Aller au contenu principal
Planification de la prochaine vue optimale avec prise en compte de l'incertitude de mouvement pour la reconstruction d'objets mobiles
RecherchearXiv cs.RO 

Planification de la prochaine vue optimale avec prise en compte de l'incertitude de mouvement pour la reconstruction d'objets mobiles

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent dans un preprint arXiv (2605.17593) un cadre de planification baptisé "motion-uncertainty-aware next-best-view" (NBV), destiné à reconstruire en 3D des objets rigides en mouvement planaire avec un robot mobile équipé d'un capteur de profondeur. Le problème central est le délai entre la sélection d'un viewpoint et son exécution : au moment où le robot atteint la position choisie, l'objet a déjà bougé, rendant caduc tout plan basé sur une pose prédite unique. Pour y répondre, chaque viewpoint candidat est évalué non pas sur une position fixe, mais sur l'ensemble des états futurs plausibles de l'objet, modélisés par un lisseur à processus gaussien à fenêtre glissante (fixed-lag Gaussian Process smoother) alimenté par des mesures de position bruitées. Les expériences, menées en simulation et en conditions réelles, montrent une complétude de reconstruction supérieure à celle des planificateurs NBV non-prédictifs et des méthodes de tracking-seul.

Ce résultat comble un angle mort documenté de la robotique perceptive : les planificateurs NBV classiques optimisent la couverture de surface en supposant des objets statiques, tandis que les méthodes de perception active orientées mouvement favorisent le suivi au détriment de la qualité de reconstruction. La combinaison des deux dans un seul cadre probabiliste est directement applicable à l'inspection automatisée de pièces sur convoyeur, au contrôle qualité en ligne ou à la génération de jumeaux numériques en environnement dynamique. Traiter le futur comme une distribution d'états plutôt qu'une estimation ponctuelle améliore la robustesse aux perturbations capteurs et aux variations de dynamique que les approches déterministes ne gèrent pas.

La planification NBV est un problème actif depuis les années 1990 en robotique perceptive, mais son extension aux objets en mouvement reste peu traitée dans la littérature. L'usage de processus gaussiens pour la prédiction de trajectoire est éprouvé dans d'autres domaines, rarement couplé jusqu'ici à des scores de couverture de surface en contexte NBV. Il s'agit d'un preprint sans évaluation par les pairs à ce stade, sans partenaire industriel ni déploiement annoncé. Les métriques de complétude avancées restent à confirmer sur des dynamiques plus complexes : les expériences actuelles se limitent au mouvement planaire et aux objets rigides. Les extensions naturelles incluent le mouvement 3D non-planaire, les objets déformables et les configurations multi-cibles. Aucun acteur français ou européen n'est impliqué dans cette publication.

Dans nos dossiers

À lire aussi

MIGU : ancrage d'instructions multimodales en contexte incertain pour la planification de manipulation
1arXiv cs.RO 

MIGU : ancrage d'instructions multimodales en contexte incertain pour la planification de manipulation

L'équipe de recherche à l'origine de MIGU (Multimodal Instruction Grounding under Uncertainty) a publié sur arXiv, sous la référence 2609.24995, une nouvelle soumission datée du 22 septembre 2026, un framework destiné à interpréter des instructions humaines combinant langage et gestes pour la manipulation robotique. Le système construit une vraisemblance géométrique en 3D en propageant l'incertitude de direction du regard et de profondeur à travers la géométrie œil-doigt, en tenant compte de l'erreur d'estimation de la direction de la main. En parallèle, un modèle vision-langage (VLM) fournit des a priori sémantiques sur les objets et régions candidats. Ces deux sources sont fusionnées par une approche inspirée de l'inférence bayésienne pour produire une croyance unifiée de désignation. Cette croyance alimente un planificateur de comportement qui décide soit de passer directement à la planification d'action, soit de demander une clarification si l'ambiguïté reste trop forte. Les cibles ainsi désignées définissent les objectifs pour la manipulation mobile et pour la planification tâche-et-mouvement sur table. Sur un benchmark réel, MIGU dépasse toutes les méthodes de référence testées, et les études d'ablation confirment l'apport de la modélisation explicite de l'incertitude multimodale. Le projet est documenté sur multimodal-instruction.github.io. L'enjeu dépasse l'exercice académique: dans un entrepôt, un domicile ou un établissement de soin, une instruction vague accompagnée d'un geste imprécis reste une source majeure d'échec pour un bras ou un robot mobile chargé de manipulation. La plupart des systèmes de désignation fondés sur des VLM ou des architectures VLA traitent le langage ou le geste isolément, ou supposent un signal propre et non ambigu. L'apport de MIGU est de quantifier explicitement l'incertitude de chaque canal et de prévoir une option de clarification plutôt que de forcer une décision hasardeuse, ce qui réduit le risque de saisir le mauvais objet, un défaut coûteux en conditions réelles pour les intégrateurs. La validation sur un benchmark physique, et non en simulation seule, distingue ce travail des démonstrations vidéo sélectives fréquentes dans le secteur. Le travail s'inscrit dans une recherche plus large sur la fiabilité des interfaces homme-robot fondées sur des modèles de fondation multimodaux, alors que des architectures VLA comme GR00T N2, Pi-0 ou Helix se généralisent pour piloter manipulateurs et humanoïdes. Contrairement à un produit commercial, MIGU reste à ce stade une contribution de recherche en prépublication, sans acteur industriel ni calendrier de déploiement annoncés dans l'article. Les suites évoquées portent sur l'intégration de cette brique de désignation dans des chaînes complètes de manipulation mobile et de planification tâche-et-mouvement, sans détail chiffré sur un passage à l'échelle.

RecherchePaper
1 source
Primitives de mouvement à reconfiguration complète : planification constructive pour robots modulaires plans déformables
2arXiv cs.RO 

Primitives de mouvement à reconfiguration complète : planification constructive pour robots modulaires plans déformables

Une équipe de chercheurs publie sur arXiv (arXiv:2608.17324v1) une méthode de planification de reconfiguration pour robots modulaires plans déformables. Le papier introduit une abstraction en cellules carrées qui projette des modules losangiques à géométrie continûment déformable sur une grille fixe, via deux mouvements élémentaires: le pivotement et le cisaillement. Les auteurs démontrent que toute configuration connectée non rectiligne d'au moins 7 modules (N≥7) peut être ramenée à une forme canonique "en escalier" par ces seuls mouvements admissibles et réversibles, ce qui rend deux configurations quelconques mutuellement atteignables. La preuve constructive fournit directement un planificateur qui déplace les modules de bordure amovibles en préservant la connectivité à chaque étape. Un sélecteur à anticipation "bordure-vers-livraison" réduit fortement le temps de calcul sans affecter la garantie de complétude, selon les expériences rapportées. Ce résultat s'attaque à un problème resté largement ouvert en robotique modulaire auto-reconfigurable: garantir formellement qu'un planificateur relie toujours deux arrangements quelconques, pas seulement des cas favorables observés en simulation. Pour la matière programmable et les systèmes métamorphiques envisagés pour l'assemblage spatial, l'outillage adaptatif ou la recherche-sauvetage, une preuve de complétude compte plus que la vitesse brute: un échec de planification signifie un système physiquement bloqué. Le papier montre qu'une abstraction géométrique couplée à une démonstration formelle, plutôt qu'une recherche par force brute ou de l'apprentissage, peut apporter à la fois garantie théorique et gain pratique de vitesse. Limite à noter: la garantie ne vaut que pour des configurations non rectilignes d'au moins sept modules, ce qui exclut certains cas limites du champ de la preuve. La robotique modulaire auto-reconfigurable remonte à des systèmes comme PolyBot ou M-Blocks du MIT, et aux robots modulaires en treillis étudiés depuis les années 1990-2000; le champ peine à établir des garanties formelles de complétude pour des modules plans déformables, plus difficiles à discrétiser que des modules cubiques rigides, un défi que ce travail relève spécifiquement pour des modules losangiques à déformation continue. La comparaison à un "cadre antérieur" évoquée par les auteurs n'identifie pas nommément le concurrent, ce qui limite la portée du positionnement compétitif annoncé. Le papier reste, à ce stade, une contribution théorique validée par simulation, sans déploiement sur matériel réel; l'extension à des configurations tridimensionnelles et une validation sur robot physique apparaissent comme les suites naturelles, mais aucune feuille de route ni date n'est communiquée.

RecherchePaper
1 source
Calibration optimale tenant compte de l'incertitude pour le problème AX=YB
3arXiv cs.RO 

Calibration optimale tenant compte de l'incertitude pour le problème AX=YB

Une équipe de chercheurs a publié le 7 mai 2026 sur arXiv (identifiant 2605.04809) une méthode d'optimisation pour la calibration main-oeil, problème dit AX=YB, qui consiste à déterminer la transformation géométrique rigide entre un capteur (caméra ou lidar) et l'effecteur d'un robot. L'algorithme proposé est itératif, formulé en algèbre de Lie, et respecte strictement les contraintes structurelles du groupe SE(3) tout en synchronisant les mises à jour des paramètres de calibration. Plutôt que de modéliser explicitement l'incertitude des données, approche jugée trop difficile à généraliser, les auteurs introduisent une métrique d'incertitude relative entre sources de mesure, utilisée pour pondérer dynamiquement chaque observation pendant l'optimisation. Sur jeux de données synthétiques à forte incertitude, la méthode améliore la précision d'estimation d'au moins 67 % par rapport aux approches existantes, selon des simulations numériques et des expériences réelles présentées dans l'article. L'enjeu industriel est concret : la calibration main-oeil conditionne toute application robotique guidée par vision, qu'il s'agisse de soudure, d'assemblage, de palettisation ou de contrôle qualité. Dans les scénarios à grande plage de travail ou en surcharge mécanique, typiques des robots 6-DOF à payload supérieur à 50 kg, les données de calibration sont contaminées par des incertitudes difficiles à quantifier : flexions structurelles, jeux mécaniques, dérive thermique. Les méthodes classiques comme Tsai-Lenz ou Shah traitent ces perturbations de façon uniforme, sans pondération adaptative. L'approche proposée ajuste au contraire l'influence de chaque paire de mesures pendant l'optimisation, ce qui peut réduire les temps de recalibration en production et améliorer la répétabilité sur cellules robotisées existantes sans changer de matériel. Le problème AX=YB est étudié en robotique depuis les travaux fondateurs de Shiu et Ahmad (1987) et Tsai et Lenz (1989). Les approches concurrentes exploitent les quaternions duaux (Daniilidis, 1999), les décompositions de Kronecker, ou plus récemment l'apprentissage automatique avec données visuelles denses. L'article positionne son apport principal sur deux points de friction récurrents dans les déploiements réels : la qualité de l'initialisation et la robustesse aux incertitudes non modélisées. Aucun code source ni partenaire industriel ne sont mentionnés dans le préprint disponible. Une intégration dans des frameworks de calibration open-source comme Kalibr ou easy_handeye constituerait la prochaine étape naturelle vers une adoption pratique.

UELes intégrateurs robotiques européens déployant des cellules 6-DOF à forte charge (KUKA, ABB) pourraient bénéficier d'une meilleure répétabilité de calibration sans changement matériel, sous réserve d'une publication du code dans des frameworks open-source comme Kalibr ou easy_handeye.

RecherchePaper
1 source
Recherche, ancrage, planification : suffisance fonctionnelle pour la planification tâche-mouvement avec connaissance incomplète de la scène
4arXiv cs.RO 

Recherche, ancrage, planification : suffisance fonctionnelle pour la planification tâche-mouvement avec connaissance incomplète de la scène

GRAB-TAMP est un framework de planification de tâches et de mouvements (TAMP) piloté par des foundation models, capable de traiter des instructions en langage naturel et des observations visuelles. Publié sur arXiv le 22 septembre 2026 sous la référence 2609.23113, avec un code disponible sur GitHub (dépôt Narendhiranv04/GRAB-TAMP), le système recherche dans la scène les entités nécessaires à la tâche, ancre chaque rôle fonctionnel requis à un objet physique valide via des contrôles sémantiques, géométriques et relationnels, puis ne déclenche la planification qu'une fois obtenue une affectation complète établissant ce que les auteurs nomment la "suffisance fonctionnelle". Testé sur 32 variantes de scènes réparties en trois domaines simulés, cuisine, salon et atelier, et sur 200 essais jugés faisables, le système atteint 54,0% de réussite de bout en bout et 67,3% de couverture des objectifs de plan, soit 25,7 points de pourcentage de mieux que la moyenne de trois autres frameworks TAMP concurrents testés dans les mêmes conditions d'exécution. L'enjeu visé est un angle mort connu des pipelines TAMP pilotés par foundation models: comprendre une instruction en langage ne garantit pas que la scène observée contienne réellement de quoi la réaliser, et la plupart des architectures existantes supposent à tort une connaissance complète de la scène, produisant des plans irréalisables dès que la perception est partielle, un cas fréquent hors laboratoire. En conditionnant la planification à cette vérification préalable, GRAB-TAMP réduit ce risque et améliore nettement le taux de réussite face à des baselines comparables. Un score de 54% en environnement simulé, même en net progrès, montre toutefois que le problème de la connaissance incomplète de la scène reste loin d'être résolu à l'échelle, un repère utile pour les intégrateurs qui évaluent des piles VLA ou des agents de planification fondés sur des LLM avant un déploiement réel plutôt qu'en démonstration contrôlée. GRAB-TAMP prolonge le TAMP classique, historiquement fondé sur une modélisation symbolique complète de l'environnement, vers des tâches spécifiées par le langage et la vision grâce aux foundation models. L'abstract ne précise ni l'affiliation des auteurs ni les noms des trois frameworks concurrents servant de référence, mais fixe une comparaison à conditions d'exécution identiques, ce qui rend les écarts de performance directement lisibles. Aucun déploiement sur robot physique n'est mentionné: les résultats proviennent uniquement de scènes simulées, sans partenariat industriel ni pilote annoncé à ce stade. La suite passe par la publication du code, ouvrant la voie à une réplication indépendante et à une extension éventuelle vers des scènes ou des robots réels.

RecherchePaper
1 source