Aller au contenu principal
Planification de la manipulation pour des activités de construction répétitives
RecherchearXiv cs.RO 

Planification de la manipulation pour des activités de construction répétitives

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a publié mi-mai 2026 sur arXiv un framework de planification de manipulation robotique destiné aux tâches de construction répétitives, comme la pose de briques ou l'installation de dalles de plafond. L'approche repose sur un environnement de démonstration en réalité virtuelle (VR) : un opérateur humain réalise une seule démonstration du geste à apprendre, que le système capture puis décompose en une séquence de mouvements à vis constants (screw motions) via la géométrie des vis. À partir de cette représentation, deux algorithmes, la Screw Linear Interpolation (ScLERP) et le Resolved Motion Rate Control (RMRC), génèrent automatiquement les plans de mouvement articulaire pour chaque instance répétée de la tâche. Les expériences ont été conduites sur un bras à 7 degrés de liberté (7-DoF), d'abord en simulation puis sur robot physique, avec deux scénarios concrets : construction de murs de briques en configurations arbitraires et pose de multiples dalles de plafond, chacun déclenché depuis une unique démonstration.

Le résultat le plus significatif est la généralisation one-shot à des séquences de longueur arbitraire, un mur peut contenir autant de briques que nécessaire sans nouvelle démonstration. C'est un point directement pertinent pour les intégrateurs industriels : en construction, la variabilité de l'environnement (dimensions de chantier, positions relatives des éléments) est précisément ce qui freine le déploiement des robots. Ici, la représentation par vis capture la structure géométrique du mouvement de façon compacte, ce qui permet une extrapolation robuste plutôt qu'une simple répétition mémorisée. La validation hardware réduit partiellement le sim-to-real gap souvent invoqué pour relativiser les démonstrations purement simulées, bien que les conditions expérimentales (charge utile, tolérance dimensionnelle, matériaux réels) ne soient pas précisément détaillées dans le préprint.

La robotique de construction est un secteur en accélération : Hilti, Hadrian X (Fastbrick Robotics), ou encore Dusty Robotics adressent des tâches spécifiques de chantier, mais la plupart restent sur des pipelines hautement programmés et peu flexibles. L'approche par démonstration VR + géométrie des vis s'inscrit dans un courant plus large de Learning from Demonstration (LfD) qui tente de réduire le coût d'intégration sur des tâches manuelles qualifiées. La prochaine étape naturelle serait de tester la robustesse face aux perturbations réelles du chantier (vibrations, tolérances matériaux, occlusions) et d'étendre à des tâches multi-bras ou à manipulation bimane, deux lacunes que le papier ne couvre pas encore.

À lire aussi

Planification de séquences de compétences pour la construction collaborative multi-robots
1arXiv cs.RO 

Planification de séquences de compétences pour la construction collaborative multi-robots

Une équipe de recherche publie sur arXiv (référence 2609.25649, soumis fin septembre 2026) une méthode de planification de séquences de compétences destinée à des équipes hétérogènes de robots multifonctions collaborant sur des tâches d'assemblage en construction. Le système s'appuie sur des compétences préprogrammées et réutilisables telles que la préhension, le perçage et le vissage. Un contrôleur central convertit la représentation numérique du bâtiment en un graphe de relations de construction, qui modélise les entités du chantier, leurs états et leurs liens hiérarchiques parent-enfant. À partir de cette représentation, le système sélectionne la prochaine cible de construction, génère une séquence symbolique de compétences pour les robots de l'équipe capables de les exécuter, puis produit des plans de mouvement géométriques sans collision pour chaque compétence. Le problème de planification symbolique est régénéré dynamiquement à chaque évolution de l'état du chantier, et un jumeau numérique interactif présente la séquence planifiée et l'état des robots à des opérateurs humains pour validation avant exécution. La méthode a été évaluée sur une étude de cas d'assemblage de construction, sans chiffres de charge utile, degrés de liberté ou temps de cycle communiqués dans le résumé du papier. L'intérêt principal de ces travaux tient à la réduction de l'effort de reprogrammation robot par robot et tâche par tâche, identifié comme le principal frein à l'adoption des robots dans le secteur du bâtiment. En automatisant la génération de séquences à partir d'un modèle numérique du bâtiment plutôt que d'une programmation manuelle spécifique à chaque variation de tâche, l'approche vise une flexibilité de déploiement accrue pour des équipes de robots collaboratifs sur chantier, un enjeu direct pour les intégrateurs et décideurs industriels confrontés à la diversité des configurations de construction. Le papier s'inscrit dans la lignée des travaux sur l'automatisation de la construction et la planification multi-robots, où la validation humaine via jumeau numérique reste un garde-fou courant avant exécution physique. Aucun acteur commercial, franco-européen ou autre, n'est mentionné dans cette publication académique, et le texte ne précise pas de suites opérationnelles ou de pilotes industriels annoncés au-delà de l'étude de cas décrite.

RecherchePaper
1 source
MIGU : ancrage d'instructions multimodales en contexte incertain pour la planification de manipulation
2arXiv cs.RO 

MIGU : ancrage d'instructions multimodales en contexte incertain pour la planification de manipulation

L'équipe de recherche à l'origine de MIGU (Multimodal Instruction Grounding under Uncertainty) a publié sur arXiv, sous la référence 2609.24995, une nouvelle soumission datée du 22 septembre 2026, un framework destiné à interpréter des instructions humaines combinant langage et gestes pour la manipulation robotique. Le système construit une vraisemblance géométrique en 3D en propageant l'incertitude de direction du regard et de profondeur à travers la géométrie œil-doigt, en tenant compte de l'erreur d'estimation de la direction de la main. En parallèle, un modèle vision-langage (VLM) fournit des a priori sémantiques sur les objets et régions candidats. Ces deux sources sont fusionnées par une approche inspirée de l'inférence bayésienne pour produire une croyance unifiée de désignation. Cette croyance alimente un planificateur de comportement qui décide soit de passer directement à la planification d'action, soit de demander une clarification si l'ambiguïté reste trop forte. Les cibles ainsi désignées définissent les objectifs pour la manipulation mobile et pour la planification tâche-et-mouvement sur table. Sur un benchmark réel, MIGU dépasse toutes les méthodes de référence testées, et les études d'ablation confirment l'apport de la modélisation explicite de l'incertitude multimodale. Le projet est documenté sur multimodal-instruction.github.io. L'enjeu dépasse l'exercice académique: dans un entrepôt, un domicile ou un établissement de soin, une instruction vague accompagnée d'un geste imprécis reste une source majeure d'échec pour un bras ou un robot mobile chargé de manipulation. La plupart des systèmes de désignation fondés sur des VLM ou des architectures VLA traitent le langage ou le geste isolément, ou supposent un signal propre et non ambigu. L'apport de MIGU est de quantifier explicitement l'incertitude de chaque canal et de prévoir une option de clarification plutôt que de forcer une décision hasardeuse, ce qui réduit le risque de saisir le mauvais objet, un défaut coûteux en conditions réelles pour les intégrateurs. La validation sur un benchmark physique, et non en simulation seule, distingue ce travail des démonstrations vidéo sélectives fréquentes dans le secteur. Le travail s'inscrit dans une recherche plus large sur la fiabilité des interfaces homme-robot fondées sur des modèles de fondation multimodaux, alors que des architectures VLA comme GR00T N2, Pi-0 ou Helix se généralisent pour piloter manipulateurs et humanoïdes. Contrairement à un produit commercial, MIGU reste à ce stade une contribution de recherche en prépublication, sans acteur industriel ni calendrier de déploiement annoncés dans l'article. Les suites évoquées portent sur l'intégration de cette brique de désignation dans des chaînes complètes de manipulation mobile et de planification tâche-et-mouvement, sans détail chiffré sur un passage à l'échelle.

RecherchePaper
1 source
COMPASS : planification de la manipulation en espace confiné par perception active
3arXiv cs.RO 

COMPASS : planification de la manipulation en espace confiné par perception active

Des chercheurs ont publié COMPASS (Confined-space Manipulation Planning with Active Sensing Strategy), un framework multi-étapes destiné à résoudre la manipulation robotique en environnements confinés et encombrés. La méthode repose sur trois composants enchaînés : un scan de proximité dit "near-field awareness" qui construit une carte locale de collision avant tout mouvement, une fonction d'utilité multi-objectifs qui sélectionne des points de vue à la fois informatifs et compatibles avec les poses de saisie ultérieures, et un optimiseur de manipulation contraint qui génère des configurations de préhension respectant les obstacles détectés. Les auteurs proposent également un benchmark structuré en quatre niveaux de difficulté croissante pour évaluer les méthodes d'exploration et de manipulation en espace restreint. En simulation, COMPASS affiche un gain de 24,25 points de pourcentage sur le taux de succès de manipulation par rapport aux méthodes d'exploration conçues pour d'autres types de robots ou n'optimisant que le gain d'information. Des expériences en conditions réelles confirment la faisabilité de l'approche. Ce résultat est significatif parce qu'il adresse directement l'un des angles morts du champ NBV (Next Best View) : les stratégies d'exploration existantes maximisent la couverture informationnelle sans tenir compte de la faisabilité de la manipulation qui suit. En couplant explicitement exploration et planification de saisie dans une même fonction d'utilité, COMPASS réduit l'écart entre "voir la scène" et "agir dessus". Pour un intégrateur industriel, cela signifie une réduction du nombre de cycles d'observation improductifs avant une prise, ce qui devient critique dans des applications comme la désassembly, le picking en bacs profonds, ou la maintenance en espaces contraints. La validation sim-to-real, même partielle, réduit le scepticisme habituel sur le transfert des méthodes d'exploration en laboratoire vers des contextes terrain. Le problème de la manipulation en espace confiné est étudié depuis plusieurs années dans la communauté planification-perception, mais reste ouvert faute de benchmarks standardisés et de méthodes intégrant les deux dimensions simultanément. COMPASS s'inscrit dans un mouvement plus large qui voit des frameworks comme Active Neural Mapping ou des planificateurs basés sur l'échantillonnage (RRT, STOMP) être revisités pour intégrer des contraintes de manipulation dès la phase d'exploration. Aucune entreprise n'est associée à cette publication académique (arXiv:2509.14787), et aucune timeline de commercialisation n'est mentionnée. Les prochaines étapes naturelles seraient d'étendre le benchmark à des objets déformables ou à des scènes dynamiques, et de tester la robustesse face à des capteurs de profondeur bruités, condition sine qua non pour un déploiement industriel.

RecherchePaper
1 source
RoboEvolve : co-évolution planificateur-simulateur pour la manipulation robotique avec peu de données
4arXiv cs.RO 

RoboEvolve : co-évolution planificateur-simulateur pour la manipulation robotique avec peu de données

RoboEvolve est un framework de recherche publié en preprint arXiv (réf. 2605.13775, mai 2025) dont l'objectif est de résoudre la rareté des données d'interaction physique alignées sur les tâches de manipulation robotique. Le système couple un planificateur basé sur un modèle vision-langage (VLM) et un simulateur basé sur un modèle de génération vidéo (VGM) dans une boucle co-évolutive auto-renforçante, opérant à partir de seulement 500 images non annotées, soit une réduction de 50x par rapport aux baselines entièrement supervisées. Le mécanisme alterne une phase d'exploration diurne, qui génère des trajectoires ancrées physiquement via une récompense multi-granulaire à contrôle sémantique, et une phase de consolidation nocturne, qui exploite les échecs "near-miss" pour stabiliser l'optimisation de politique. Les résultats publiés indiquent une amélioration de 30 points absolus sur les planificateurs de base, une hausse de 48 % du taux de succès des simulateurs, et un apprentissage continu robuste sans oubli catastrophique. Ces chiffres adressent directement le principal verrou économique des pipelines de manipulation à grande échelle : la collecte de données téléopérées, qui freine aujourd'hui des systèmes commerciaux comme Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI). La co-évolution VLM-VGM contourne deux limitations bien documentées : les VLM seuls souffrent d'un désalignement sémantique-spatial (compréhension correcte de la tâche mais imprécision dans le positionnement 3D), tandis que les VGM seuls produisent des hallucinations physiques (vidéos synthétiques qui violent les contraintes physiques réelles). Un curriculum progressif automatique fait évoluer le système d'actions atomiques simples vers des tâches composites complexes, approche concrète au problème de généralisation hiérarchique encore non résolu à l'échelle commerciale. Ce travail s'inscrit dans une tendance émergente visant à substituer la génération synthétique de données à la collecte terrain coûteuse, tendance accélérée depuis Diffusion Policy (2023) et l'essor des modèles VLA (vision-language-action). Le résumé disponible ne précise ni affiliation institutionnelle des auteurs ni plateforme matérielle de validation, une limite importante avant tout transfert industriel. Aucun déploiement physique ni partenariat constructeur n'est annoncé : RoboEvolve reste à ce stade une contribution académique dont la transposition sim-to-real sur hardware réel reste entièrement à démontrer.

RechercheOpinion
1 source