Aller au contenu principal
RecherchearXiv cs.RO 

Une taxonomie des activités de tâches de construction pour les robots ouvriers

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié sur arXiv (2608.25395v1, août 2026) présente TARCAT, une taxonomie des tâches de construction destinée aux robots ouvriers, développée par un groupe associé au laboratoire AICPS. Le système s'appuie sur 91 tâches issues de la base O*NET, couvrant sept métiers du bâtiment à forte employabilité, ainsi que sur l'analyse de 30 vidéos pédagogiques de travail physique. TARCAT décompose ce corpus en 41 primitives d'action, regroupées en 12 catégories et trois classes, avec un mécanisme pour combiner ces primitives paramétrées en séquences réutilisables appelées compétences. Une partie de ces primitives a été testée sur un bras robotique DOBOT CR3 équipé d'une main CRAFT. Les annotations complètes sont publiées en accès libre sur GitHub, dans le dépôt AICPS/TARCAT-Taxonomy.

Cette taxonomie répond à un problème concret pour les intégrateurs et chercheurs en robotique générale : les modèles vision-langage-action promettent des robots au répertoire plus large que les systèmes spécialisés, mais leur déploiement sur chantier exige un inventaire précis des gestes et des capacités nécessaires, ce qui manquait dans le secteur de la construction. En offrant un vocabulaire commun et lisible par des humains, TARCAT peut organiser des démonstrations d'apprentissage, spécifier les exigences matérielles d'un robot, et alimenter des agents de codage capables de retrouver et d'étendre des bibliothèques de compétences. À noter : seule une sélection restreinte de primitives a été validée physiquement sur un unique bras, loin d'une démonstration de système complet opérant sur un vrai chantier.

Ce travail s'inscrit dans le mouvement plus large de la robotique embarquée, où les modèles VLA cherchent à s'affranchir des systèmes dédiés tâche par tâche, un axe poussé par plusieurs laboratoires et fabricants de robots manipulateurs ou humanoïdes. Contrairement aux annonces produits qui multiplient des démonstrations spectaculaires sans cadre d'évaluation standardisé, TARCAT s'appuie sur des données d'occupation officielles et des vidéos de terrain plutôt que sur des cas choisis pour l'effet. Les auteurs présentent ce travail comme une fondation destinée à être étendue : le dépôt GitHub public ouvre la porte à des contributions externes et à une adoption par d'autres équipes travaillant sur la robotique générale appliquée au bâtiment, un secteur où peu de standards communs existaient jusqu'ici pour décrire précisément le travail humain à automatiser.

À lire aussi

Planification de la manipulation pour des activités de construction répétitives
1arXiv cs.RO 

Planification de la manipulation pour des activités de construction répétitives

Une équipe de chercheurs a publié mi-mai 2026 sur arXiv un framework de planification de manipulation robotique destiné aux tâches de construction répétitives, comme la pose de briques ou l'installation de dalles de plafond. L'approche repose sur un environnement de démonstration en réalité virtuelle (VR) : un opérateur humain réalise une seule démonstration du geste à apprendre, que le système capture puis décompose en une séquence de mouvements à vis constants (screw motions) via la géométrie des vis. À partir de cette représentation, deux algorithmes, la Screw Linear Interpolation (ScLERP) et le Resolved Motion Rate Control (RMRC), génèrent automatiquement les plans de mouvement articulaire pour chaque instance répétée de la tâche. Les expériences ont été conduites sur un bras à 7 degrés de liberté (7-DoF), d'abord en simulation puis sur robot physique, avec deux scénarios concrets : construction de murs de briques en configurations arbitraires et pose de multiples dalles de plafond, chacun déclenché depuis une unique démonstration. Le résultat le plus significatif est la généralisation one-shot à des séquences de longueur arbitraire, un mur peut contenir autant de briques que nécessaire sans nouvelle démonstration. C'est un point directement pertinent pour les intégrateurs industriels : en construction, la variabilité de l'environnement (dimensions de chantier, positions relatives des éléments) est précisément ce qui freine le déploiement des robots. Ici, la représentation par vis capture la structure géométrique du mouvement de façon compacte, ce qui permet une extrapolation robuste plutôt qu'une simple répétition mémorisée. La validation hardware réduit partiellement le sim-to-real gap souvent invoqué pour relativiser les démonstrations purement simulées, bien que les conditions expérimentales (charge utile, tolérance dimensionnelle, matériaux réels) ne soient pas précisément détaillées dans le préprint. La robotique de construction est un secteur en accélération : Hilti, Hadrian X (Fastbrick Robotics), ou encore Dusty Robotics adressent des tâches spécifiques de chantier, mais la plupart restent sur des pipelines hautement programmés et peu flexibles. L'approche par démonstration VR + géométrie des vis s'inscrit dans un courant plus large de Learning from Demonstration (LfD) qui tente de réduire le coût d'intégration sur des tâches manuelles qualifiées. La prochaine étape naturelle serait de tester la robustesse face aux perturbations réelles du chantier (vibrations, tolérances matériaux, occlusions) et d'étendre à des tâches multi-bras ou à manipulation bimane, deux lacunes que le papier ne couvre pas encore.

RecherchePaper
1 source
IA incarnée : perception et action pour l'exécution de tâches par un robot humanoïde en construction
2arXiv cs.RO 

IA incarnée : perception et action pour l'exécution de tâches par un robot humanoïde en construction

Des chercheurs publient sur arXiv (référence 2608.01600v1, soumis début août 2026) un système de perception et d'action destiné aux robots humanoïdes pour l'exécution de tâches de construction. L'architecture combine deux réseaux de neurones profonds : Humanoid-PoseNet, qui capture les postures d'un ouvrier lors d'une démonstration et les traduit en poses mécaniquement réalisables pour un robot humanoïde, puis Humanoid-ActionNet, qui apprend à partir de ces poses traduites les actions que le robot peut réellement exécuter. Testé sur huit tâches liées au chantier, le système atteint une erreur moyenne de suivi de mouvement de 82,45 mm en MPJPE (Mean Per Joint Position Error, l'écart moyen par articulation entre le geste de référence et celui reproduit par le robot). L'abstract ne cite aucun modèle de robot précis, aucun site de déploiement ni partenaire industriel : il s'agit d'un travail de recherche méthodologique et non d'un produit commercialisé. L'enjeu porte sur un goulot d'étranglement bien identifié de l'apprentissage par démonstration chez les humanoïdes : la différence de morphologie et de degrés de liberté (DOF) entre un corps humain et un robot rend la traduction directe des mouvements captés souvent instable ou irréalisable mécaniquement. En séparant explicitement l'étape de retargeting des poses (PoseNet) de l'apprentissage de l'action (ActionNet), l'étude propose une réponse ciblée à ce problème, potentiellement transposable à d'autres tâches physiques répétitives et dangereuses en environnement non structuré, un terrain bien plus exigeant pour un humanoïde que l'entrepôt logistique. Le chiffre de 82,45 mm reste toutefois difficile à juger sans point de comparaison ni contexte sur la difficulté relative des huit tâches testées. Le secteur de la construction, confronté à une pénurie de main-d'œuvre et à des tâches physiquement éprouvantes, est régulièrement cité comme débouché naturel pour les humanoïdes, aux côtés des usines et entrepôts déjà ciblés par Figure, Agility Robotics ou Unitree. Ce travail se positionne en amont de tout déploiement commercial : les auteurs le présentent eux-mêmes comme une « étape précoce » vers des collaborateurs humanoïdes de chantier, sans calendrier de pilotes ni annonce industrielle à ce stade.

RecherchePaper
1 source
Tripody : un robot parallèle surcontraint de type 3-SPR pour les tâches de construction en hauteur
3arXiv cs.RO 

Tripody : un robot parallèle surcontraint de type 3-SPR pour les tâches de construction en hauteur

Tripody, un robot parallèle sur roues à 3 degrés de liberté conçu pour les travaux de construction en hauteur, notamment le perçage de plafonds, a été présenté par une équipe de recherche dans une publication arXiv (2607.25781, juillet 2026). Pesant 33 kg, l'engin s'étend de 1,7 m à 3,4 m de hauteur et supporte une charge continue de 32 kg via une interface d'effecteur modulaire. Sa cinématique reprend l'architecture classique 3-SPR (trois jambes, joint sphérique à la base, articulation prismatique actionnée, joint de rotation à l'effecteur), mais remplace les joints sphériques par des joints universels, ce qui surcontraint volontairement le mécanisme ; de petites déflexions élastiques réparties absorbent les incompatibilités cinématiques résultantes tout en préservant un mouvement essentiellement translationnel. Les essais montrent une rigidité en plan comparable à celle d'une variante à base sphérique, mais une rigidité en torsion nettement supérieure : +67% à 1,7 m, +196% à 2,6 m et +454% à 3,4 m, avec un couplage inter-axes négligeable. Le positionnement en boucle fermée, mesuré par station totale, converge sous 0,6 mm sur tout l'espace de travail, tandis que la simple extrapolation par modèle atteint une erreur au 95e centile de 2,7 mm (maximum 3,6 mm). Une démonstration de perçage de plafond en boucle ouverte, avec un motif de 15 trous, affiche une erreur de position relative maximale de 4,5 mm après alignement rigide. Ces résultats s'adressent directement à un problème concret du secteur de la construction : les manipulateurs sériels lourds actuellement utilisés pour les travaux en hauteur sont difficiles à déployer dans des intérieurs encombrés, faute de compacité et de mobilité. En misant sur une architecture surcontrainte qui tolère la compliance plutôt que de la combattre, les auteurs proposent une voie pratique vers des robots légers, à grande portée verticale et à précision millimétrique, un compromis rarement atteint simultanément par les solutions existantes. Pour les intégrateurs et décideurs du BTP, l'intérêt tient moins à la performance brute qu'à la validation en conditions quasi réelles : le perçage de 15 trous avec une précision de l'ordre de quelques millimètres démontre une faisabilité tâche par tâche, au-delà d'une simple preuve de concept en laboratoire. Le papier reste toutefois prudent : il s'agit d'une étude en boucle ouverte sur un motif limité, pas d'un déploiement chantier. L'approche s'inscrit dans une lignée de recherches en robotique parallèle explorant les architectures 3-SPR pour des tâches nécessitant rigidité et précision sur de grands espaces de travail, un terrain habituellement dominé par les bras sériels ou les portiques fixes. En intégrant des actionneurs linéaires sur mesure et une pile de contrôle combinant estimation d'état SE(3), cinématique directe et commande dans l'espace des tâches, les auteurs positionnent Tripody comme une alternative mobile et reconfigurable aux solutions de perçage plafond existantes, qu'elles soient manuelles ou robotisées de type portique. Les prochaines étapes attendues, non détaillées dans l'abstract, porteraient logiquement sur un contrôle en boucle fermée pour la tâche de perçage elle-même et sur des essais en environnement de chantier réel plutôt qu'en conditions contrôlées de laboratoire.

RecherchePaper
1 source
IA physique : des modèles du monde aux modèles d'action, un tutoriel concis pour la robotique
4arXiv cs.RO 

IA physique : des modèles du monde aux modèles d'action, un tutoriel concis pour la robotique

Un article publié sur arXiv (2607.00836) dresse un état des lieux conceptuel des "world models" utilisés en robotique et en simulation générative, un terme dont le périmètre varie fortement selon les communautés de recherche. Les auteurs proposent une définition unifiée : un modèle du monde est un système conditionné par l'action qui prédit l'évolution future des observations ou des états pertinents pour une tâche donnée. Ils distinguent deux grandes familles : les modèles dans l'espace des observations, qui prédisent des images ou vidéos brutes, et les modèles dans l'espace des états, qui travaillent sur des représentations compactes. Chaque approche est comparée selon quatre critères : fidélité visuelle, structuration spatiale, interprétabilité physique et facilité d'usage pour le contrôle. Le papier introduit ensuite les "world action models", qui relient ces prédictions du futur à des actions robotiques exécutables, avec quatre paradigmes identifiés : imaginer puis exécuter, prédiction d'action conditionnée par des features vidéo, modélisation conjointe vidéo-action, et prédiction vidéo auxiliaire pour l'apprentissage de politiques. Cette clarification terminologique a une portée pratique pour les équipes qui développent des politiques robotiques : elle aide à choisir entre un modèle générateur de pixels, coûteux en calcul mais riche visuellement, et un modèle d'état plus léger, plus proche du contrôle temps réel mais moins interprétable. Elle formalise aussi un débat de fond du secteur : les modèles de génération vidéo produisent des démonstrations spectaculaires, mais leur utilité réelle pour piloter un bras ou un humanoïde reste à prouver, faute de garanties physiques strictes, ce qui rejoint les critiques récurrentes sur l'écart entre démo et déploiement réel. En distinguant explicitement l'approche "imaginer puis exécuter" des méthodes qui apprennent directement une politique conjointe vidéo-action, le tutoriel donne aux intégrateurs une grille de lecture pour évaluer les annonces commerciales selon ce qu'elles modélisent vraiment, plutôt que sur la seule qualité de leurs vidéos. Ce travail arrive alors que les world models occupent une place croissante dans la course aux modèles vision-langage-action, portée par des systèmes comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, qui combinent tous, à des degrés divers, prédiction du futur et génération d'actions. Sans analyser directement ces produits commerciaux, la taxonomie proposée offre un cadre académique pour resituer ces systèmes les uns par rapport aux autres, à un moment où la recherche universitaire tente de structurer conceptuellement un domaine dont la vitesse de publication industrielle a largement dépassé la théorie.

RecherchePaper
1 source