Aller au contenu principal
Une taxonomie des activités de tâches de construction pour les robots ouvriers
RecherchearXiv cs.RO 

Une taxonomie des activités de tâches de construction pour les robots ouvriers

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article publié sur arXiv (2608.25395v1, août 2026) présente TARCAT, une taxonomie des tâches de construction destinée aux robots ouvriers, développée par un groupe associé au laboratoire AICPS. Le système s'appuie sur 91 tâches issues de la base O*NET, couvrant sept métiers du bâtiment à forte employabilité, ainsi que sur l'analyse de 30 vidéos pédagogiques de travail physique. TARCAT décompose ce corpus en 41 primitives d'action, regroupées en 12 catégories et trois classes, avec un mécanisme pour combiner ces primitives paramétrées en séquences réutilisables appelées compétences. Une partie de ces primitives a été testée sur un bras robotique DOBOT CR3 équipé d'une main CRAFT. Les annotations complètes sont publiées en accès libre sur GitHub, dans le dépôt AICPS/TARCAT-Taxonomy.

Cette taxonomie répond à un problème concret pour les intégrateurs et chercheurs en robotique générale : les modèles vision-langage-action promettent des robots au répertoire plus large que les systèmes spécialisés, mais leur déploiement sur chantier exige un inventaire précis des gestes et des capacités nécessaires, ce qui manquait dans le secteur de la construction. En offrant un vocabulaire commun et lisible par des humains, TARCAT peut organiser des démonstrations d'apprentissage, spécifier les exigences matérielles d'un robot, et alimenter des agents de codage capables de retrouver et d'étendre des bibliothèques de compétences. À noter : seule une sélection restreinte de primitives a été validée physiquement sur un unique bras, loin d'une démonstration de système complet opérant sur un vrai chantier.

Ce travail s'inscrit dans le mouvement plus large de la robotique embarquée, où les modèles VLA cherchent à s'affranchir des systèmes dédiés tâche par tâche, un axe poussé par plusieurs laboratoires et fabricants de robots manipulateurs ou humanoïdes. Contrairement aux annonces produits qui multiplient des démonstrations spectaculaires sans cadre d'évaluation standardisé, TARCAT s'appuie sur des données d'occupation officielles et des vidéos de terrain plutôt que sur des cas choisis pour l'effet. Les auteurs présentent ce travail comme une fondation destinée à être étendue : le dépôt GitHub public ouvre la porte à des contributions externes et à une adoption par d'autres équipes travaillant sur la robotique générale appliquée au bâtiment, un secteur où peu de standards communs existaient jusqu'ici pour décrire précisément le travail humain à automatiser.

À lire aussi

Planification de la manipulation pour des activités de construction répétitives
1arXiv cs.RO 

Planification de la manipulation pour des activités de construction répétitives

Une équipe de chercheurs a publié mi-mai 2026 sur arXiv un framework de planification de manipulation robotique destiné aux tâches de construction répétitives, comme la pose de briques ou l'installation de dalles de plafond. L'approche repose sur un environnement de démonstration en réalité virtuelle (VR) : un opérateur humain réalise une seule démonstration du geste à apprendre, que le système capture puis décompose en une séquence de mouvements à vis constants (screw motions) via la géométrie des vis. À partir de cette représentation, deux algorithmes, la Screw Linear Interpolation (ScLERP) et le Resolved Motion Rate Control (RMRC), génèrent automatiquement les plans de mouvement articulaire pour chaque instance répétée de la tâche. Les expériences ont été conduites sur un bras à 7 degrés de liberté (7-DoF), d'abord en simulation puis sur robot physique, avec deux scénarios concrets : construction de murs de briques en configurations arbitraires et pose de multiples dalles de plafond, chacun déclenché depuis une unique démonstration. Le résultat le plus significatif est la généralisation one-shot à des séquences de longueur arbitraire, un mur peut contenir autant de briques que nécessaire sans nouvelle démonstration. C'est un point directement pertinent pour les intégrateurs industriels : en construction, la variabilité de l'environnement (dimensions de chantier, positions relatives des éléments) est précisément ce qui freine le déploiement des robots. Ici, la représentation par vis capture la structure géométrique du mouvement de façon compacte, ce qui permet une extrapolation robuste plutôt qu'une simple répétition mémorisée. La validation hardware réduit partiellement le sim-to-real gap souvent invoqué pour relativiser les démonstrations purement simulées, bien que les conditions expérimentales (charge utile, tolérance dimensionnelle, matériaux réels) ne soient pas précisément détaillées dans le préprint. La robotique de construction est un secteur en accélération : Hilti, Hadrian X (Fastbrick Robotics), ou encore Dusty Robotics adressent des tâches spécifiques de chantier, mais la plupart restent sur des pipelines hautement programmés et peu flexibles. L'approche par démonstration VR + géométrie des vis s'inscrit dans un courant plus large de Learning from Demonstration (LfD) qui tente de réduire le coût d'intégration sur des tâches manuelles qualifiées. La prochaine étape naturelle serait de tester la robustesse face aux perturbations réelles du chantier (vibrations, tolérances matériaux, occlusions) et d'étendre à des tâches multi-bras ou à manipulation bimane, deux lacunes que le papier ne couvre pas encore.

RecherchePaper
1 source
IA incarnée : perception et action pour l'exécution de tâches par un robot humanoïde en construction
2arXiv cs.RO 

IA incarnée : perception et action pour l'exécution de tâches par un robot humanoïde en construction

Des chercheurs publient sur arXiv (référence 2608.01600v1, soumis début août 2026) un système de perception et d'action destiné aux robots humanoïdes pour l'exécution de tâches de construction. L'architecture combine deux réseaux de neurones profonds : Humanoid-PoseNet, qui capture les postures d'un ouvrier lors d'une démonstration et les traduit en poses mécaniquement réalisables pour un robot humanoïde, puis Humanoid-ActionNet, qui apprend à partir de ces poses traduites les actions que le robot peut réellement exécuter. Testé sur huit tâches liées au chantier, le système atteint une erreur moyenne de suivi de mouvement de 82,45 mm en MPJPE (Mean Per Joint Position Error, l'écart moyen par articulation entre le geste de référence et celui reproduit par le robot). L'abstract ne cite aucun modèle de robot précis, aucun site de déploiement ni partenaire industriel : il s'agit d'un travail de recherche méthodologique et non d'un produit commercialisé. L'enjeu porte sur un goulot d'étranglement bien identifié de l'apprentissage par démonstration chez les humanoïdes : la différence de morphologie et de degrés de liberté (DOF) entre un corps humain et un robot rend la traduction directe des mouvements captés souvent instable ou irréalisable mécaniquement. En séparant explicitement l'étape de retargeting des poses (PoseNet) de l'apprentissage de l'action (ActionNet), l'étude propose une réponse ciblée à ce problème, potentiellement transposable à d'autres tâches physiques répétitives et dangereuses en environnement non structuré, un terrain bien plus exigeant pour un humanoïde que l'entrepôt logistique. Le chiffre de 82,45 mm reste toutefois difficile à juger sans point de comparaison ni contexte sur la difficulté relative des huit tâches testées. Le secteur de la construction, confronté à une pénurie de main-d'œuvre et à des tâches physiquement éprouvantes, est régulièrement cité comme débouché naturel pour les humanoïdes, aux côtés des usines et entrepôts déjà ciblés par Figure, Agility Robotics ou Unitree. Ce travail se positionne en amont de tout déploiement commercial : les auteurs le présentent eux-mêmes comme une « étape précoce » vers des collaborateurs humanoïdes de chantier, sans calendrier de pilotes ni annonce industrielle à ce stade.

RecherchePaper
1 source
Modèles vision-action pour l'apprentissage et le contrôle des robots : une étude
3arXiv cs.RO 

Modèles vision-action pour l'apprentissage et le contrôle des robots : une étude

Une équipe de chercheurs publie sur arXiv (identifiant 2609.16074v1) une étude de synthèse consacrée aux World-Action Models (WAM), des architectures qui couplent prédiction de l'état futur du monde et génération d'actions exécutables pour des robots. Le texte ne présente ni robot ni déploiement terrain : c'est une revue de littérature qui situe les WAM par rapport aux modèles du monde classiques, à l'apprentissage par renforcement basé sur un modèle, à la génération vidéo conditionnée par l'action et aux politiques VLA (vision-langage-action) purement réactives. Les auteurs proposent une taxonomie unifiée couvrant représentations, modélisation des transitions d'état, interfaces d'action, architectures, pipelines d'entraînement, modalités de données et stratégies de mise à l'échelle, puis passent en revue les applications en manipulation robotique, navigation et conduite autonome, avant de recenser les jeux de données, benchmarks, métriques et protocoles d'évaluation existants. Une page de projet répertoriant les travaux associés est mise en ligne à l'adresse rcl-robotics.github.io. L'intérêt de ce travail tient moins à un résultat inédit qu'à la mise en ordre d'un champ en pleine effervescence. Depuis l'essor des modèles du monde et de politiques VLA comme Pi-0, GR00T N2 ou Helix, une même intuition traverse le secteur : un robot fiable doit anticiper les conséquences d'une action avant de l'exécuter, plutôt que de se contenter d'associer observation et geste. Pour les intégrateurs et décideurs B2B, cette synthèse offre un vocabulaire commun pour évaluer des annonces concurrentes qui se réclament toutes, à des degrés divers, de cette convergence entre prédiction et action. Elle rappelle aussi, en creux, que la plupart des systèmes déployés aujourd'hui restent soit des générateurs vidéo sans boucle d'action réelle, soit des politiques réactives sans véritable anticipation, ce qui relativise la maturité que certains fournisseurs revendiquent. Ce travail s'inscrit dans la convergence amorcée depuis 2024-2025 entre les modèles du monde issus de la génération vidéo et les politiques d'action de type VLA popularisées par des laboratoires nord-américains et asiatiques ; aucun acteur français ou européen n'est cité dans cette étude, qui reste centrée sur la littérature académique et industrielle existante. Les auteurs identifient plusieurs verrous encore ouverts : l'alignement entre prédiction et action, la factorisation monde-action, la cohérence spatiale et multi-vue, la mémoire à long horizon, la simulation neuronale pour l'apprentissage en boucle fermée, et l'inférence efficace nécessaire à un déploiement temps réel. Ces axes dessinent l'agenda de recherche à venir pour transformer les WAM, aujourd'hui à l'état de cadre conceptuel, en briques réellement déployables sur des robots.

RecherchePaper
1 source
Tripody : un robot parallèle surcontraint de type 3-SPR pour les tâches de construction en hauteur
4arXiv cs.RO 

Tripody : un robot parallèle surcontraint de type 3-SPR pour les tâches de construction en hauteur

Tripody, un robot parallèle sur roues à 3 degrés de liberté conçu pour les travaux de construction en hauteur, notamment le perçage de plafonds, a été présenté par une équipe de recherche dans une publication arXiv (2607.25781, juillet 2026). Pesant 33 kg, l'engin s'étend de 1,7 m à 3,4 m de hauteur et supporte une charge continue de 32 kg via une interface d'effecteur modulaire. Sa cinématique reprend l'architecture classique 3-SPR (trois jambes, joint sphérique à la base, articulation prismatique actionnée, joint de rotation à l'effecteur), mais remplace les joints sphériques par des joints universels, ce qui surcontraint volontairement le mécanisme ; de petites déflexions élastiques réparties absorbent les incompatibilités cinématiques résultantes tout en préservant un mouvement essentiellement translationnel. Les essais montrent une rigidité en plan comparable à celle d'une variante à base sphérique, mais une rigidité en torsion nettement supérieure : +67% à 1,7 m, +196% à 2,6 m et +454% à 3,4 m, avec un couplage inter-axes négligeable. Le positionnement en boucle fermée, mesuré par station totale, converge sous 0,6 mm sur tout l'espace de travail, tandis que la simple extrapolation par modèle atteint une erreur au 95e centile de 2,7 mm (maximum 3,6 mm). Une démonstration de perçage de plafond en boucle ouverte, avec un motif de 15 trous, affiche une erreur de position relative maximale de 4,5 mm après alignement rigide. Ces résultats s'adressent directement à un problème concret du secteur de la construction : les manipulateurs sériels lourds actuellement utilisés pour les travaux en hauteur sont difficiles à déployer dans des intérieurs encombrés, faute de compacité et de mobilité. En misant sur une architecture surcontrainte qui tolère la compliance plutôt que de la combattre, les auteurs proposent une voie pratique vers des robots légers, à grande portée verticale et à précision millimétrique, un compromis rarement atteint simultanément par les solutions existantes. Pour les intégrateurs et décideurs du BTP, l'intérêt tient moins à la performance brute qu'à la validation en conditions quasi réelles : le perçage de 15 trous avec une précision de l'ordre de quelques millimètres démontre une faisabilité tâche par tâche, au-delà d'une simple preuve de concept en laboratoire. Le papier reste toutefois prudent : il s'agit d'une étude en boucle ouverte sur un motif limité, pas d'un déploiement chantier. L'approche s'inscrit dans une lignée de recherches en robotique parallèle explorant les architectures 3-SPR pour des tâches nécessitant rigidité et précision sur de grands espaces de travail, un terrain habituellement dominé par les bras sériels ou les portiques fixes. En intégrant des actionneurs linéaires sur mesure et une pile de contrôle combinant estimation d'état SE(3), cinématique directe et commande dans l'espace des tâches, les auteurs positionnent Tripody comme une alternative mobile et reconfigurable aux solutions de perçage plafond existantes, qu'elles soient manuelles ou robotisées de type portique. Les prochaines étapes attendues, non détaillées dans l'abstract, porteraient logiquement sur un contrôle en boucle fermée pour la tâche de perçage elle-même et sur des essais en environnement de chantier réel plutôt qu'en conditions contrôlées de laboratoire.

RecherchePaper
1 source