Aller au contenu principal
RecherchearXiv cs.RO 

AffordTrajDP : apprentissage dynamique de politiques visuomotrices guidées par affordance pour la manipulation robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent AffordTrajDP, un nouveau framework d'apprentissage par imitation guidé par affordances pour la manipulation robotique, publié en préprint sur arXiv début août 2026. Contrairement aux approches classiques qui figent un point de contact statique entre l'effecteur et l'objet cible, ce système construit une trajectoire d'affordance dynamique : à partir d'une observation RGB-D, un point d'ancrage est propagé dans le temps en suivant la pose SE(3) de l'objet, ce qui donne une guidance cohérente tout au long du geste plutôt qu'une simple instruction figée en début de tâche. Sur le benchmark simulé ManiSkill3, la méthode atteint un taux de réussite moyen de 70,0 %, soit jusqu'à 17,8 points de mieux que les meilleures méthodes concurrentes. Des essais en conditions réelles ont été menés sur des bras robotiques Galaxea A1 et UR7e, sur six tâches de précision (empilement de cubes, prise de gobelet, insertion d'adaptateur, anneau sur tige, dépôt en bol, insertion USB), avec des tests sur objets vus et non vus pour le bras Galaxea A1.

L'enjeu dépasse la simple performance chiffrée : les affordances statiques dérivent souvent après le contact initial, surtout dans les tâches de précision ou quand la position de l'objet varie légèrement, un problème classique de fossé entre démonstration en labo et robustesse en conditions réelles. En rendant la guidance sensible à l'état de l'objet plutôt qu'à un point fixe défini à l'avance, AffordTrajDP s'attaque directement à ce goulot d'étranglement, un signal pertinent pour les intégrateurs qui cherchent des politiques visuo-motrices capables de tolérer le désordre réel d'un poste de production ou d'entrepôt, plutôt que des démonstrations calibrées en environnement contrôlé.

Le travail s'inscrit dans la lignée des méthodes d'apprentissage par imitation guidées par affordances, qui cherchent à compresser la perception visuelle en contraintes géométriques exploitables pour réduire les besoins en données d'entraînement. Les auteurs présentent des ablations pour isoler la contribution de chaque composant du système. À ce stade, il s'agit d'un résultat de recherche en préprint, non d'un produit commercial ni d'un déploiement industriel annoncé.

À lire aussi

Apprentissage de politiques par simulation pour la loco-manipulation des robots humanoïdes
1arXiv cs.RO 

Apprentissage de politiques par simulation pour la loco-manipulation des robots humanoïdes

Une équipe de chercheurs a publié le 9 juin 2026 sur arXiv (2606.08278) SIMPLE, un banc de test de simulation unifié pour l'apprentissage et l'évaluation de politiques de contrôle de robots humanoïdes. La plateforme couple la simulation de dynamique de contact de MuJoCo avec le rendu photoréaliste d'IsaacSim, et propose 60 tâches de loco-manipulation plein corps, 50 scènes d'intérieur et plus de 1 000 assets d'objets. Pour la collecte de données, deux pipelines sont intégrés : génération automatisée de trajectoires par planification de mouvement, et interface de téléopération VR à faible latence. Les auteurs y benchmarkent plusieurs familles de politiques humanoïdes : réseaux d'imitation légers, grands modèles vision-langage-action (VLA) et les récents modèles d'action du monde (WAM, World Action Models). Les expériences démontrent, selon les auteurs, un transfert zero-shot vers des robots humanoïdes physiques dans des configurations similaires. L'enjeu central est un goulot d'étranglement d'évaluation : les modèles fondationnels humanoïdes progressent plus vite que les protocoles pour les tester. Les benchmarks existants se concentrent sur la robotique de table ou les robots à roues, sans couvrir la loco-manipulation plein corps, compétence clé pour les humanoïdes déployés en environnement industriel ou domestique. Si la corrélation sim-to-real revendiquée dans l'article se confirme à plus grande échelle, elle légitime le recours massif à la simulation pour entraîner des politiques de contrôle, réduisant drastiquement les coûts de collecte de données en conditions réelles. C'est précisément le pari industriel de Physical Intelligence avec pi-0, et de Figure AI avec Figure 02 : remplacer les démos téléopérées coûteuses par des pipelines simulés reproductibles. La fragmentation des benchmarks est un problème structurel en robotique humanoïde : chaque laboratoire publie sur ses propres protocoles, rendant toute comparaison inter-équipes difficile. Des initiatives comme HumanoidBench, RoboVerse ou Isaac Lab ont tenté d'y répondre, mais sans couvrir la chaîne complète loco-manipulation avec rendu photoréaliste et pipelines de données intégrés. SIMPLE se positionne à cette intersection. Les équipes de Google DeepMind (GR00T N2, Helix), Agility Robotics (Digit) et Boston Dynamics sont directement concernées. Ce preprint arXiv n'est pas encore évalué par les pairs ; l'adoption par la communauté dépendra de la disponibilité publique du code et des assets, non encore confirmée.

RecherchePaper
1 source
Robots à trois bras : apprentissage par imitation visuomotrice de politiques robotiques
2arXiv cs.RO 

Robots à trois bras : apprentissage par imitation visuomotrice de politiques robotiques

Voici l'article traduit et résumé. Une équipe de recherche présente TriManPolicy, un système d'apprentissage par imitation conçu pour piloter des robots à trois bras simultanément. Le problème de départ est concret : la téléopération bi-manuelle classique fonctionne bien quand le nombre de canaux de contrôle correspond entre l'opérateur humain et le robot, mais elle échoue dès qu'un robot dispose d'un troisième bras, puisqu'un seul opérateur ne peut piloter en continu que deux membres à la fois. Basculer entre paires de bras force alors à enregistrer des mouvements indépendants de façon séquentielle, ce qui pousse l'apprentissage par clonage comportemental à reproduire des délais imposés par l'interface de contrôle plutôt que par la tâche elle-même. Le composant central de TriManPolicy est le Dependency-Aware Tri-Arm Scheduling (DATS), un algorithme qui retraite les démonstrations hors ligne : il conserve les segments sensorimoteurs locaux tels que démontrés mais les repositionne dans le temps selon des contraintes d'ordre des tâches et d'usage des bras, validées par un humain. Le résultat entraîne une politique unique et synchrone pour les trois bras, sans nécessiter le graphe de dépendances ni le planificateur au moment du déploiement. Sur six tâches réelles complexes, les politiques entraînées sur données retimées par DATS montrent une coordination plus efficace, avec un taux de succès comparable aux méthodes classiques. Cette avancée s'attaque à un goulot d'étranglement peu discuté de la robotique humanoïde et multi-bras : la collecte de données de démonstration reste le facteur limitant pour entraîner des politiques visuomotrices de type VLA, et les systèmes à trois bras ou plus (bras additionnels, mains bimanuelles montées sur base mobile) sont de plus en plus courants dans les plateformes industrielles. En prouvant qu'il est possible de découpler la structure temporelle de la démonstration humaine de celle exigée par la tâche, TriManPolicy ouvre la voie à une collecte de données plus rapide et moins coûteuse pour des architectures robotiques complexes, un enjeu direct pour les intégrateurs qui cherchent à réduire le coût par démonstration sans sacrifier la qualité de coordination entre membres. Ce travail s'inscrit dans la lignée plus large des recherches sur l'apprentissage par imitation visuomoteur, où la majorité des systèmes existants (type ALOHA, Mobile ALOHA ou les plateformes bimanuelles standard) suppose une correspondance stricte entre canaux de téléopération humains et effecteurs robotiques. En proposant une méthode de retiming offline validée par supervision humaine plutôt qu'un simple filtrage des temps morts, les auteurs montrent que DATS modifie réellement la structure de supervision entre bras. Les six tâches testées en conditions réelles suggèrent une piste concrète pour les futurs travaux sur les architectures à quatre bras ou plus, notamment pour les robots humanoïdes à deux bras plus une base mobile ou un troisième effecteur dédié à une tâche auxiliaire.

RecherchePaper
1 source
Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche
3arXiv cs.RO 

Apprentissage de compétences atomiques sémantiques pour la manipulation robotique multitâche

Des chercheurs ont mis en ligne une nouvelle version (v2) de leur article "Learning Semantic Atomic Skills for Multi-Task Robotic Manipulation" sur arXiv (2512.18368), présentant AtomSkill, un framework d'apprentissage par imitation pour la manipulation robotique multi-tâches. La méthode s'attaque à trois obstacles connus de l'apprentissage par démonstration à grande échelle : démonstrations sous-optimales, multi-modalité des comportements et interférences destructrices entre tâches lorsqu'un même modèle doit apprendre plusieurs compétences simultanément. AtomSkill découpe les démonstrations en compétences atomiques de longueur variable, alignées sémantiquement grâce à un objectif contrastif qui impose à la fois cohérence sémantique et cohérence temporelle, formant une bibliothèque de compétences compacte et réutilisable. La politique apprise prédit à la fois la position finale (keypose) d'une compétence et les actions immédiates, ce qui permet des transitions fluides entre compétences en fonction de la progression. Lors de l'inférence, un échantillonneur par diffusion génère des séquences de compétences plausibles, tandis que les keyposes prédites déclenchent automatiquement l'enchaînement. Les auteurs annoncent des résultats supérieurs aux méthodes de référence en imitation learning et aux approches par compétences existantes, en simulation comme en conditions réelles. L'enjeu dépasse la seule prouesse technique : la plupart des bibliothèques de compétences actuelles sont soit trop dépendantes de la structure du langage utilisé pour les décrire, soit mal alignées sémantiquement d'une tâche à l'autre, ce qui limite leur capacité à généraliser. Résoudre ce compromis conditionne directement la viabilité des politiques multi-tâches pour des applications industrielles comme le picking, l'assemblage ou la manutention, où un même robot doit enchaîner des gestes variés sans réapprentissage complet à chaque nouvelle tâche. C'est aussi un signal dans le débat actuel sur les modèles vision-langage-action (VLA) : la promesse d'une politique unique capable de généraliser à grande échelle reste difficile à tenir, et des architectures hiérarchiques par compétences comme AtomSkill pourraient constituer une alternative plus robuste que les VLA monolithiques. L'article s'inscrit dans une lignée de recherche en concurrence directe avec des approches VLA de bout en bout telles que Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure. Contrairement à ces annonces industrielles très médiatisées, il s'agit ici d'une publication académique sans chiffres de benchmark détaillés ni précisions sur le matériel utilisé dans l'abstract, et sans affiliation commerciale indiquée. Les auteurs renvoient vers une page de projet (atom-skill.github.io) pour le code et les démonstrations vidéo ; la validation à plus grande échelle sur robots physiques reste, comme souvent à ce stade de publication, la prochaine étape à surveiller.

RecherchePaper
1 source
RelAfford6D : graphes d'affordance 6D relationnels pour la manipulation robotique guidée par contraintes
4arXiv cs.RO 

RelAfford6D : graphes d'affordance 6D relationnels pour la manipulation robotique guidée par contraintes

Des chercheurs ont déposé en juin 2026 sur arXiv (référence 2606.27036) RelAfford6D, un framework sans entraînement pour la manipulation robotique d'objets articulés. Le système s'appuie sur un graphe d'affordances 6D relationnel : à partir d'une consigne en langage naturel, il déduit une topologie sémantique reliant la partie principale d'interaction d'un objet à son ancre physique. Ces noeuds topologiques sont ensuite convertis en poses métriques précises dans l'espace SE(3), soit six degrés de liberté complets en position et orientation, via des modèles de vision fondamentaux pré-entraînés. L'exécution est formulée comme un problème de satisfaction de contraintes cinématiques : le robot génère des trajectoires continues en suivant des variétés physiques strictement définies, qu'il s'agisse d'orbites rotoïdes (rotation) ou prismatiques (translation). Un mécanisme de suivi en boucle fermée assure la replanification en temps réel face aux perturbations. L'approche tranche avec la majorité des politiques data-driven actuelles, comme les VLA basés sur l'imitation ou les méthodes à affordances latentes, qui extraient des points de contact isolés sans contraintes cinématiques explicites. En formulant la manipulation comme satisfaction de contraintes, RelAfford6D obtient des taux de succès zero-shot supérieurs aux baselines data-driven testées, avec une généralisation inter-catégories documentée sur des objets articulés variés (tiroirs, portes, manettes) aussi bien en simulation que dans des environnements physiques réels. Pour les intégrateurs industriels, l'absence d'entraînement spécifique à la tâche est significative : le framework peut s'adapter à de nouveaux mécanismes sans collecter de données de démonstration supplémentaires. La manipulation d'objets articulés en open-world reste l'un des verrous majeurs de la robotique de service et industrielle. Les approches récentes à base de VLA ont progressé sur la flexibilité sémantique mais peinent à garantir la précision géométrique requise pour des mécanismes contraints comme des vannes, portes ou tiroirs industriels. RelAfford6D s'inscrit dans une tendance émergente combinant fondations visuelles pré-entraînées et raisonnement géométrique analytique, sans fine-tuning coûteux. Parmi les travaux concurrents figurent CabiNet, les méthodes à affordance implicite comme GNFactor ou F3RM, et les approches VLA récentes telles que Pi-0. Ce preprint constitue une démonstration académique validée sur banc réel, sans partenariat industriel ni timeline de déploiement annoncé à ce stade.

RecherchePaper
1 source