Aller au contenu principal
RecherchearXiv cs.RO 

RoboAug : d'une seule annotation à des centaines de scènes grâce à l'augmentation de données par contraste de régions pour la manipulation robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

RoboAug est un cadre d'augmentation de données génératif pour l'apprentissage robotique, décrit dans un article arXiv (2602.14032, version 2). Son principe tient en une contrainte minimale : une seule image annotée de bounding boxes suffit pour construire le jeu de données. À partir de cette supervision réduite, le système s'appuie sur des modèles génératifs préentraînés pour produire des variations sémantiques précises de la scène. Il y ajoute une perte contrastive par région (région-contrastive loss), utilisable en plug-and-play, qui oriente l'attention de la politique vers les zones utiles à la tâche. Les auteurs ont testé la méthode sur trois plateformes physiques : le bras UR-5e d'Universal Robots, une plateforme AgileX et le robot humanoïde Tian Gong 2.0. Selon eux, RoboAug dépasse systématiquement les méthodes d'augmentation de l'état de l'art face à trois types de décalages : l'arrière-plan, les objets distracteurs et l'éclairage. Le résumé ne donne ni taux de réussite, ni nombre de tâches, ni nombre de démonstrations. Le titre évoque « des centaines de scènes » générées depuis une annotation, sans plus de détail dans le texte disponible.

L'enjeu est la généralisation d'une politique d'imitation ou d'une politique vision-langage-action (VLA) à des environnements jamais vus, l'un des principaux freins au passage de la démonstration au déploiement. Deux voies dominent aujourd'hui. La première est le préentraînement à grande échelle, coûteux en collecte de données et en temps. La seconde est l'augmentation sémantique, qui suppose une détection d'objets sans faille en amont, hypothèse fragile en conditions réelles. RoboAug cherche à contourner ces deux obstacles, ce qui, si les résultats tiennent, ferait baisser le coût de préparation d'un nouveau site pour un intégrateur : une image annotée plutôt qu'une campagne de captures. Les validations sur trois robots de natures différentes, dont un humanoïde, sont un point positif. Quelques réserves s'imposent toutefois. Le résumé ne précise ni les tâches, ni la taille des échantillons d'essais, ni les baselines comparées. Les gains ne sont pas chiffrés, et la robustesse face à des changements de géométrie ou de pose des objets n'est pas évoquée. Il s'agit d'un résultat de laboratoire, non d'un déploiement industriel.

Ce travail s'inscrit dans une lignée de méthodes qui utilisent des modèles de diffusion ou d'édition d'images pour multiplier les observations d'entraînement : ROSIE, GenAug ou, plus récemment, des pipelines qui s'appuient sur la segmentation pour isoler l'objet manipulé. Leur point faible commun est la dépendance à un détecteur fiable, que RoboAug dit relâcher. La concurrence passe aussi par les gros modèles fondation (Pi-0, GR00T, Helix), qui misent sur l'échelle des données plutôt que sur l'augmentation ciblée. L'usage de Tian Gong 2.0, plateforme humanoïde chinoise, confirme l'activité des laboratoires asiatiques sur ce sujet. La publication d'une page de projet (x-roboaug.github.io) devrait permettre d'examiner vidéos et protocoles. Les prochaines étapes à surveiller sont la publication de chiffres détaillés, le code ouvert et des tests sur des tâches plus longues ou plus dextres.

Impact France/UE

Universal Robots (Danemark) équipe de nombreuses lignes européennes avec son bras UR-5e, et si RoboAug tient ses promesses, une seule image annotée suffirait aux intégrateurs européens pour adapter leurs politiques d'apprentissage à un nouveau site, ce qui réduirait le coût de déploiement, même si ce résultat de laboratoire n'est pas encore validé en conditions industrielles.

À lire aussi

RESample : un cadre robuste d'augmentation de données par échantillonnage exploratoire pour la manipulation robotique
1arXiv cs.RO 

RESample : un cadre robuste d'augmentation de données par échantillonnage exploratoire pour la manipulation robotique

Les modèles Vision-Language-Action (VLA), entraînés par apprentissage par imitation sur de vastes jeux de démonstrations, pilotent aujourd'hui la plupart des systèmes de manipulation robotique avancés. Mais ces jeux de données ne contiennent presque exclusivement que des trajectoires réussies : dès qu'un robot déployé s'écarte légèrement du scénario appris, ce décalage de distribution le pousse vers des situations d'échec pour lesquelles il n'a jamais vu d'exemple de correction. Des chercheurs proposent RESample, un cadre d'augmentation de données guidé par la couverture, qui vient combler ce trou. La méthode entraîne une fonction de couverture conservatrice capable de repérer les modes d'échec plausibles dans le monde réel mais absents des démonstrations standard, puis génère par échantillonnage exploratoire des séquences où le robot s'écarte volontairement de la trajectoire avant d'exécuter une action de récupération. Ces trajectoires synthétiques enrichissent le jeu d'entraînement initial. Sur le benchmark LIBERO et sur des tâches réelles de manipulation, RESample améliore systématiquement le taux de réussite des politiques, avec un gain absolu allant jusqu'à 12 points, pour un surcoût de données limité à 20% du jeu de départ. L'enjeu dépasse la performance brute : c'est le problème classique du "reality gap" entre démonstrations et déploiement qui est directement attaqué. Un bras robotique piloté par un VLA finit toujours, en usage réel, par dévier légèrement de sa trajectoire d'apprentissage, à cause du bruit capteur, d'un objet mal positionné ou d'une variation de lumière. Sans exemples de récupération, ces déviations s'accumulent jusqu'à l'échec complet de la tâche. En automatisant la génération de ces scénarios correctifs, plutôt qu'en s'appuyant sur du télé-opérateur humain coûteux pour les enregistrer, RESample s'attaque à un vrai goulot d'étranglement pour l'industrialisation des VLA en environnement industriel ou logistique, où la fiabilité prime sur la démonstration en conditions idéales. Ce travail s'inscrit dans une lignée de recherches récentes sur la robustesse des politiques d'imitation, aux côtés d'approches comme les corrections DAgger ou les méthodes de fine-tuning par renforcement appliquées à des modèles de type Pi-0 ou GR00T N2. La publication, une version révisée (v4) d'un article arXiv d'octobre 2025, ne mentionne pas de partenariat industriel ni de déploiement commercial: il s'agit d'un résultat de laboratoire, validé en simulation (LIBERO) et sur un nombre limité de tâches réelles, dont l'ampleur exacte n'est pas précisée dans le résumé.

RecherchePaper
1 source
GeCCo : une politique généraliste conditionnée par le contact pour la loco-manipulation des robots à pattes
2arXiv cs.RO 

GeCCo : une politique généraliste conditionnée par le contact pour la loco-manipulation des robots à pattes

GeCCo, pour Generalist Contact-Conditioned Policy, est une politique de bas niveau entraînée par apprentissage par renforcement profond (DRL) capable de suivre des points de contact arbitraires sur un robot quadrupède, décrite dans un article arXiv (2509.17582v2, version révisée). Plutôt que d'apprendre une politique de bout en bout spécifique à chaque tâche, les auteurs proposent une architecture hiérarchique modulaire où cette unique politique de suivi de contacts sert d'interface entre un planificateur de haut niveau et le contrôle bas niveau du robot. Le système a été testé sur un large éventail de tâches de locomotion et de manipulation avec une seule politique généraliste : différentes allures, franchissement de terrains complexes comme des escaliers et des pentes, traversée de pierres de gué et de poutres étroites jamais vues à l'entraînement, ainsi que des interactions physiques comme appuyer sur un bouton ou pousser un tonneau. L'intérêt principal pour l'industrie robotique tient à la promesse de rompre avec le goulot d'étranglement classique du RL en locomotion quadrupède : la définition et l'ajustement itératifs de fonctions de récompense pour chaque nouvelle application, un processus chronophage qui limite le passage à l'échelle. En stabilisant l'exécution des contacts malgré l'incertitude dynamique et les erreurs de planification, GeCCo permet d'échanger ou de composer des planificateurs (codés à la main, appris ou basés sur de l'optimisation) sans réentraîner la couche de contrôle. Pour des intégrateurs cherchant à combiner locomotion et manipulation sur une même plateforme, cela suggère la possibilité de construire de nouveaux comportements en assemblant un planificateur spécifique à la tâche avec une politique pré-entraînée générique, plutôt qu'en repartant de zéro à chaque fois. L'article se positionne face aux méthodes dominantes de RL end-to-end en locomotion quadrupède, qu'il cherche explicitement à dépasser en généralité et en modularité. Aucune affiliation industrielle ni partenaire commercial n'est mentionné dans le résumé, ce qui situe ce travail comme une contribution de recherche plutôt qu'une annonce produit. Des démonstrations vidéo sont disponibles sur le site du projet, vassil-atn.github.io/gecco.github.io, mais l'article ne précise ni feuille de route de déploiement ni pilote industriel annoncé.

RecherchePaper
1 source
D'une seule démonstration à une politique générale pour la manipulation avec contact
3arXiv cs.RO 

D'une seule démonstration à une politique générale pour la manipulation avec contact

Une équipe de recherche publie sur arXiv (réf. 2605.17601, mai 2026) un framework d'apprentissage par démonstration capable de généraliser à partir d'un seul exemple sur des tâches de manipulation impliquant des contacts répétés avec l'environnement. Le système repose sur un pipeline en quatre étapes : abstraction de la démonstration en primitives de contraintes environnementales, exploration autonome pour lever les ambiguïtés, correction ciblée par un opérateur humain pour couvrir les variantes hors-distribution, et enfin récupération en ligne des détails géométriques via interaction compliante. Validé sur sept tâches réelles multi-étapes à contact riche, le framework atteint un taux de succès supérieur à 90 %. Aucune entreprise spécifique ni plateforme robotique n'est mentionnée dans le préprint, qui reste une contribution académique sans déploiement industriel annoncé. Le point central de l'approche est de représenter une tâche non pas comme une trajectoire à imiter, mais comme une séquence de contraintes environnementales à exploiter. Ce changement de paradigme permet au robot de distinguer la structure générale d'une tâche (types de contraintes, transitions entre elles) des détails spécifiques à une instance donnée (poses exactes, géométrie locale). Pour un intégrateur ou un décideur industriel, cela signifie qu'une seule démonstration suffit potentiellement là où les méthodes de behavior cloning classiques en réclament des centaines. Le résultat de 90 %+ sur des tâches à contact riche est notable car ce domaine concentre la majorité des échecs en manipulation robotique réelle, notamment à cause de la sensibilité aux variations de pose et aux dynamiques de contact non modélisées. L'apprentissage par démonstration est un champ très actif depuis une décennie, concurrencé récemment par les politiques de diffusion (Diffusion Policy, Pi-0 de Physical Intelligence), les architectures VLA (RT-2, GR00T N2 de NVIDIA) et les méthodes ACT (Action Chunking with Transformers). L'originalité revendiquée ici est de traiter les contraintes environnementales comme biais inductif plutôt que d'augmenter massivement les données d'entraînement ou la puissance du modèle. La limite principale reste l'absence d'évaluation sur des plateformes humanoïdes ou collaboratives standard, ce qui rend difficile la comparaison directe avec les benchmarks du secteur. Les suites naturelles seraient un passage à des environnements ouverts et une validation sur des robots commerciaux comme le Franka Research 3 ou les bras UR.

RecherchePaper
1 source
ReCo : locomotion cohérente avec la réponse de la politique grâce à une MPC adaptée, pour la manipulation par robots à pattes
4arXiv cs.RO 

ReCo : locomotion cohérente avec la réponse de la politique grâce à une MPC adaptée, pour la manipulation par robots à pattes

Des chercheurs publient sur arXiv ReCo (Response-Consistent Locomotion), un cadre logiciel pour la manipulation continue sur robots à pattes, c'est-à-dire la tâche qui consiste à suivre précisément une trajectoire avec l'effecteur d'un bras pendant que la base continue de marcher. L'approche combine apprentissage par renforcement (RL) et commande prédictive (MPC). La politique apprise assure une locomotion robuste, tandis que le MPC coordonne la base et le bras pour compenser les erreurs de suivi. La contribution tient en deux briques. Un « response shaping » entraîne la politique à répondre aux commandes de façon cohérente et répétable malgré des dynamiques randomisées. Un modèle de réponse en boucle fermée, identifié ensuite, permet au MPC de planifier conjointement les commandes de locomotion et le mouvement du bras. Sur un benchmark en simulation, ReCo réduit l'erreur quadratique moyenne (RMSE) de position de 28,7 % et celle d'orientation de 27,4 % par rapport au meilleur point de comparaison pour chaque métrique. Des essais sur robot réel démontrent une manipulation continue embarquée, base et bras coordonnés. Le résumé ne précise ni la plateforme, ni la charge utile, ni les temps de cycle. L'enjeu est un problème que connaissent bien les intégrateurs de robots mobiles manipulateurs. Le MPC ne peut compenser que le mouvement de base qu'il sait prédire. Or la réponse d'une politique RL à une commande de vitesse varie avec la phase de marche, les contacts et la charge portée. Cette variabilité rend la compensation imprécise précisément quand le robot transporte quelque chose ou marche sur un sol irrégulier. Rendre la réponse de la politique prévisible plutôt que la corriger après coup est une voie pragmatique pour rapprocher les politiques apprises des contrôleurs à modèle, sans renoncer à la robustesse du RL. Pour un décideur industriel, cela concerne la précision en conditions réelles, souvent le point faible des démonstrations de manipulation sur quadrupèdes. Les gains annoncés restent toutefois mesurés en simulation, face à des références choisies par les auteurs, et la validation matérielle semble qualitative. Il s'agit d'un résultat de recherche, sans produit ni déploiement associé. Ces travaux s'inscrivent dans la lignée de la manipulation « loco-manipulation » sur quadrupèdes équipés d'un bras, où deux écoles s'opposent. L'une repose sur des politiques RL de bout en bout pour l'ensemble du corps. L'autre est hybride, avec un RL pour la marche et une optimisation pour le bras. ReCo se range dans la seconde. Elle vise à combler l'écart entre une politique de marche opaque et un planificateur qui a besoin d'un modèle fiable. La suite logique serait des essais sur d'autres plateformes, avec des charges variées et des tâches plus longues, ainsi qu'une comparaison avec des politiques de corps entier entraînées de bout en bout. Le texte n'annonce aucun calendrier de ce type.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source