Aller au contenu principal
RecherchearXiv cs.RO 

Même scène, tâche différente : alignement des compétences pour la généralisation compositionnelle des modèles VLA

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs, dont l'équipe derrière le site taegeunyang.github.io/craft, publient sur arXiv (2610.00524) CRAFT, une méthode d'entraînement destinée à améliorer la généralisation compositionnelle des modèles VLA (vision-language-action). Le problème visé est précis: un VLA affiné sur des démonstrations échoue souvent à exécuter des combinaisons de compétences absentes de ces démonstrations, même si chaque compétence prise isolément a bien été démontrée. Les auteurs testent CRAFT sur trois modèles VLA et deux benchmarks en simulation, et sur un robot réel. Ils annoncent une hausse du taux de succès sur les combinaisons non démontrées, sans perte notable sur les combinaisons démontrées. Le résumé ne fournit aucun chiffre de gain, ni le nom des modèles ou des benchmarks, ni le type de robot, ce qui empêche pour l'instant de mesurer l'ampleur réelle de l'amélioration.

L'intérêt tient au diagnostic autant qu'au remède. Les auteurs identifient un « raccourci visuel »: pendant le fine-tuning, l'observation visuelle sert de substitut à l'instruction. La politique reconnaît une scène déjà vue et rejoue la combinaison associée, au lieu de suivre la consigne donnée. Si ce mécanisme se confirme à grande échelle, il remet en cause l'idée que des VLA robustes en démonstration suivent réellement le langage. Pour un intégrateur, la conséquence est concrète: un robot qui réussit « poser la pièce puis visser » dans une cellule peut échouer sur « visser puis poser » dans la même cellule, sans qu'aucun test de démonstration ne le révèle. Cela renforce l'exigence de bancs d'essai qui varient l'instruction à scène constante, plutôt que de mesurer la seule réussite sur des tâches vues. À ce stade, les résultats restent ceux d'un preprint, sans revue par les pairs.

Techniquement, CRAFT construit des paires contrefactuelles: l'observation d'une démonstration est conservée, l'instruction est changée pour désigner une combinaison jamais démontrée. Ces paires n'ont pas d'action cible. Les actions de la compétence requise ne peuvent pas être copiées telles quelles, car une même compétence exige des gestes différents selon la scène. La méthode transfère donc la supervision à partir de représentations de compétences réutilisables d'une exécution à l'autre. Elle s'inscrit dans le travail sur la généralisation compositionnelle des VLA, face aux approches qui comptent sur davantage de données ou de diversité de scènes. Les prochaines étapes à surveiller sont la publication du code, les chiffres détaillés et la validation sur des tâches longues et des plateformes industrielles.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Corriger le OÙ, préserver le COMMENT : généralisation compositionnelle des modèles vision-langage-action (VLA) par guidage référentiel
1arXiv cs.RO 

Corriger le OÙ, préserver le COMMENT : généralisation compositionnelle des modèles vision-langage-action (VLA) par guidage référentiel

Des chercheurs proposent ReGuide (Referential Guidance), un module d'enrobage « training-free » qui s'ajoute à des politiques Vision-Language-Action (VLA) déjà entraînées, sans toucher à leurs poids ni à leur architecture. À partir des poses d'objets fournies par un module de grounding externe, il combine un « rebinding » sémantique et un « rebinding » géométrique. Il guide l'effecteur terminal vers des configurations couvertes par les démonstrations d'entraînement, centrées sur le référent désigné par l'instruction. La politique gelée reprend alors le contrôle et termine la tâche. Les tests en simulation ont porté sur plusieurs architectures VLA, puis sur un robot réel. Les gains de taux de réussite sous décalage compositionnel atteignent jusqu'à 56,8 points de pourcentage en simulation et 75,0 points sur le robot physique. Les performances sur les tâches standard sont préservées. L'article est un préprint arXiv (v1), donc non évalué par les pairs. Il ne précise pas, dans son résumé, les noms des modèles testés, le robot utilisé ni le nombre d'essais. Ces résultats visent un point faible connu des VLA. Entraînés de bout en bout sur des jeux de données robotiques peu variés, ces modèles exploitent des raccourcis visuels : ils associent une action à des éléments sans rapport avec la tâche (arrière-plan, disposition de la scène) plutôt qu'à la sémantique de l'instruction. Un objet, une destination ou un décor déjà vus séparément ne peuvent alors pas être recombinés dans une configuration nouvelle. Les auteurs observent que, dans ce cas, le VLA échoue surtout à se localiser globalement (WHERE), tout en conservant ses compétences de manipulation locale (HOW). Corriger la cible plutôt que réapprendre le geste évite le recours à de nouvelles données ou à un réentraînement par backbone. Pour un intégrateur, c'est une piste pratique pour fiabiliser une politique déjà déployée. Le revers est la dépendance à un module de perception qui fournit des poses d'objets fiables. Les gains les plus élevés correspondent aussi à des scénarios de décalage choisis par les auteurs, et non à des conditions d'usine. Les approches existantes reposent sur une perception centrée sur la tâche ou sur une diversification ciblée des données. Elles n'offrent pas de mécanisme explicite pour la recomposition d'éléments inédits et exigent des modifications spécifiques à chaque architecture, avec réentraînement. ReGuide se positionne comme un correctif extérieur, compatible avec différents backbones. Sa validité à grande échelle reste à démontrer : le résumé ne mentionne ni tâches longues, ni scènes encombrées, ni déploiement industriel. Les prochaines étapes à surveiller sont la publication du code et des détails expérimentaux, la comparaison avec des politiques réentraînées sur des données plus diversifiées, et la robustesse face aux erreurs du module de grounding.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
MA-VLA : un modèle vision-langage-action multi-bras pour la collaboration et la généralisation compositionnelle
2arXiv cs.RO 

MA-VLA : un modèle vision-langage-action multi-bras pour la collaboration et la généralisation compositionnelle

La recherche en robotique manipulative s'attaque à un problème précis: coordonner plusieurs bras robotiques qui doivent collaborer sur une même tâche sans être limités aux schémas de coopération vus pendant l'entraînement. Un article publié sur arXiv (identifiant 2608.25864v1) présente MA-VLA, un modèle vision-langage-action (VLA) conçu pour la collaboration multi-bras. Contrairement aux VLA récents qui traitent l'instruction comme une consigne globale unique appliquée à l'ensemble du système, MA-VLA découpe le comportement coopératif en "prompts atomiques" de niveau intermédiaire, chacun assigné à un bras spécifique. L'équipe introduit aussi une technique d'entraînement baptisée Arm Shuffle: elle permute aléatoirement, pour chaque bras, les observations, les états et les prompts atomiques assignés, ce qui force le modèle à suivre les instructions indépendamment du rôle fixe attribué à un bras donné. Les auteurs ont construit un benchmark dédié où les configurations de collaboration testées sont absentes de l'ensemble d'entraînement, et ont évalué le système en simulation comme en conditions réelles. Le code, les modèles et les données sont publiés sur GitHub (zhangzaibin/future-robots). Ce travail cible un angle mort connu des VLA actuels: leur capacité de généralisation s'effondre dès que la répartition des rôles entre bras change par rapport aux schémas mémorisés à l'entraînement. Selon les résultats rapportés, les VLA de référence échouent largement sur ces collaborations inédites, alors que MA-VLA maintient des performances stables. Pour les intégrateurs travaillant sur des cellules robotiques multi-bras ou des plateformes bimanuelles, c'est un signal utile: la généralisation compositionnelle, plutôt que la simple mémorisation de trajectoires coopératives, pourrait devenir un critère de sélection des architectures VLA pour des lignes de production où la configuration des tâches varie. Cette contribution s'inscrit dans la vague plus large des modèles VLA qui cherchent à unifier perception, langage et contrôle pour la manipulation robotique, un axe de recherche porté ces dernières années par plusieurs laboratoires académiques et industriels. MA-VLA se positionne explicitement contre les architectures à instruction globale unique, en misant sur une assignation explicite et recomposable de sous-objectifs par bras. Il s'agit à ce stade d'une publication de recherche avec code ouvert, sans annonce de déploiement industriel ni de partenaire commercial identifié.

RechercheActu
1 source
Diagnostic de la généralisation compositionnelle dans les tâches robotiques séquentielles
3arXiv cs.RO 

Diagnostic de la généralisation compositionnelle dans les tâches robotiques séquentielles

Une nouvelle étude arXiv (2607.29687v1) s'attaque à un problème central de la manipulation robotique séquentielle : comment un robot généralise-t-il à des combinaisons d'instructions jamais vues lors de l'entraînement. Collecter des démonstrations pour chaque combinaison possible d'instructions coûte combinatoirement trop cher, et les jeux de données à couverture éparse échouent souvent face à des recombinaisons hors distribution. Les chercheurs décomposent l'écart de généralisation en trois sources distinctes : le décalage marginal d'instruction, le décalage compositionnel d'instruction, et le décalage contexte-action. Résultat clé : il n'est pas nécessaire d'énumérer toutes les combinaisons de tâches. Un sous-ensemble structuré, ne représentant qu'un quart de l'espace complet des tâches, suffit à restaurer une performance hors distribution robuste, à condition qu'il couvre les dépendances pertinentes pour l'action. Autre constat notable : un simple réglage fin avec une seule démonstration par tâche fait bondir le taux de réussite hors distribution de 0,4% à 54,7%. Pour l'industrie robotique, ce travail remet en cause une hypothèse répandue sur la collecte de données pour les architectures VLA (vision-langage-action) : l'échec en généralisation compositionnelle ne vient généralement pas d'un manque de compétences de bas niveau chez le robot, mais d'un mauvais "guidage" par l'instruction (instruction steering). Autrement dit, le robot sait souvent déjà exécuter le geste requis, mais peine à le rattacher à la bonne combinaison de mots. Pour les intégrateurs et les équipes data de laboratoires comme ceux travaillant sur des modèles type Pi-0 ou GR00T N2, la conclusion pratique est stratégique : prioriser la couverture des dépendances entre instructions plutôt que l'expansion exhaustive du nombre de tâches, ce qui pourrait réduire drastiquement les coûts de collecte de démonstrations. L'étude s'inscrit dans un courant de recherche plus large sur le "reality gap" des politiques de manipulation entraînées par imitation, où la généralisation en conditions réelles reste le principal goulot d'étranglement avant un déploiement industriel fiable. Les auteurs précisent que des résultats complémentaires sont disponibles en supplément, ainsi qu'un site de projet dédié, sans toutefois annoncer de déploiement matériel ni de partenariat industriel à ce stade.

RecherchePaper
1 source
ATOM-Bench : un benchmark réel pour les compétences atomiques et la généralisation compositionnelle dans les politiques de manipulation
4arXiv cs.RO 

ATOM-Bench : un benchmark réel pour les compétences atomiques et la généralisation compositionnelle dans les politiques de manipulation

Une équipe de chercheurs a publié ATOM-Bench, un benchmark de terrain conçu pour évaluer les politiques de manipulation robotique sur deux dimensions distinctes : l'acquisition de compétences atomiques et la généralisation compositionnelle. Le dispositif décompose la manipulation sur table en "atomes moteurs" (précision de préhension, trajectoire du poignet, force de contact) et en "atomes d'instruction" (comptage, filtrage logique, ancrage sémantique). Il comprend 30 tâches atomiques et 24 tâches compositionnelles inédites, testées sur des configurations bras unique et bras double. Les auteurs ont collecté 3 000 démonstrations humaines pour le fine-tuning et effectué 2 700 rollouts physiques sur cinq politiques de manipulation représentatives. Les métriques introduites, l'Atomic Score (AS) et le Compositional Failure Share (CFS), permettent d'isoler la source d'un échec : exécution moteur défaillante, mauvais ancrage instruction, ou incapacité à recombiner des compétences acquises. Les résultats remettent en cause un postulat courant dans le secteur : que des politiques performantes sur des tâches atomiques généralisent naturellement à des tâches compositionnelles. Ce n'est pas le cas. Malgré des scores atomiques corrects sur l'ancrage d'instructions simples, les modèles testés échouent systématiquement sur le comptage, le filtrage logique et les atomes moteurs fins. Plus significatif encore, une bonne performance atomique ne prédit pas fiablement la réussite sur les tâches compositionnelles hors distribution. Pour un intégrateur ou un décideur industriel, cela signifie que les benchmarks classiques sur tâches démontrées surestiment largement la robustesse opérationnelle des politiques dites "généralistes". ATOM-Bench s'inscrit dans un contexte où les politiques VLA (Vision-Language-Action) comme pi0 (Physical Intelligence), Octo, ou OpenVLA sont présentées comme des fondations universelles pour le contrôle robotique. Ce cadre d'évaluation comble l'absence de protocole standardisé pour tester la composabilité des compétences, un angle mort identifié depuis les travaux sur l'abstraction hiérarchique en RL. Les données de démonstration et les rollouts d'évaluation sont publiés en open access pour permettre une comparaison reproductible entre équipes. La prochaine étape logique serait d'intégrer ATOM-Bench comme protocole de validation dans les pipelines de fine-tuning des acteurs du secteur, notamment pour qualifier des déploiements réels en environnement industriel non contrôlé.

UELes laboratoires et intégrateurs européens travaillant sur des politiques de manipulation robotique peuvent adopter ATOM-Bench comme protocole de validation open-access pour qualifier la robustesse réelle de leurs systèmes avant déploiement industriel.

RecherchePaper
1 source