Aller au contenu principal
RecherchearXiv cs.RO 

FOCUS : des états privilégiés au RGB-D grâce à un changement de modalité contrôlé et à l'alignement des représentations

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent FOCUS, un cadre d'apprentissage par renforcement en une seule étape, fondé sur PPO, qui vise à réduire l'écart entre l'entraînement en simulation avec états privilégiés et le déploiement avec des observations RGB-D. Le critique (la fonction de valeur) est entraîné sur l'état privilégié disponible en simulation: positions d'objets, poses, etc. L'acteur, lui, collecte ses trajectoires soit depuis des latents issus de caméras RGB-D, soit depuis des latents issus de l'état privilégié. Le choix entre les deux est régulé automatiquement par la divergence de Kullback-Leibler entre les distributions d'actions produites par chaque modalité. Un terme d'alignement de représentation pousse en parallèle l'acteur à choisir des actions cohérentes dans les deux cas. Sur cinq tâches de manipulation, le succès moyen au test passe de 0,71 à 0,93 par rapport au meilleur baseline RGB-D au test de chaque tâche. L'AUC de succès à l'entraînement, normalisée par budget et calculée sur l'ensemble du pipeline de chaque méthode, passe de 0,47 à 0,65. Sur Pick-and-Place, le succès au test grimpe de 0,47 à 0,86 et l'AUC de 0,12 à 0,61, soit un gain de 5,0 fois en efficacité d'apprentissage pour un budget d'interactions fixe.

Ce travail s'attaque à un point de friction très concret pour les équipes qui entraînent des politiques visuelles de manipulation. L'apprentissage direct sur pixels est coûteux en échantillons, tandis que la distillation d'un « enseignant » à états privilégiés vers un « élève » visuel impose généralement plusieurs étapes et laisse un écart de modalité au moment du test. FOCUS propose de conserver un seul étage d'entraînement et de faire croître progressivement l'exposition au RGB-D, uniquement quand les deux modalités s'accordent sur l'action à effectuer. Si les gains se confirment, cela réduirait le coût de calcul et la complexité d'ingénierie des pipelines sim-to-real, notamment pour les intégrateurs qui entraînent des politiques de préhension et de dépose sur des scènes variées. Les réserves sont toutefois nettes. Les résultats sont annoncés sur cinq tâches, apparemment en simulation. L'article ne mentionne ni transfert sur robot réel, ni comparaison avec des modèles fondation de type VLA, ni nombre de graines. Le chiffre de 0,71 à 0,93 compare en outre FOCUS au meilleur baseline sélectionné tâche par tâche, ce qui rend la comparaison conservatrice mais dépendante du choix des baselines.

Le contexte est celui d'une littérature déjà riche sur l'asymétrie acteur-critique et la distillation d'états privilégiés vers des observations visuelles, où les méthodes en deux phases dominent. L'enjeu reste la robustesse du RGB-D bruité, par exemple face aux reflets, aux occultations ou aux capteurs bon marché. Il s'agit d'une prépublication arXiv (2610.11119v1), non encore évaluée par les pairs, sans code ni calendrier de validation annoncés dans le résumé. La suite logique serait un test sur matériel réel et une confrontation avec les politiques généralistes actuelles, afin de savoir si ce gain d'efficacité tient hors des benchmarks simulés.

Dans nos dossiers

À lire aussi

Sur l'alignement des représentations entre agents incarnés
1arXiv cs.RO 

Sur l'alignement des représentations entre agents incarnés

Des chercheurs publient sur arXiv (2610.02985, octobre 2026) un travail théorique sur l'alignement des représentations entre agents incarnés. Le point de départ est que plusieurs agents qui interagissent avec le même processus physique ont rarement des représentations identiques. Elles sont hétérogènes, asynchrones et relatives à l'observateur. Les auteurs ne cherchent pas à les aligner globalement. Ils se demandent quelles distinctions doivent réellement être résolues pour qu'une interaction reste cohérente. Ils formalisent la question par la notion de « suffisance relationnelle ». Une carte de preuves relationnelles, propre à l'interaction, définit l'ambiguïté laissée après comparaison des représentations. La suffisance est atteinte quand chaque fibre d'ambiguïté résiduelle reste dans une même classe d'équivalence d'interaction. Si la condition échoue, il faut ajouter des ancrages sensorimoteurs qui séparent précisément les ambiguïtés capables de changer le résultat utile. Pour les systèmes lisses, les auteurs dérivent une borne inférieure locale au premier ordre. Le nombre d'ancrages scalaires indépendants est au moins égal à la dimension des directions invisibles à la preuve relationnelle mais visibles pour la carte pertinente pour l'interaction. L'article l'illustre par un scénario de passage de relais asynchrone, en deux variantes avec les mêmes agents observateurs, représentations, transports et preuves relationnelles. La synchronisation relative n'exige aucun ancrage supplémentaire. Le passage à un instant absolu en exige exactement un. Le résultat est une condition d'arrêt, relative à la tâche, pour l'alignement des représentations. Un désaccord résiduel n'a pas besoin d'être éliminé s'il n'a aucun effet sur l'interaction. Pour les équipes qui conçoivent des flottes multi-robots, des cellules mixtes humains-robots ou des échanges entre robots de fournisseurs différents, cela déplace la question. On ne demande plus si deux systèmes partagent le même modèle du monde, mais quelle information minimale ils doivent partager pour la tâche visée. Le cas du passage de relais montre aussi qu'une exigence d'horloge absolue a un coût réel en capteurs ou en signaux de synchronisation, alors qu'une coordination relative peut s'en passer. Il faut toutefois rester prudent. Il s'agit d'un cadre théorique, sans validation sur du matériel, sans benchmark, sans chiffres de performance, et la borne n'est établie que localement pour des systèmes lisses. Rien n'indique encore que le cadre passe à l'échelle de politiques apprises de type VLA ou de dynamiques avec contacts non lisses. Ces travaux s'inscrivent dans un débat plus large sur la communication et l'alignement de représentations dans les systèmes multi-agents. Les approches habituelles cherchent souvent un espace latent commun ou un étalonnage global, ce qui est coûteux et souvent superflu. La contribution ici est une manière de dire à l'avance où s'arrêter. Les prochaines étapes naturelles seraient de calculer cette borne sur des tâches robotiques concrètes, comme le transfert d'objet entre manipulateurs ou la coordination entre AMR, et de la relier à des politiques apprises. Aucune implémentation ni échéance n'est annoncée.

RecherchePaper
1 source
LARA : alignement des représentations d'actions latentes pour les modèles vision-langage-action
2arXiv cs.RO 

LARA : alignement des représentations d'actions latentes pour les modèles vision-langage-action

Une équipe de recherche propose LARA (Latent Action Representation Alignment), un framework qui entraîne conjointement deux composants jusqu'ici séparés dans les modèles vision-langage-action (VLA) : le modèle d'action latente (LAM), qui apprend des représentations d'actions à partir de vidéos non annotées, et le modèle VLA lui-même. Jusqu'à présent, ces deux briques étaient optimisées indépendamment, ce qui limitait leurs bénéfices mutuels : le LAM restait déconnecté du contexte robotique réel, et le VLA était contraint par des représentations figées, sans possibilité d'ajustement. LARA aligne les deux via un mécanisme de représentation partagée, permettant au LAM d'apprendre à partir de trajectoires d'actions réelles pour éviter de capter de simples changements visuels sans pertinence (comme un déplacement de caméra), tandis que le VLA est régularisé par la dynamique prédictive du LAM pour réduire les hallucinations de trajectoires inefficaces. Les auteurs rapportent des gains moyens d'environ 10% en pré-entraînement, 5% en amélioration post-entraînement de modèles VLA déjà entraînés, et 15% en affinage du LAM seul, mesurés sur trois benchmarks de manipulation en simulation et un benchmark réel conçu spécifiquement pour l'évaluation. L'enjeu pour le secteur est la dépendance chronique des VLA à des jeux de données robotiques réels, coûteux et rares à grande échelle. Exploiter des vidéos humaines non étiquetées comme source de supervision, sans perdre en fiabilité, est une piste suivie par plusieurs laboratoires travaillant sur des modèles comme GR00T N2 ou Pi-0. Ce que suggère LARA, c'est que le goulot d'étranglement n'est pas seulement la quantité de données vidéo disponibles, mais la façon dont les représentations d'action apprises restent ou non ancrées dans la réalité physique du robot pendant l'entraînement conjoint. L'approche s'inscrit dans la lignée des travaux sur les Latent Action Models, qui cherchent depuis plusieurs années à combler l'écart entre l'abondance de vidéos web et la rareté des démonstrations robotiques annotées. Contrairement à une annonce produit, il s'agit ici d'un travail académique (version 2 d'un article déposé sur arXiv), sans déploiement industriel annoncé ni calendrier de commercialisation ; sa portée dépendra de sa reproductibilité et de son adoption par les équipes développant des VLA en conditions réelles.

RecherchePaper
1 source
3arXiv cs.RO 

ExecVLA : respecter des contraintes d'exécution fines dans les modèles vision-langage-action (VLA) grâce à une représentation d'action à deux niveaux

Des chercheurs proposent ExecVLA, un cadre pour les modèles vision-langage-action (VLA) qui vise à faire respecter des contraintes d'exécution fines données dans l'instruction, alors que l'objectif de la tâche reste identique. Ces contraintes portent sur la cible d'interaction, le motif de mouvement, les relations spatiales et la configuration terminale. Le cadre sépare une composante orientée but d'une composante spécifique à l'exécution. Pour cela, il utilise une représentation d'action à deux niveaux et des jetons de raisonnement à deux niveaux, supervisés. Deux objectifs d'entraînement s'y ajoutent. L'invariance du but maintient stable la représentation de haut niveau entre les exécutions d'un même but. La prédictibilité de l'exécution garantit que la représentation de bas niveau conserve les contraintes qui distinguent ces exécutions. Les auteurs ont construit des jeux de données dédiés, avec annotations de but et de raisonnement fin, en simulation (sur la base de LIBERO) et sur un bras Realman-75. Ils rapportent une meilleure complétion des tâches et, surtout, un respect nettement plus fiable des contraintes. L'extrait ne fournit aucun chiffre précis, ni taux de réussite ni écart avec les modèles de référence, ni nombre d'épisodes ou de tâches. L'enjeu est de distinguer deux critères que les benchmarks VLA actuels confondent souvent. Une politique orientée but est jugée sur l'accomplissement de la tâche, sans regarder la manière. Or, en contexte industriel, la manière compte. Contourner un obstacle par la gauche, saisir un objet par une zone précise, déposer une pièce selon une orientation donnée ou s'arrêter dans une pose finale imposée sont des exigences courantes en assemblage, en logistique ou en manipulation en environnement partagé. Les trajectoires qui réussissent la même tâche ne sont donc pas interchangeables. Ce travail met en évidence une limite des VLA généralistes : ils ignorent facilement les consignes de style d'exécution tant que le but est atteint. Pour un intégrateur, la contrôlabilité fine par le langage peut devenir un critère de sélection aussi important que le taux de réussite brut. Il faut toutefois rester prudent. Il s'agit d'un article académique sur un seul bras, avec des jeux de données maison, et les contraintes évaluées restent probablement proches de celles de l'entraînement. Aucun résultat ne porte encore sur la généralisation à des contraintes inédites ou sur des cadences industrielles. Le contexte est celui d'une génération de VLA (Pi-0, Helix, GR00T et leurs dérivés) qui a surtout progressé sur la généralisation de la tâche et la robustesse perceptive. La question du pilotage fin de l'exécution reste moins traitée. Des approches voisines utilisent le raisonnement en chaîne de pensée ou des représentations intermédiaires de trajectoire pour guider l'action. ExecVLA y ajoute une séparation explicite entre le but et la manière, avec une supervision dédiée. Il s'agit d'une version révisée (v2) d'un préprint arXiv, sans partenaire industriel ni calendrier de déploiement annoncé. Les prochaines étapes à surveiller sont une évaluation sur d'autres embodiments, des comparaisons directes avec les VLA ouverts du moment, et la publication du code et des jeux de données, qui permettrait à la communauté de reproduire les résultats.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
4arXiv cs.RO 

Unifier l'apprentissage de politiques et la prédiction d'états grâce à la modélisation spatiale du langage

Des chercheurs proposent, dans un preprint arXiv (2610.12172), le « Spatial Language Modeling », une approche qui fait apprendre à un seul Transformer autorégressif à la fois la génération d'actions et la prédiction des états futurs d'une scène. Le principe consiste à représenter les contours de la scène, les objectifs, les cibles d'action et les états futurs avec un vocabulaire commun de coordonnées discrètes et de tokens sémantiques. Une grammaire propre à chaque tâche organise ces éléments en séquences spatiales, de sorte qu'un même objectif de prédiction du token suivant couvre le contrôle et la modélisation de l'état. Le modèle est entraîné de zéro en deux temps : un pré-entraînement sur des transitions issues de jeu aléatoire, puis un entraînement conjoint actions et états sur des démonstrations expertes. Pendant le pré-entraînement, les coordonnées d'action enregistrées servent de condition aux prédictions d'état suivantes, mais sont exclues de la perte. En phase de contrôle, le modèle ne décode que les cibles d'action exécutables et met à jour son historique avec les états réellement observés. L'évaluation porte sur la tâche Push-T, en simulation et sur un robot réel. Les auteurs annoncent des performances compétitives en simulation, et un taux de réussite ainsi qu'une couverture de la cible supérieurs à ceux des politiques de référence testées sur robot réel. Pour les équipes qui travaillent sur les politiques de manipulation, l'intérêt tient à la supervision complémentaire apportée par l'apprentissage des effets géométriques des actions. Les ablations indiquent que l'entraînement sur des séquences conjointes action-état améliore le contrôle, et que le pré-entraînement sur du jeu aléatoire apporte un gain supplémentaire. Ce dernier point est pertinent en pratique : ces données sont bon marché à collecter, sans téléopérateur expert. Le même modèle, alimenté avec des trajectoires d'actions fournies, prédit aussi les états successifs de la scène et reproduit les effets du poussage. Il joue donc à la fois le rôle de politique et de modèle du monde léger. Il faut toutefois rester prudent sur la portée de ces résultats. Push-T est un benchmark de poussage planaire d'un objet en forme de T, relativement simple, et le texte ne chiffre pas, dans son résumé, l'écart avec les baselines ni la taille de l'échantillon d'essais réels. La généralisation à des tâches à contacts riches, à de la 3D ou à des préhenseurs multi-doigts reste à démontrer, de même que le passage à l'échelle d'un vocabulaire de coordonnées discrètes. Ce travail s'inscrit dans un mouvement plus large visant à unifier perception, action et prédiction dans des architectures de type langage. Il se distingue des approches VLA (vision-langage-action) dominantes, qui reposent sur de grands modèles pré-entraînés, par un entraînement de zéro, sans pré-entraînement web, et par une représentation entièrement spatiale. Parmi les références habituelles de Push-T figurent les politiques de diffusion, qui servent souvent de base de comparaison, ainsi que les modèles du monde appris pour la planification. Le résumé ne précise ni l'équipe, ni le code, ni d'éventuelles extensions annoncées. Il s'agit à ce stade d'un preprint non évalué par des pairs, sans déploiement industriel associé. La suite logique sera de tester la méthode sur des tâches plus longues, sur des scènes 3D et sur des manipulations avec contacts complexes.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source