Aller au contenu principal
RecherchearXiv cs.RO 

TERRA : apprendre des actions latentes transférables par représentation temporelle des effets et alignement relationnel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent TERRA (Temporal Effect Representation and Relational Alignment), une méthode d'apprentissage d'actions latentes pour la robotique, décrite dans un preprint arXiv (2610.09509v1). Les actions latentes sont des codes proches d'actions, inférés à partir de transitions visuelles, qui servent à superviser des politiques robotiques sans étiquettes d'actions explicites. TERRA représente une transition par un « effet temporel » compact. Cet effet combine le changement net des caractéristiques visuelles avec une composante de dynamique d'ordre faible à l'intérieur de la fenêtre temporelle. Un latent continu est appris à partir de cet effet. Le module Effect-Anchored Transport (EAT) décode ensuite ce latent dans d'autres états initiaux. L'effet obtenu est ancré sur celui observé à la source. Avec des lecteurs linéaires gelés, TERRA prédit les actions plus précisément que UniVLA et qu'une baseline de type LAPA. Il se dégrade plus lentement face aux distracteurs visuels. Les transitions « transportées » restent fidèles à l'action du donneur, même quand le contexte du receveur s'éloigne. À échelle de pré-entraînement égale, le système complet atteint 93,4 % de succès moyen sur LIBERO, contre 91,8 % pour UniVLA.

L'intérêt tient à la façon dont le papier traite deux faiblesses des actions latentes. La première concerne ce que le code conserve. Une simple différence entre états de départ et d'arrivée perd la manière dont le mouvement se déroule. La séquence complète, elle, laisse passer des variations parasites. La seconde concerne la réutilisation. La reconstruction n'observe un latent qu'avec l'état dont il provient, donc rien ne garantit qu'il garde le même sens dans un autre contexte. L'approche vise à rendre ces codes transférables d'un contexte à l'autre, ce qui compte pour le pré-entraînement à partir de vidéos sans annotations d'actions. Le gain de 1,6 point sur LIBERO est modeste. Il s'agit d'un benchmark de simulation, où l'écart entre résultats en simulation et en conditions réelles reste entier. Les auteurs précisent qu'un contrôle à budget identique attribue l'essentiel des gains à EAT, ce qui désigne ce module comme la contribution centrale. Aucun déploiement ni test sur robot physique n'est rapporté dans le résumé.

Ce travail s'inscrit dans la lignée des modèles vision-langage-action (VLA) qui apprennent des représentations d'actions à partir de vidéos. LAPA a popularisé les actions latentes quantifiées, et UniVLA constitue la référence directe retenue ici pour la comparaison. Les prochaines étapes naturelles seraient des validations sur de plus grands corpus vidéo, sur des benchmarks plus variés et sur du matériel réel, notamment avec des vidéos humaines dont le point de vue et la morphologie diffèrent de ceux du robot. Ces tests diraient si la propriété de transport tient hors du cadre simulé. Aucune date de publication de code ou de modèles n'est indiquée. Le résultat reste pour l'instant un apport méthodologique de recherche, sans lien avec un produit ou un déploiement industriel.

À lire aussi

LARA : alignement des représentations d'actions latentes pour les modèles vision-langage-action
1arXiv cs.RO 

LARA : alignement des représentations d'actions latentes pour les modèles vision-langage-action

Une équipe de recherche propose LARA (Latent Action Representation Alignment), un framework qui entraîne conjointement deux composants jusqu'ici séparés dans les modèles vision-langage-action (VLA) : le modèle d'action latente (LAM), qui apprend des représentations d'actions à partir de vidéos non annotées, et le modèle VLA lui-même. Jusqu'à présent, ces deux briques étaient optimisées indépendamment, ce qui limitait leurs bénéfices mutuels : le LAM restait déconnecté du contexte robotique réel, et le VLA était contraint par des représentations figées, sans possibilité d'ajustement. LARA aligne les deux via un mécanisme de représentation partagée, permettant au LAM d'apprendre à partir de trajectoires d'actions réelles pour éviter de capter de simples changements visuels sans pertinence (comme un déplacement de caméra), tandis que le VLA est régularisé par la dynamique prédictive du LAM pour réduire les hallucinations de trajectoires inefficaces. Les auteurs rapportent des gains moyens d'environ 10% en pré-entraînement, 5% en amélioration post-entraînement de modèles VLA déjà entraînés, et 15% en affinage du LAM seul, mesurés sur trois benchmarks de manipulation en simulation et un benchmark réel conçu spécifiquement pour l'évaluation. L'enjeu pour le secteur est la dépendance chronique des VLA à des jeux de données robotiques réels, coûteux et rares à grande échelle. Exploiter des vidéos humaines non étiquetées comme source de supervision, sans perdre en fiabilité, est une piste suivie par plusieurs laboratoires travaillant sur des modèles comme GR00T N2 ou Pi-0. Ce que suggère LARA, c'est que le goulot d'étranglement n'est pas seulement la quantité de données vidéo disponibles, mais la façon dont les représentations d'action apprises restent ou non ancrées dans la réalité physique du robot pendant l'entraînement conjoint. L'approche s'inscrit dans la lignée des travaux sur les Latent Action Models, qui cherchent depuis plusieurs années à combler l'écart entre l'abondance de vidéos web et la rareté des démonstrations robotiques annotées. Contrairement à une annonce produit, il s'agit ici d'un travail académique (version 2 d'un article déposé sur arXiv), sans déploiement industriel annoncé ni calendrier de commercialisation ; sa portée dépendra de sa reproductibilité et de son adoption par les équipes développant des VLA en conditions réelles.

RecherchePaper
1 source
Forçage temporel : alignement de représentation 4D pour les modèles vision-langage-action
2arXiv cs.RO 

Forçage temporel : alignement de représentation 4D pour les modèles vision-langage-action

Des chercheurs présentent Temporal Forcing, une méthode d'alignement de représentation 4D pour les modèles vision-langage-action (VLA), détaillée dans un article publié sur arXiv (2608.30643v1) le 30 août 2026 ou aux alentours. Le système ajoute une voie dédiée à l'historique des observations, permettant à un modèle VLA standard de condenser cet historique en représentations latentes tenant compte du temps. Ces représentations sont ensuite alignées avec les caractéristiques géométriques extraites par un modèle de fondation 4D préentraîné, capable de capturer l'évolution d'une scène 3D dans le temps de façon géométriquement cohérente. Sur le benchmark LIBERO, Temporal Forcing atteint un taux de réussite de 98,8%, soit 2,2 points de plus que son modèle de base. Sur une tâche physique de placement d'objet caché ("hidden-placement"), le taux de réussite complet de la tâche passe de 20,0% à 43,3%. Le code source doit être rendu public, sans date de disponibilité précisée dans l'article. Cette avancée cible un problème connu des VLA actuels: la confusion entre états visuellement similaires (observation aliasing) et la difficulté à gérer des manipulations longues, deux limites qui découlent du fait que les représentations 3D classiques ne capturent qu'un instant figé de la scène, sans mémoire de son évolution. En démontrant qu'ajouter une dimension temporelle à l'alignement géométrique améliore concrètement le taux de succès sur une tâche physique réelle, et pas seulement en simulation, ces résultats nuancent l'idée que l'alignement 3D seul suffirait à rapprocher les VLA d'une robustesse proche de l'humain. Pour les intégrateurs et équipes de recherche en robotique manipulatrice, cela suggère qu'exploiter des modèles de fondation 4D préentraînés peut devenir un ingrédient standard pour améliorer la mémoire de contexte des politiques d'action, sans changer l'architecture de base du modèle VLA. Ce travail s'inscrit dans la lignée des méthodes récentes de VLA qui alignent leurs représentations internes sur la géométrie de scène 3D pour améliorer la manipulation, une approche qui a gagné du terrain mais bute sur les tâches à long horizon. Temporal Forcing se positionne comme une extension de ces approches géométriques plutôt qu'une rupture architecturale, en s'appuyant sur un modèle de fondation 4D externe déjà entraîné. Les auteurs annoncent la publication future du code, ce qui permettra à la communauté de valider les résultats sur d'autres benchmarks que LIBERO et la tâche physique testée, mais aucun calendrier de déploiement industriel ni de partenariat n'est mentionné à ce stade.

RechercheActu
1 source
EDAR : apprentissage de représentations d'actions dépendantes de l'environnement pour la manipulation robotique
3arXiv cs.RO 

EDAR : apprentissage de représentations d'actions dépendantes de l'environnement pour la manipulation robotique

EDAR (Environment-Dependent Action Representation) est une nouvelle méthode d'apprentissage de représentations d'actions pour la manipulation robotique, présentée dans un article publié sur arXiv (référence 2607.11427v1). Le problème que les auteurs cherchent à résoudre est que les trajectoires de contrôle brutes utilisées pour entraîner des politiques robotiques sont bruitées, redondantes et difficiles à modéliser telles quelles. Les approches existantes se contentent généralement d'encoder la structure du flux d'actions lui-même, sans tenir compte explicitement de l'environnement dans lequel ces actions sont exécutées. EDAR propose au contraire de coupler les commandes moteur avec leurs effets visuels attendus, conditionnés par le contexte de la scène, afin que la représentation apprise capture la sémantique de l'interaction plutôt que de simples motifs au niveau des commandes. Les auteurs ont testé leur méthode sur des bancs d'essai de manipulation à la fois simulés et sur robot réel. Cette approche s'attaque à un angle mort connu des architectures VLA (vision-language-action) actuelles: le même segment d'action peut produire des résultats radicalement différents selon la disposition des objets, les propriétés physiques de la scène ou l'état initial de l'environnement. En ancrant les tokens d'action dans les conséquences visuelles attendues plutôt que dans la seule structure de commande, EDAR vise à améliorer la généralisation des politiques apprises, en particulier sur des tâches de manipulation à long horizon, où les erreurs de représentation s'accumulent au fil des étapes. Pour les équipes qui développent des politiques de manipulation généralistes, ce type de travail illustre une tendance de fond: le passage d'une modélisation purement centrée sur le contrôle vers des représentations conjointes action-perception, jugées nécessaires pour que les modèles de fondation robotiques (dans la lignée de GR00T N2, Pi-0 ou Helix) tiennent leurs promesses au-delà des démonstrations en environnement contrôlé. Le papier s'inscrit dans un courant de recherche plus large sur les représentations d'actions pour la robotique, où plusieurs travaux récents ont exploré la tokenisation d'actions, l'apprentissage par imitation conditionné par la vision, ou les modèles du monde pour anticiper les conséquences des actions. EDAR se positionne comme une contribution méthodologique plutôt qu'un produit ou un système déployé: il n'y a pas d'annonce de déploiement industriel ni de partenariat commercial associé à ce travail, qui reste à ce stade une publication de recherche évaluée sur des bancs d'essai académiques. Les prochaines étapes attendues pour ce type de travaux sont généralement l'intégration dans des pipelines VLA plus larges et des tests de transfert sur des plateformes robotiques commerciales, mais aucune feuille de route de ce type n'est mentionnée dans l'abstract.

RecherchePaper
1 source
Sur l'alignement des représentations entre agents incarnés
4arXiv cs.RO 

Sur l'alignement des représentations entre agents incarnés

Des chercheurs publient sur arXiv (2610.02985, octobre 2026) un travail théorique sur l'alignement des représentations entre agents incarnés. Le point de départ est que plusieurs agents qui interagissent avec le même processus physique ont rarement des représentations identiques. Elles sont hétérogènes, asynchrones et relatives à l'observateur. Les auteurs ne cherchent pas à les aligner globalement. Ils se demandent quelles distinctions doivent réellement être résolues pour qu'une interaction reste cohérente. Ils formalisent la question par la notion de « suffisance relationnelle ». Une carte de preuves relationnelles, propre à l'interaction, définit l'ambiguïté laissée après comparaison des représentations. La suffisance est atteinte quand chaque fibre d'ambiguïté résiduelle reste dans une même classe d'équivalence d'interaction. Si la condition échoue, il faut ajouter des ancrages sensorimoteurs qui séparent précisément les ambiguïtés capables de changer le résultat utile. Pour les systèmes lisses, les auteurs dérivent une borne inférieure locale au premier ordre. Le nombre d'ancrages scalaires indépendants est au moins égal à la dimension des directions invisibles à la preuve relationnelle mais visibles pour la carte pertinente pour l'interaction. L'article l'illustre par un scénario de passage de relais asynchrone, en deux variantes avec les mêmes agents observateurs, représentations, transports et preuves relationnelles. La synchronisation relative n'exige aucun ancrage supplémentaire. Le passage à un instant absolu en exige exactement un. Le résultat est une condition d'arrêt, relative à la tâche, pour l'alignement des représentations. Un désaccord résiduel n'a pas besoin d'être éliminé s'il n'a aucun effet sur l'interaction. Pour les équipes qui conçoivent des flottes multi-robots, des cellules mixtes humains-robots ou des échanges entre robots de fournisseurs différents, cela déplace la question. On ne demande plus si deux systèmes partagent le même modèle du monde, mais quelle information minimale ils doivent partager pour la tâche visée. Le cas du passage de relais montre aussi qu'une exigence d'horloge absolue a un coût réel en capteurs ou en signaux de synchronisation, alors qu'une coordination relative peut s'en passer. Il faut toutefois rester prudent. Il s'agit d'un cadre théorique, sans validation sur du matériel, sans benchmark, sans chiffres de performance, et la borne n'est établie que localement pour des systèmes lisses. Rien n'indique encore que le cadre passe à l'échelle de politiques apprises de type VLA ou de dynamiques avec contacts non lisses. Ces travaux s'inscrivent dans un débat plus large sur la communication et l'alignement de représentations dans les systèmes multi-agents. Les approches habituelles cherchent souvent un espace latent commun ou un étalonnage global, ce qui est coûteux et souvent superflu. La contribution ici est une manière de dire à l'avance où s'arrêter. Les prochaines étapes naturelles seraient de calculer cette borne sur des tâches robotiques concrètes, comme le transfert d'objet entre manipulateurs ou la coordination entre AMR, et de la relier à des politiques apprises. Aucune implémentation ni échéance n'est annoncée.

RecherchePaper
1 source