Aller au contenu principal
IA physiquearXiv cs.RO 

Inférence de l'action à partir de l'état latent futur pour la manipulation robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche a publié sur arXiv, le 25 août 2026 (référence 2608.22067v1), un article intitulé « Inferring Action from Future Latent State for Robotic Manipulation », présentant DELE-w0.5, un nouveau modèle de contrôle robotique. Contrairement aux World-Action Models existants, qui s'appuient sur des backbones de génération vidéo pour prédire conjointement les images futures et les actions du robot, DELE-w0.5 se passe de la génération vidéo : il infère directement la séquence d'actions à partir d'un état latent futur compact, qui capture le résultat physique de l'interaction sans reconstruire l'apparence visuelle intermédiaire. Testé sur 480 essais réels couvrant quatre tâches de manipulation à long horizon, le système atteint un taux de réussite complet de 62,5 % et une progression macro par étapes ordonnées de 81,3 %, soit respectivement 47,5 et 30,7 points de pourcentage de mieux que la meilleure baseline comparée.

Cette approche remet en question un postulat courant chez les VLA (vision-language-action) et les world models robotiques, celui voulant que prédire l'image future soit nécessaire pour ancrer un modèle de contrôle dans la physique réelle, une logique suivie par des systèmes comme GR00T N2, Pi-0 ou Helix. En supprimant cette étape coûteuse en calcul, DELE-w0.5 promet un entraînement moins cher et une inférence plus rapide, un enjeu concret pour les intégrateurs visant du contrôle temps réel sur du matériel embarqué limité. Si ces gains se confirment au-delà de ce papier, ils pourraient orienter la recherche vers des architectures plus légères fondées sur la prédiction d'états latents plutôt que sur la vidéo dense.

Il s'agit d'un travail de recherche en preprint, sans laboratoire ni entreprise nommés dans le résumé, et sans déploiement, partenariat ou pilote commercial annoncé. L'article s'inscrit dans la vague actuelle des World-Action Models combinant génération vidéo et prédiction d'action, un terrain disputé par des acteurs comme Figure (Helix), NVIDIA (GR00T N2) ou Physical Intelligence (Pi-0). Le taux de réussite de 62,5 % reste loin d'un niveau de fiabilité industrielle, même s'il dépasse nettement les références testées, et ces chiffres proviennent des auteurs eux-mêmes, sans validation indépendante ni revue par les pairs à ce jour. Aucune suite, aucun pilote ni intégration produit n'est mentionné dans l'article.

À lire aussi

E-TTS : un nouveau cadre de mise à l'échelle au moment de l'inférence pour la manipulation robotique
1arXiv cs.RO 

E-TTS : un nouveau cadre de mise à l'échelle au moment de l'inférence pour la manipulation robotique

Des chercheurs présentent sur arXiv (2606.27268, juin 2026) E-TTS, un cadre de mise à l'échelle à l'inférence (test-time scaling) pour la manipulation robotique, applicable en surcouche de modèles vision-language-action (VLA) existants sans réentraînement ni collecte de données supplémentaire. Le framework repose sur deux mécanismes : un échantillonnage conjoint raisonnement-action avec notation par paires, et un tampon d'historique (history buffer) qui stocke les observations passées pour contextualiser les décisions d'action. Contrairement aux méthodes TTS en boucle ouverte, E-TTS intègre du feedback durant l'inférence via un mécanisme de raffinement itératif en boucle fermée, piloté par des vérificateurs vision-langage. Les auteurs rapportent des gains jusqu'à 33,14 % en simulation et 26,62 % en conditions réelles, mesurés sur 4 benchmarks, 6 environnements, 3 morphologies de robots et 4 modèles VLA de base. L'enjeu est de transposer à la robotique ce qui a fonctionné pour les LLMs : amplifier les capacités à l'inférence sans modifier les poids du modèle. Le défi spécifique aux robots est que les tâches sont séquentielles et longues : une observation instantanée ne suffit pas pour choisir la bonne action, contrairement à une requête texte isolée. En partageant un buffer d'historique entre les modules de raisonnement et de vérification d'action, E-TTS comble un angle mort des méthodes TTS précédentes pour l'embodied AI. Le fait que le gain tienne en conditions réelles (26,62 %) et pas seulement en simulation est un signal positif sur le sim-to-real gap, même si les conditions exactes de ces expériences en monde réel méritent examen dans le papier complet. Le test-time scaling a émergé avec les architectures o1 et o3 d'OpenAI et les approches chain-of-thought pour les LLMs, avant d'être progressivement exploré pour les VLA robotiques. E-TTS s'inscrit dans ce mouvement que les auteurs eux-mêmes qualifient d'"early attempts", ce qui situe honnêtement le niveau de maturité. L'architecture modulaire et plug-and-play est conçue pour s'adapter à des VLA variés, ce qui pourrait faciliter l'adoption par des équipes travaillant sur des modèles comme pi0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA. Le papier ne mentionne ni déploiement industriel ni partenariat avec un constructeur de robots : il reste une preuve de concept académique dont la validation sur des tâches industrielles réelles (assemblage, palettisation) constituerait l'étape suivante naturelle.

💬 Ce qui change ici, c'est le buffer. Appliquer le test-time scaling à un robot, c'est pas aussi simple qu'à un LLM : un bras qui visse en étape 7 ne peut pas raisonner sur une observation instantanée, il lui faut les étapes précédentes pour contextualiser. Que les gains tiennent à 26 % en conditions réelles et pas seulement en sim, c'est le seul résultat qui compte pour l'instant.

IA physiqueOpinion
1 source
Échantillonnage guidé à l'inférence par un vérificateur de progression des tâches pour la manipulation robotique
2arXiv cs.RO 

Échantillonnage guidé à l'inférence par un vérificateur de progression des tâches pour la manipulation robotique

Une équipe de recherche publie TapSampling (arXiv:2605.25547, mai 2026), un cadre plug-and-play d'échantillonnage au moment de l'inférence pour la manipulation robotique. Là où la majorité des travaux du domaine cherchent à améliorer les performances en augmentant la taille des données d'entraînement ou des modèles, TapSampling explore un axe différent : l'exploitation du calcul disponible à l'inférence. Le système repose sur deux composants. D'abord, un Action-VAE qui projette les actions générées par la politique dans un espace latent de faible dimension via une distribution postérieure compressée, permettant de tirer un nombre arbitraire d'actions candidates approximant la distribution réelle. Ensuite, un vérificateur sémantique qui reformule la sélection d'actions comme une prédiction de progression de tâche (task-progress outcome prediction), en exploitant la structure séquentielle intrinsèque des jeux de données robotiques pour choisir l'action la plus prometteuse de façon interprétable. L'intérêt principal réside dans l'agnosticisme vis-à-vis de la politique sous-jacente : TapSampling s'applique sans fine-tuning additionnel à des modèles généralistes existants, qu'ils soient basés sur la diffusion ou sur des architectures autorégressives. Les expériences présentées en simulation et en conditions réelles montrent des améliorations qualifiées de « substantielles » sur plusieurs politiques généralistes, bien que l'abstract ne fournisse pas de chiffres précis de taux de réussite, ce qui invite à la prudence avant de juger de l'ampleur réelle des gains. Pour les ingénieurs robotique et les intégrateurs, l'approche ouvre la possibilité d'améliorer des politiques déjà déployées sans réentraînement, en ajoutant simplement un surcoût computationnel à l'inférence. Ce travail s'inscrit dans une tendance plus large consistant à transposer le test-time compute scaling, popularisé par les grands modèles de langage (OpenAI o1, DeepSeek-R1), vers la robotique embodied. D'autres approches comparables incluent le Best-of-N sampling avec des modèles de récompense appris séparément, ainsi que les méthodes de vérification intégrées dans des politiques comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA). TapSampling se distingue par un vérificateur ancré dans la progression de tâche plutôt que dans une récompense exogène, ce qui lui confère une meilleure lisibilité sémantique. Le code et les modèles sont mis à disposition via la page projet des auteurs, ce qui permettra une reproduction et une évaluation indépendante des résultats annoncés.

IA physiqueActu
1 source
PhysMem : mise à l'échelle de la mémoire physique pour la manipulation robotique
3arXiv cs.RO 

PhysMem : mise à l'échelle de la mémoire physique pour la manipulation robotique

PhysMem, un cadre mémoire présenté sur arXiv (identifiant 2502.20323, version 5 actualisée au printemps 2026), propose une approche permettant aux planificateurs robotiques basés sur des modèles vision-langage (VLM) d'acquérir des connaissances physiques au moment de l'exécution, sans modifier les paramètres du modèle. Le système enregistre les interactions, génère des hypothèses sur les propriétés physiques observées, les soumet à vérification par des gestes ciblés, puis n'intègre que les hypothèses validées pour guider les décisions futures. Évalué sur trois tâches de manipulation réelle et des benchmarks de simulation avec quatre architectures VLM distinctes, PhysMem atteint 76 % de succès sur une tâche contrôlée d'insertion de brique, contre 23 % pour une récupération directe d'expérience. Sur des sessions de déploiement de 30 minutes, les performances progressent de façon consistante au fil du temps. L'apport central de PhysMem réside dans la séparation entre récupération et vérification. Les approches classiques de mémoire épisodique supposent que les expériences passées s'appliquent directement à la situation courante, ce qui produit des échecs dès que les conditions physiques changent, même marginalement. PhysMem brise ce cycle en testant activement chaque hypothèse avant de l'exploiter, une propriété critique pour les environnements industriels où surfaces, matériaux et tolérances varient d'un poste à l'autre. Pour les intégrateurs et les décideurs B2B, cela ouvre la voie à des robots capables de s'adapter à de nouveaux objets ou environnements sans cycle de réentraînement coûteux. L'écart de 53 points de pourcentage entre les deux modes illustre que le problème n'est pas la mémoire en soi, mais la rigidité de son application directe. Les VLM comme planificateurs robotiques ont été popularisés par des travaux comme SayCan (Google DeepMind), Code as Policies, ou plus récemment pi0 de Physical Intelligence, qui ont démontré une capacité de raisonnement abstrait sur les tâches. Leur limite persistante reste l'incapacité à modéliser les propriétés physiques spécifiques d'objets particuliers, un obstacle majeur à la généralisation hors laboratoire. PhysMem s'inscrit dans un mouvement plus large vers le test-time adaptation en robotique, distinct du fine-tuning classique et complémentaire des approches VLA (Vision-Language-Action). À noter: les résultats publiés portent sur des tâches de laboratoire contrôlées, et aucun déploiement industriel n'est annoncé à ce stade. Les suites logiques incluent des tests sur des horizons de déploiement plus longs et des tâches impliquant des objets déformables ou des matériaux à comportement incertain, là où les hypothèses physiques sont les plus difficiles à abstraire.

IA physiquePaper
1 source
SLIM-0.5B : apprentissage de représentations latentes prédictives ancrées dans l'action pour la manipulation robotique
4arXiv cs.RO 

SLIM-0.5B : apprentissage de représentations latentes prédictives ancrées dans l'action pour la manipulation robotique

Optimisée pour le contrôle plutôt que pour la richesse visuelle, une nouvelle politique vision-langage-action baptisée SLIM (Self-supervised Latent Interaction Model) vient d'être présentée dans un article publié le 11 août 2026 sur arXiv (arXiv:2608.09771v1). Développée pour la manipulation robotique, SLIM ne compte que 0,5 milliard de paramètres, un ordre de grandeur en dessous des backbones multimodaux massifs habituellement utilisés par les modèles VLA de référence. Le système apprend des représentations latentes ancrées dans l'action, capables à la fois de prédire les transitions futures conditionnées par une action et d'inférer l'action ayant produit un changement observé. L'entraînement repose sur une prédiction de trajectoire masquée auto-supervisée, combinant reconstruction d'action et prédiction de latent futur, le tout porté par une architecture compacte de type Mixture-of-Transformers (MoT) qui modélise les interactions entre latents d'observation et tokens d'action. La génération d'action conditionnée par le langage utilise ensuite le flow matching. Selon les auteurs, SLIM égale ou dépasse des baselines VLA et des modèles monde-action à grande échelle sur des benchmarks en simulation et en conditions réelles, sans pré-entraînement embarqué supplémentaire. L'intérêt pour les intégrateurs et décideurs industriels tient moins à la performance brute qu'à l'efficacité: les auteurs revendiquent une latence d'inférence réduite et une empreinte mémoire GPU nettement plus faible que les architectures VLA massives actuelles. Cela répond directement à une critique récurrente du secteur, à savoir que les backbones multimodaux surdimensionnés consacrent l'essentiel de leur capacité à une sémantique ouverte peu utile au contrôle moteur continu, alors que la manipulation robotique nécessite surtout des représentations compactes des observations, actions et transitions. Si les résultats se confirment au-delà des benchmarks académiques, cela ouvrirait la voie à des politiques VLA déployables sur du matériel embarqué moins coûteux, un enjeu direct pour l'industrialisation des humanoïdes et bras robotiques dont le calcul embarqué reste un goulot d'étranglement économique. SLIM se positionne comme alternative aux modèles monde pixel-level, jugés coûteux car ils prédisent des détails visuels non pertinents pour le contrôle, ainsi qu'aux grandes politiques VLA généralistes du type Pi-0 ou GR00T N2. L'article ne précise pas de partenariat industriel, de date de déploiement pilote ni d'acteur commercial associé: il s'agit à ce stade d'une contribution de recherche publiée en preprint, sans validation industrielle indépendante ni comparaison chiffrée détaillée avec les principales baselines nommées dans le texte.

IA physiqueActu
1 source