Aller au contenu principal
SlotVLA : vers la modélisation des représentations objet-relation pour la manipulation robotique
IA physiquearXiv cs.RO 

SlotVLA : vers la modélisation des représentations objet-relation pour la manipulation robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent dans un preprint arXiv (2511.06754v3, troisième révision, mai 2026) SlotVLA, un framework de manipulation robotique multitatches qui repose sur des représentations centrées sur les objets et leurs relations plutôt que sur les plongements denses utilisés par la majorité des modèles VLA actuels. L'architecture combine trois composants : un tokeniseur visuel à slots qui maintient des représentations temporellement cohérentes pour chaque objet détecté dans la scène, un décodeur centré sur les relations entre objets pour produire des embeddings pertinents à la tâche, et un module LLM qui traduit ces embeddings en séquences d'actions exécutables. En parallèle, les auteurs publient LIBERO+, un benchmark de manipulation dérivé du jeu de données LIBERO existant, enrichi d'annotations objet-centriques au niveau des boîtes englobantes et des masques de segmentation, ainsi qu'un suivi temporel des instances entre frames. Les expériences conduites sur LIBERO+ montrent que les représentations à slots réduisent significativement le nombre de tokens visuels nécessaires tout en conservant des performances de généralisation comparables aux baselines denses.

L'intérêt principal de cette approche réside dans la tension qu'elle adresse directement : les VLAs déployés à ce jour (Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA, Helix de Figure) s'appuient sur des encodeurs visuels qui traitent la scène comme un champ dense, sans distinction explicite entre objets manipulables et arrière-plan. Cette architecture entraîne une redondance computationnelle et rend difficile l'audit du raisonnement du modèle, ce qui freine l'adoption industrielle dans des contextes certifiables. SlotVLA propose que des représentations structurées, inspirées de la cognition humaine sur les objets discrets, puissent constituer une base plus efficace et interprétable pour le contrôle visuomoteur. La réduction du nombre de tokens visuels est un levier concret de coût d'inférence pour des systèmes embarqués ou des flottes de robots. Il convient toutefois de noter que les résultats présentés restent confinés à l'environnement simulé LIBERO+ : aucune validation physique sur robot réel n'est rapportée dans ce preprint, ce qui laisse ouverte la question du sim-to-real gap pour ce type de représentation.

Cette publication s'inscrit dans un courant actif de recherche sur les architectures objet-centriques pour la robotique, dont les travaux fondateurs incluent les modèles de slot attention de Locatello et al. (2020) et les approches OCRL. LIBERO avait déjà été introduit comme benchmark multitatches pour la manipulation, mais sans annotations objet-centriques fines : LIBERO+ vient combler ce manque pour faciliter l'évaluation comparative de ce type de représentation. Sur le plan concurrentiel, les laboratoires académiques (notamment ceux liés à CMU, Berkeley, Stanford) et industriels travaillent en parallèle sur des architectures plus interprétables pour répondre aux demandes croissantes de traçabilité dans l'automatisation industrielle. Les prochaines étapes naturelles seront la validation sim-to-real sur des plateformes physiques standard (Franka, UR, ou humanoïdes) et l'intégration dans des pipelines de fine-tuning avec des modèles fondateurs publics.

À lire aussi

Représentations centrées sur l'objet pour une meilleure généralisation en manipulation robotique
1arXiv cs.RO 

Représentations centrées sur l'objet pour une meilleure généralisation en manipulation robotique

Des chercheurs ont publié sur arXiv (2601.21416v2) une étude comparative sur les représentations visuelles utilisées pour entraîner des politiques de manipulation robotique. Le problème central : les robots peinent à généraliser lorsque les conditions visuelles changent, éclairage, textures ou présence d'objets parasites dans la scène. L'équipe a évalué trois familles de représentations extraites d'encodeurs pré-entraînés : les features globales (image résumée en un seul vecteur agrégé), les features denses (embedding par patch issu de la dernière couche de l'encodeur), et une approche intermédiaire baptisée SBOCR (Slot-Based Object-Centric Representations), qui regroupe ces features denses en un nombre fini d'entités "objet-like" via un mécanisme de slots. Testées sur une batterie de tâches de manipulation en simulation et en conditions réelles, allant de scénarios simples à complexes, les politiques SBOCR surpassent les deux autres familles en termes de généralisation, sans pré-entraînement spécifique à la tâche. Ce résultat intéresse directement les intégrateurs et équipes R&D en robotique : la principale cause d'échec en déploiement n'est pas la commande moteur, mais la robustesse perceptuelle aux conditions non vues à l'entraînement. Les features globales sacrifient le détail spatial ; les features denses transmettent trop d'information non pertinente (fond, reflets, distracteurs), dégradant la politique hors distribution. SBOCR agit comme un filtre structuré : en segmentant implicitement la scène en objets discrets, la représentation réduit le bruit transmis à la politique sans perdre les informations nécessaires à l'exécution de la tâche. C'est un signal significatif pour les architectures VLA (Vision-Language-Action), et cela valide empiriquement que la structure objet-centrique améliore la robustesse aux shifts visuels sans supervision supplémentaire. Ce travail s'inscrit dans la lignée des Slot Attention (Locatello et al., Google Brain, 2020). Dans le paysage concurrent, les politiques VLA majeures comme Pi-0 (Physical Intelligence) et GR00T N2 (NVIDIA) s'appuient majoritairement sur des features denses issues de ViT ou CLIP, sans structuration objet explicite. La question de l'intégration de SBOCR dans des architectures transformer de grande taille reste ouverte, notamment sur le plan du coût computationnel. Il s'agit d'un preprint arXiv sans évaluation par les pairs publiée à ce jour ; la scalabilité à des environnements industriels complexes, multi-objets et à fortes occlusions, reste à confirmer.

💬 Le problème de généralisation en robotique, c'est pas les moteurs, c'est la perception hors distribution. SBOCR montre qu'en structurant la scène en objets discrets plutôt qu'en features brutes, on gagne en robustesse visuelle sans aucun ré-entraînement spécifique. Pi-0 et GR00T N2 s'appuient encore sur des features denses, et si ce résultat tient à plus grande échelle, c'est un angle mort de design qu'il va falloir corriger.

IA physiqueOpinion
1 source
Représentation continue des trajectoires pour la manipulation robotique
2arXiv cs.RO 

Représentation continue des trajectoires pour la manipulation robotique

Une équipe de recherche publie sur arXiv (arXiv:2608.24111v1, soumis en août 2026) un nouveau framework baptisé CAT, pour "trajectory-level continuous Action representation", destiné aux politiques de manipulation robotique visuomotrices. Le principe consiste à encoder les trajectoires d'action sur un intervalle temporel fixe en un ensemble de tokens latents continus, plutôt que de lier la représentation à la fréquence de contrôle du robot ou à des paramétrisations temporelles prédéfinies, comme le font la plupart des systèmes actuels. Les auteurs ajoutent un positional encoding "frequency-aware" qui crée un système de coordonnées temporelles partagé, quelle que soit la cadence de contrôle, ainsi qu'une régularisation au niveau trajectoire pour stabiliser l'espace latent. Les évaluations ont porté sur les benchmarks de simulation LIBERO et MimicGen, ainsi que sur des tâches réelles de manipulation à long horizon. Résultat annoncé: les politiques basées sur CAT surpassent de façon constante les baselines par quantification vectorielle (VQ) et les baselines visuomotrices continues concurrentes, à conditions d'entraînement identiques, sur plusieurs backbones de modèle et plusieurs fréquences de contrôle. Le papier cible un problème concret pour les politiques vision-langage-action: coupler la représentation d'action à la fréquence d'échantillonnage produit soit de la redondance à haute cadence, soit une perte de finesse sur les mouvements critiques à basse cadence. En découplant les deux, CAT ouvre une piste pour rendre un même modèle de manipulation plus facilement transférable entre plateformes robotiques opérant à des cadences différentes, un enjeu direct pour les intégrateurs qui doivent déployer une politique sur des bras, mains ou humanoïdes hétérogènes. Dans la course aux modèles fondation pour la robotique, aux côtés de Pi-0, GR00T N2 ou Helix, ce travail confirme que l'architecture de la tête d'action devient un terrain de différenciation aussi disputé que le backbone vision-langage. Reste que les gains sont mesurés surtout en simulation (LIBERO, MimicGen), les résultats réels n'étant pas quantifiés dans le résumé, ce qui appelle une lecture prudente avant extrapolation. Ce travail s'inscrit dans la lignée des recherches sur l'apprentissage par imitation en robotique, où s'opposaient jusqu'ici la quantification vectorielle des trajectoires et les représentations continues à fenêtre fixe type Action Chunking Transformer ou politiques de diffusion. Aucun industriel ni partenariat commercial n'est cité: il s'agit d'une contribution académique, sans calendrier de déploiement annoncé. Sa diffusion suivra vraisemblablement la voie classique de ce type de recherche, adoption dans des frameworks open-source de politiques robotiques, puis, en cas de confirmation des gains, intégration possible dans des piles VLA commerciales.

IA physiqueActu
1 source
SLIM-0.5B : apprentissage de représentations latentes prédictives ancrées dans l'action pour la manipulation robotique
3arXiv cs.RO 

SLIM-0.5B : apprentissage de représentations latentes prédictives ancrées dans l'action pour la manipulation robotique

Optimisée pour le contrôle plutôt que pour la richesse visuelle, une nouvelle politique vision-langage-action baptisée SLIM (Self-supervised Latent Interaction Model) vient d'être présentée dans un article publié le 11 août 2026 sur arXiv (arXiv:2608.09771v1). Développée pour la manipulation robotique, SLIM ne compte que 0,5 milliard de paramètres, un ordre de grandeur en dessous des backbones multimodaux massifs habituellement utilisés par les modèles VLA de référence. Le système apprend des représentations latentes ancrées dans l'action, capables à la fois de prédire les transitions futures conditionnées par une action et d'inférer l'action ayant produit un changement observé. L'entraînement repose sur une prédiction de trajectoire masquée auto-supervisée, combinant reconstruction d'action et prédiction de latent futur, le tout porté par une architecture compacte de type Mixture-of-Transformers (MoT) qui modélise les interactions entre latents d'observation et tokens d'action. La génération d'action conditionnée par le langage utilise ensuite le flow matching. Selon les auteurs, SLIM égale ou dépasse des baselines VLA et des modèles monde-action à grande échelle sur des benchmarks en simulation et en conditions réelles, sans pré-entraînement embarqué supplémentaire. L'intérêt pour les intégrateurs et décideurs industriels tient moins à la performance brute qu'à l'efficacité: les auteurs revendiquent une latence d'inférence réduite et une empreinte mémoire GPU nettement plus faible que les architectures VLA massives actuelles. Cela répond directement à une critique récurrente du secteur, à savoir que les backbones multimodaux surdimensionnés consacrent l'essentiel de leur capacité à une sémantique ouverte peu utile au contrôle moteur continu, alors que la manipulation robotique nécessite surtout des représentations compactes des observations, actions et transitions. Si les résultats se confirment au-delà des benchmarks académiques, cela ouvrirait la voie à des politiques VLA déployables sur du matériel embarqué moins coûteux, un enjeu direct pour l'industrialisation des humanoïdes et bras robotiques dont le calcul embarqué reste un goulot d'étranglement économique. SLIM se positionne comme alternative aux modèles monde pixel-level, jugés coûteux car ils prédisent des détails visuels non pertinents pour le contrôle, ainsi qu'aux grandes politiques VLA généralistes du type Pi-0 ou GR00T N2. L'article ne précise pas de partenariat industriel, de date de déploiement pilote ni d'acteur commercial associé: il s'agit à ce stade d'une contribution de recherche publiée en preprint, sans validation industrielle indépendante ni comparaison chiffrée détaillée avec les principales baselines nommées dans le texte.

IA physiqueActu
1 source
STARRY : modélisation du monde centrée sur l'action spatio-temporelle pour la manipulation robotique
4arXiv cs.RO 

STARRY : modélisation du monde centrée sur l'action spatio-temporelle pour la manipulation robotique

Des chercheurs ont publié sur arXiv (arXiv:2604.26848) un nouveau modèle de politique robotique appelé STARRY, conçu pour améliorer la manipulation d'objets en intégrant un module de prédiction spatiotemporelle directement dans la boucle de génération d'actions. L'architecture repose sur un débruitage conjoint de latents spatiotemporels futurs et de séquences d'actions, complété par un mécanisme baptisé Geometry-Aware Selective Attention Modulation (GASAM), qui convertit la profondeur prédite et la géométrie de l'effecteur terminal en poids d'attention alignés sur les tokens d'action. Sur le benchmark RoboTwin 2.0, STARRY atteint 93,82 % de taux de succès moyen en configuration propre (Clean) et 93,30 % en configuration aléatoire (Randomized). En conditions réelles, le modèle améliore le taux de succès de 42,5 % à 70,8 % par rapport à π0.5, la politique de référence de Physical Intelligence. Ce résultat en conditions réelles mérite attention : le delta de +28,3 points sur π0.5 suggère que l'intégration explicite de la structure spatiotemporelle dans la politique, plutôt qu'en post-traitement, apporte un gain concret au-delà du benchmark simulé. Pour les intégrateurs et décideurs industriels, c'est un signal que le sim-to-real gap sur des tâches de manipulation précise reste un vrai verrou, et que les architectures VLA (Vision-Language-Action) classiques, sans modélisation de l'interaction future, plafonnent sur les scénarios à forte contrainte géométrique. La distinction entre prédire le monde et prédire ce qui est pertinent pour l'action semble être la clé ici, ce que STARRY formalise avec GASAM. STARRY s'inscrit dans une compétition dense autour des politiques VLA pour la manipulation : π0 et π0.5 (Physical Intelligence), GR00T N2 (NVIDIA), OpenVLA, et les travaux issus des labos de Stanford, CMU ou Berkeley. Le benchmark RoboTwin 2.0, utilisé comme terrain d'évaluation principal, est un environnement de simulation récent orienté tâches bimanuelles. Il convient de noter que cette publication est un preprint arXiv, sans revue par les pairs à ce stade, et que les expériences réelles décrites semblent limitées en nombre de tâches et de contextes. Les prochaines étapes naturelles seraient une évaluation sur des benchmarks plus diversifiés comme LIBERO ou Open X-Embodiment, et une validation à plus grande échelle en environnement industriel réel.

IA physiqueOpinion
1 source