Aller au contenu principal
GaussMemory : mémoire de scène en gaussiennes 3D pilotée par la tâche pour la manipulation robotique à long horizon
RecherchearXiv cs.RO 

GaussMemory : mémoire de scène en gaussiennes 3D pilotée par la tâche pour la manipulation robotique à long horizon

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Un article de recherche publie sur arXiv le 18 aout 2026 (référence 2608.14986v1) présente GaussMemory, un système de mémoire spatiale pour la manipulation robotique a long horizon, construit sur le 3D Gaussian Splatting comme substrat géométrique persistant. A la différence des mémoires 3D existantes, qui enregistrent les observations selon des règles fixes en traitant chaque élément de la scene avec la même importance, GaussMemory apprend de bout en bout quels objets suivre précisément, a quelle fréquence les mettre a jour et quoi oublier. Sur les bancs d'essai LIBERO et VLABench, il depasse le système MemoryVLA sur les taches Goal et Long-10, et surpasse le modèle π0-FAST de 5,2 points sur la piste 1 et de 6,0 points sur la piste 6.

Le problème vise est bien connu du secteur: les architectures vision-langage-action mémorisent généralement l'environnement de façon passive, sans distinguer ce qui compte pour la tache en cours, ce qui dégradé les performances des que les séquences de manipulation s'allongent. En unifiant mise a jour et lecture de la mémoire dans un seul mécanisme appris plutôt que des heuristiques écrites a la main, GaussMemory s'inscrit dans une tendance de fond visant a faire passer les VLA de démonstrations courtes en laboratoire vers des taches multi-étapes plus proches des besoins industriels réels. Pour les intégrateurs qui évaluent des piles VLA, des gains chiffres sur des benchmarks standardises comme LIBERO et VLABench offrent un point de comparaison plus solide qu'une simple vidéo de démonstration.

Le travail se positionne explicitement face a deux références du domaine, MemoryVLA et π0-FAST, ce dernier dérivé du modèle π0 de Physical Intelligence, citées comme bases de comparaison directes plutôt que comme simples antécédents. Il s'inscrit dans la lignée des travaux sur le 3D Gaussian Splatting, technique de représentation de scènes issue de la vision par ordinateur, de plus en plus réutilisée comme mémoire de travail pour des agents robotiques. A ce stade, il s'agit d'une publication de recherche évaluée uniquement en simulation, sans déploiement matériel annonce ni partenaire industriel cite, et sans calendrier donne pour un transfert vers des robots physiques, ce qui distingue clairement cette contribution d'une annonce produit ou d'un pilote commercial.

À lire aussi

NativeMEM : compression native de la mémoire pour la manipulation robotique long horizon
1arXiv cs.RO 

NativeMEM : compression native de la mémoire pour la manipulation robotique long horizon

Des chercheurs présentent, dans un preprint publié sur arXiv début juillet 2026, NativeMEM, une politique Vision-Language-Action (VLA) dotée d'une mémoire longue durée mise à jour en temps réel. Le cœur du système, baptisé Native Memory Compression, réutilise l'encodeur visuel du VLA lui-même pour compresser chaque image historique de chaque caméra en un unique token, ajouté à la séquence d'entrée du modèle. Cette approche permet au VLA préentraîné d'exploiter un historique long avec un surcoût de latence négligeable, sans planificateur externe ni module mémoire réinitialisé à part. L'entraînement se fait en deux temps : d'abord un tokenizer de mémoire générique, entraîné sous la supervision d'un VLA gelé sur des données exigeantes en mémoire, puis un dégel complet du modèle pour un fine-tuning spécifique à la tâche. Les résultats annoncés sont marqués : le taux de réussite passe de 32,4% à 84,0% en simulation, et grimpe jusqu'à 98,7% sur robots réels, avec une latence d'inférence et une consommation GPU maîtrisées. Le système atteint aussi des performances comparables aux méthodes précédentes en n'utilisant que 20% des données d'entraînement. L'enjeu adressé est concret pour la manipulation robotique longue horizon, un point dur reconnu du secteur : les VLA préentraînés peinent à retenir un historique visuel étendu à haute fréquence de mise à jour sans sacrifier leur réactivité, et les solutions de gestion mémoire externe existantes limitent soit l'horizon temporel, soit la vitesse de réaction. Que la compression tienne dans l'encodeur visuel déjà présent, sans architecture séparée, va à l'encontre de l'hypothèse répandue qu'une mémoire longue nécessite un module dédié coûteux à entraîner. Le saut de performance observé, notamment sur robots réels et non seulement en simulation, est le signal à surveiller pour les intégrateurs qui cherchent à dépasser les tâches courtes et réactives. Ce travail s'inscrit dans la vague de recherche actuelle sur les architectures VLA à mémoire pour la manipulation robotique, un axe activement exploré en parallèle des efforts de robots humanoïdes commerciaux. Le papier n'ayant pas encore été relu par les pairs, ses chiffres restent à confirmer par des évaluations indépendantes ; les prochaines étapes attendues concernent la généralisation à davantage de plateformes robotiques et de tâches multi-étapes en conditions réelles.

RechercheActu
1 source
LIFD : diffusion ancrée pour une mémoire de scène 3D dans la manipulation robotique
2arXiv cs.RO 

LIFD : diffusion ancrée pour une mémoire de scène 3D dans la manipulation robotique

Un article de recherche publié sur arXiv (arXiv:2609.19796v1) présente LIFD (Look, Imagine, Focus, and Do), un système de mémoire de scène tridimensionnelle persistante destiné à la manipulation robotique en conditions d'observabilité partielle, c'est-à-dire lorsque des zones vues par le robot sortent du champ de la caméra à mesure qu'il ou la scène se déplace. Le système apprend une représentation en tokens de scène à partir d'un accord multi-vues, puis la complète en déploiement à partir d'une seule image RGB et d'une mémoire récurrente, grâce à un modèle de rectified-flow combiné à un mécanisme d'attention croisée guidée par des ancrages géométriques. Sur les bancs d'essai de simulation LIBERO et MetaWorld, la version dite "Staged" de LIFD atteint respectivement 91,6% et 79,8% de taux de réussite moyen, avec un gain de 3,1 points de pourcentage sur LIBERO par rapport à un entraînement joint classique. Sur un bras robotique réel UR5e, testé sur quatre familles de tâches avec seulement dix démonstrations par famille, LIFD obtient 56,0% de réussite moyenne contre 40,5% pour OpenVLA-7B, un modèle vision-langage-action de référence dans le secteur. Ce résultat s'attaque à une limite connue des politiques de manipulation actuelles: la plupart des architectures VLA raisonnent sur la vue courante et perdent la trace des objets ou surfaces qui sortent du cadre, ce qui fragilise les tâches nécessitant de se souvenir d'un état antérieur de la scène. En montrant qu'une mémoire de scène compacte peut être inférée à partir d'une unique caméra RGB et de la proprioception au moment du déploiement, sans capteurs multi-vues ni LIDAR embarqués, LIFD répond à une contrainte très concrète pour les intégrateurs: le coût et la complexité du capteur. L'écart de performance avec OpenVLA-7B en régime few-shot (dix démonstrations) est aussi un signal pour les décideurs B2B, car il suggère qu'une mémoire spatiale explicite peut compenser en partie le besoin de données massives, un frein habituel à l'adoption des VLA en environnement industriel réel. Sur le plan méthodologique, LIFD s'appuie sur un entraînement en deux temps: une phase de représentation supervisée par des signaux multi-vues et géométriques, suivie d'une politique de manipulation reliée à cette représentation via des "slot features" compactes. Les auteurs comparent explicitement deux régimes d'entraînement, "Staged" et "Joint", le premier se révélant supérieur, et positionnent leur approche face à OpenVLA-7B comme référence VLA open-source établie. Il s'agit à ce stade d'un travail de recherche publié en preprint, validé sur des simulateurs standards du domaine (LIBERO, MetaWorld) et un unique bras collaboratif UR5e en laboratoire, sans annonce de pilote industriel ni de calendrier de déploiement à plus grande échelle.

RecherchePaper
1 source
2AM : ancrer la mémoire de l'agent pour guider des modèles d'action pilotables en manipulation à long horizon
3arXiv cs.RO 

2AM : ancrer la mémoire de l'agent pour guider des modèles d'action pilotables en manipulation à long horizon

Publiée le 11 septembre 2026 sur arXiv sous la référence 2609.11308, une nouvelle architecture baptisée 2AM propose une autre méthode pour la manipulation robotique à long horizon, ces tâches multi-étapes qui exigent de se souvenir de ce qui a déjà été fait. Le système sépare strictement deux rôles : un agent multimodal conserve seul la mémoire de la tâche et traduit l'historique des interactions en instructions de sous-tâches en langage naturel, complétées par des indices optionnels en 2D (points de préhension, de dépose et de déplacement) ; un modèle d'action unique, basé uniquement sur des images RGB et sans état interne entre les épisodes, exécute le mouvement. Pour le rendre pilotable, les auteurs ont enrichi les démonstrations d'étiquettes d'indices structurées et entraîné le modèle avec abandon aléatoire de conditions, bruit spatial et décalage temporel, afin qu'il tolère des instructions imparfaites. Testé sur le benchmark LIBERO-Mem, sans profondeur, sans géométrie calculée en ligne ni déplacement d'objets planifié, 2AM atteint un taux de complétion moyen de 76,3 %, contre 14,8 % pour la meilleure référence publiée à ce jour, soit un gain de 61,5 points, avec 63,0 % de réussite au sens large et 11,8 % au sens strict. Ce résultat vise un problème méthodologique récurrent des systèmes agentiques actuels, qui combinent souvent des modèles vision-langage-action (VLA) avec planificateurs et outils géométriques, parfois appuyés par de la profondeur ou une géométrie calibrée : il devient difficile de savoir si les gains viennent d'observations plus riches, d'outils moteurs alternatifs ou de la politique elle-même, et si les échecs viennent de la politique ou d'une interface langagière mal spécifiée. En réduisant volontairement la panoplie d'outils au profit d'une interface à plus haute bande passante entre agent et modèle d'action, 2AM isole la variable de précision du pilotage. Le résultat suggère que la mémoire de tâche peut rester entièrement côté agent, sans être intégrée dans la politique d'action, un choix opposé à la tendance qui consiste à faire porter mémoire et raisonnement par un seul grand modèle entraîné de bout en bout. Pour les équipes qui développent des modèles d'action génératifs comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure AI, ce travail introduit une hypothèse alternative : la capacité effective d'un modèle dépendrait autant de la précision avec laquelle il est piloté que de ce qu'il a appris à l'entraînement, ce qui interroge la course actuelle aux VLA toujours plus massifs. Le travail s'inscrit dans la lignée des benchmarks LIBERO, largement utilisés en apprentissage de politiques robotiques, dont LIBERO-Mem constitue une extension dédiée aux tâches à mémoire longue. Il se positionne en creux face aux architectures dominantes du secteur, qui empilent VLA, planificateurs symboliques et perception 3D pour gérer des séquences de manipulation complexes, une approche que la publication critique implicitement pour son opacité dans l'attribution des performances. Aucun déploiement matériel réel n'est mentionné : les résultats restent circonscrits à la simulation et au benchmark, sans validation sur robot physique ni pilote industriel annoncé. L'affiliation institutionnelle des auteurs et un calendrier de suite ne sont pas précisés, ce qui situe cette publication au stade de la recherche amont plutôt que d'un produit ou d'un partenariat commercial.

RechercheActu
1 source
IA incarnée sûre pour les tâches à long horizon : une analyse multi-couches de la manipulation robotique
4arXiv cs.RO 

IA incarnée sûre pour les tâches à long horizon : une analyse multi-couches de la manipulation robotique

Une équipe de chercheurs publie sur arXiv (identifiant 2606.05660, juin 2026) une revue systématique de la sécurité dans les systèmes d'IA incarnée (embodied AI) appliqués à la manipulation robotique à long horizon. Ce survey structure la littérature selon trois niveaux d'intervention : la sécurité au stade de la planification (planning-time), au niveau de la politique de contrôle (policy-time) et pendant l'exécution (execution-time). Les auteurs identifient quatre vecteurs de risque pouvant s'accumuler dans un même système en boucle fermée : le misgrounding sémantique (l'agent interprète mal l'instruction de haut niveau), la propagation d'erreur entre sous-tâches, la dérive d'exécution (execution drift) et les risques physiques liés aux contacts. Ils distinguent par ailleurs trois catégories de garanties dans la littérature existante : formelles, statistiques et heuristiques empiriques, et concluent que les preuves formelles font défaut à chaque couche. L'enjeu est direct pour les intégrateurs et les décideurs industriels. Un bras robotique déployé en entrepôt ou en ligne de production enchaîne des dizaines d'actions sur des horizons temporels étendus, et chaque sous-tâche peut propager silencieusement une erreur vers les suivantes. Or le survey révèle que la sécurité au niveau de la politique de contrôle, au coeur même des modèles VLA (Vision-Language-Action) comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, est la couche la moins documentée empiriquement. Les mécanismes d'intervention déclenchés par l'incertitude (uncertainty-triggered intervention) restent immatures, et les benchmarks spécifiques à la sécurité en manipulation longue durée sont quasi-inexistants, ce qui rend toute validation rigoureuse avant déploiement aujourd'hui difficile. Ce travail paraît dans un contexte d'accélération industrielle : Figure AI, Boston Dynamics, Unitree et Physical Intelligence multiplient les démonstrations de manipulation dextère, souvent en conditions semi-contrôlées, alimentant un écart potentiel entre annonces marketing et réalité opérationnelle. Il convient de souligner que ce papier est une analyse critique de l'existant, pas un nouveau système ou algorithme. Ses recommandations prioritaires portent sur trois axes : des assurances cross-couche cohérentes de la planification jusqu'à l'exécution physique, des benchmarks dédiés à la sécurité en manipulation longue durée, et des protocoles de déploiement progressifs pour les agents robotiques en environnements réels. En creux, le constat est que les capacités du secteur progressent plus vite que les outils pour en évaluer la sécurité.

UEL'absence de benchmarks formels de sécurité pour la manipulation longue durée concerne directement les industriels européens déployant des bras robotisés, et pourrait alimenter les exigences de validation dans le cadre de l'AI Act pour les systèmes robotiques à haut risque.

RecherchePaper
1 source