Aller au contenu principal
Gaussian Splatting anticipatif pour la représentation 3D prédictive en prise-et-dépose guidée par le langage
RecherchearXiv cs.RO 

Gaussian Splatting anticipatif pour la représentation 3D prédictive en prise-et-dépose guidée par le langage

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a proposé sur arXiv (arXiv:2605.11144, mai 2026) un framework baptisé Forecast-GS (Forecast-aware Gaussian Splatting), destiné à la manipulation robotique guidée par le langage naturel. La contribution centrale consiste à modéliser explicitement l'état final attendu d'une tâche via une reconstruction 3D prédictive par Gaussian Splatting, plutôt que de raisonner uniquement sur la configuration courante de la scène. Validé sur trois tâches réelles de pick-and-place (cutter-vers-boîte, pomme-vers-bol, éponge-vers-plateau), le système atteint des taux de succès de 84 % (21/25), 92 % (23/25) et 64 % (16/25) en sélection automatique, contre 60 %, 76 % et 40 % pour la baseline ReKep (Relational Keypoint Constraints). En mode assisté par un opérateur humain pour le classement des candidats, les taux montent à 92 %, 96 % et 76 %, chaque condition étant testée sur 25 essais réels avec configurations initiales variées sur la même plateforme robotique.

L'enjeu pratique est le suivant : la plupart des systèmes de manipulation actuels évaluent si une action est faisable depuis l'état présent, sans vérifier si l'état résultant satisfait l'objectif sémantique. Forecast-GS génère une prévision 3D de la scène post-action, que le robot compare à l'instruction en langage naturel avant d'exécuter, ce qui réduit les erreurs en présence d'observations partielles ou d'occlusions. Pour un intégrateur industriel, l'interprétabilité de ce mécanisme, contrairement aux politiques VLA end-to-end comme Pi-0 (Physical Intelligence) ou GR00T N2 (NVIDIA), facilite le débogage et la traçabilité. L'écart persistant entre mode automatique et assisté (jusqu'à 12 points de taux de succès) indique cependant que le ranking final des candidats n'est pas encore un problème résolu.

Le Gaussian Splatting, introduit en 2023 par Kerbl et al. à SIGGRAPH, a été rapidement adopté en robotique pour ses représentations 3D différentiables et compactes. Forecast-GS s'inscrit dans un courant qui hybride représentations neuronales 3D et planification guidée par le langage, en compétition directe avec ReKep (Stanford/Berkeley), SpatialVLA, et les approches VLA génératives. Aucun partenariat industriel ni calendrier de déploiement n'est mentionné dans la publication. Les prochaines étapes logiques portent sur l'amélioration du classement automatique, principal goulot d'étranglement vers l'autonomie complète, et sur l'extension à des scènes dynamiques plus complexes que les configurations statiques de laboratoire utilisées ici.

À lire aussi

VistaVLA : modèle vision-langage-action fondé sur du 3D gaussian splatting conscient de la géométrie et de la sémantique, pour la manipulation robotique
1arXiv cs.RO 

VistaVLA : modèle vision-langage-action fondé sur du 3D gaussian splatting conscient de la géométrie et de la sémantique, pour la manipulation robotique

VistaVLA, présenté dans un article arXiv publié le 15 juillet 2026, est un nouveau framework de manipulation robotique combinant vision, langage et action (VLA) qui construit une représentation 3D explicite de la scène à partir de primitives de Gaussiennes 3D. Contrairement aux modèles VLA classiques qui projettent directement instructions textuelles et images 2D vers des actions, VistaVLA fonctionne en deux étapes : il élève des caractéristiques vision-langage multi-vues en primitives gaussiennes 3D, créant des tokens sémantiques ancrés géométriquement, puis les compresse via un mécanisme baptisé Merge-then-Query (MtQ). Ce module réduit de 99% le nombre de tokens nécessaires tout en préservant les informations spatiales et sémantiques utiles à l'action. Les auteurs rapportent des gains de 22,8% du taux de réussite sur sept tâches réelles, et de 30% par rapport à la baseline VLA-Adapter sur des tâches hors distribution (out-of-distribution), en environnement simulé comme réel. Pour l'industrie robotique, ce travail cible un point faible connu des modèles VLA actuels : leur absence de représentation 3D persistante et invariante au point de vue, qui limite leur capacité à raisonner sur des contraintes géométriques et des layouts spatiaux complexes. La plupart des VLA en production s'appuient sur des flux caméra 2D bruts ou des cartes de profondeur peu structurées ; VistaVLA propose une carte cognitive 3D sémantique inspirée de la cognition humaine, un argument qui, s'il se confirme à plus grande échelle, pourrait influencer la conception des prochaines générations de politiques d'action pour bras manipulateurs et robots mobiles. Ce travail s'inscrit dans une vague de recherche académique cherchant à combler l'écart entre modèles VLA à succès commercial, comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure, et leurs limites documentées en generalisation spatiale. Les résultats restent pour l'instant issus d'évaluations contrôlées en laboratoire, sans déploiement industriel annoncé ; la validation sur des tâches de manipulation plus variées et à plus grande échelle reste la prochaine étape naturelle pour ce type d'approche.

RechercheActu
1 source
Où rejoindre un groupe ? Prédiction d'objectif guidée par le langage pour l'agrégation de robots
2arXiv cs.RO 

Où rejoindre un groupe ? Prédiction d'objectif guidée par le langage pour l'agrégation de robots

Une équipe de recherche publie sur arXiv (2609.28467v1, mis en ligne le 24 septembre 2026) une méthode baptisée "language-grounded robot group joining", qui répond à une question absente de la navigation sociale classique : non pas comment rejoindre un point fixe, mais où et comment s'intégrer à un groupe humain dont l'activité et la formation évoluent en temps réel. Le système part d'une observation visuelle et d'une description en langage naturel du groupe cible pour identifier les bonnes personnes, puis calcule des poses de jonction socialement acceptables. La chaîne technique combine un partitionnement spectral récursif, qui génère des sous-ensembles candidats de personnes dans la scène, avec un modèle language-conditioned combinant image et géométrie pour classer ces sous-ensembles selon la description fournie. Une fois le groupe identifié, un module de prédiction d'objectif s'appuie sur des a priori de formations humaines (conversations, files d'attente, publics) pour produire une carte multimodale energy-orientation couvrant l'ensemble des poses robotiques envisageables. Les auteurs rapportent une inférence en moins d'une seconde, une précision d'identification du groupe comparable aux meilleures approches existantes, et des performances supérieures à toutes les méthodes de référence testées pour la prédiction de pose de jonction, validées à la fois en simulation et sur robot réel, y compris dans des interactions dynamiques. L'intérêt pratique dépasse la simple curiosité académique : les applications visées, chiens-guides robotiques et scooters de mobilité autonomes, ciblent l'assistance aux personnes à mobilité réduite ou malvoyantes dans des environnements sociaux denses, un cas d'usage largement sous-traité par la littérature en navigation robotique, historiquement focalisée sur l'évitement d'obstacles vers un but déjà connu. En prouvant qu'un robot peut interpréter une instruction en langage naturel pour localiser un groupe spécifique parmi plusieurs, puis calculer sa position d'intégration sans base de données pré-cartographiée, les auteurs adressent un maillon manquant pour les intégrateurs travaillant sur des AMR (robots mobiles autonomes) déployés en environnement humain ouvert, plutôt qu'en entrepôt structuré. Le travail s'inscrit dans la lignée des modèles vision-langage appliqués à la robotique mobile, où la formulation de tâches sémantiques complexes via instructions textuelles gagne du terrain face aux approches purement géométriques. Le papier ne mentionne ni partenariat industriel ni déploiement commercial : il s'agit d'un résultat de recherche fondamentale, testé sur trois types de configurations sociales (conversations, files d'attente, audiences) avec tailles de groupe, densités de foule et ambiguïtés visuelles variables. Aucune suite commerciale ni calendrier de transfert vers un produit n'est annoncé à ce stade.

RecherchePaper
1 source
Prompt visuel pour la manipulation robotique : prise-et-dépose guidée par annotations avec ACT
3arXiv cs.RO 

Prompt visuel pour la manipulation robotique : prise-et-dépose guidée par annotations avec ACT

Un article publié sur arXiv (2508.08748v2, version révisée) décrit un pipeline de perception-action pour des tâches de préhension et de dépose en magasin de proximité, environnement marqué par une forte densité d'objets, des occlusions fréquentes et une grande variabilité de couleur, forme, taille et texture. La méthode repose sur un prompting visuel guidé par annotation : des boîtes englobantes désignent à la fois les objets saisissables et les emplacements de dépose, offrant un guidage spatial structuré au bras robotique. Plutôt qu'une planification de trajectoire classique étape par étape, les auteurs emploient Action Chunking with Transformers (ACT), un algorithme d'apprentissage par imitation qui prédit des séquences d'actions groupées à partir de démonstrations humaines. Le système est évalué sur le taux de réussite des prises et une analyse visuelle du comportement de préhension, sans que le résumé ne publie de chiffres précis. Cette approche cible un verrou concret de la manipulation en environnement non structuré : la planification classique peine face au désordre et aux occlusions typiques d'un rayon de magasin, tandis que les modèles vision-langage-action massifs restent coûteux à entraîner et à déployer. Combiner un guidage visuel léger, par simples boîtes englobantes, avec une politique d'imitation entraînée par chunks d'actions offre une alternative peu gourmande en données pour des intégrateurs visant l'automatisation du picking en retail, sans reconstruction 3D complète de la scène ni lourd transfert sim-to-real. Pour des décideurs B2B, l'intérêt reste surtout méthodologique : l'absence de métriques chiffrées dans le résumé invite à la prudence avant d'en tirer des conclusions de performance industrielle. ACT, brique centrale de l'étude, a été introduite par le projet ALOHA de Stanford pour la manipulation bimanuelle fine à partir de démonstrations téléopérées à bas coût matériel, et s'est depuis imposée comme méthode de référence en apprentissage par imitation, aux côtés d'approches plus généralistes comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure. Contrairement à ces modèles fondation multi-tâches, l'étude reste circonscrite à un pipeline spécialisé pick-and-place, sans nom de robot, de fabricant ni de site de déploiement mentionné : il s'agit d'une contribution de recherche publiée en preprint, non d'un produit commercialisé ni d'un pilote industriel annoncé, et aucune date de déploiement réel n'est précisée.

RecherchePaper
1 source
Mind-VLA : alignement de la représentation spatiale guidé par les instructions pour les modèles vision-langage-action
4arXiv cs.RO 

Mind-VLA : alignement de la représentation spatiale guidé par les instructions pour les modèles vision-langage-action

Publiée le 4 août 2026 sur arXiv (2608.04633), une méthode baptisée Mind-VLA corrige un défaut des modèles vision-langage-action (VLA) en robotique: les approches existantes alignent leur représentation avec la géométrie 3D de toute la scène de façon uniforme, sans isoler l'objet désigné par l'instruction, d'où des échecs en manipulation fine ou en cas d'occlusion. Mind-VLA identifie d'abord cet objet cible, en génère une vue à trois angles, en extrait des caractéristiques VAE et VGGT, puis aligne la représentation latente du modèle dessus. Avec un backbone compact de 345 millions de paramètres, le système atteint 93,9% de réussite sur LIBERO, 4,47 sur CALVIN, et 54% de succès moyen sur robot réel en situation d'occlusion, soit 32 points de plus que la meilleure méthode instruction-agnostique comparée. Le code sera publié en open source. Le résultat vise un problème concret pour les intégrateurs déployant bras manipulateurs ou humanoïdes: les démonstrations de laboratoire s'effondrent souvent dès que l'objet à saisir est partiellement caché par un carton, une pièce voisine ou l'angle de la caméra. En conditionnant la représentation 3D sur l'objet réellement visé plutôt que sur la scène entière, Mind-VLA cible directement l'écart entre démo et réalité industrielle. Le gain de 32 points obtenu sur robot réel, pas seulement en simulation, compte dans un domaine où les progrès annoncés reposent souvent sur des vidéos sélectionnées ou des métriques peu transposables. Mind-VLA s'inscrit dans la lignée des travaux sur l'alignement géométrique des VLA, qui injectent une compréhension 3D explicite dans des modèles entraînés sur images et texte, comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, sans qu'aucun ne cible spécifiquement l'objet d'intérêt. Le résumé ne nomme pas la méthode instruction-agnostique servant de référence, ce qui invite à la prudence tant que l'article complet et le code promis ne sont pas vérifiables. La piste, aligner la représentation sur l'objet désigné plutôt que sur toute la scène, devrait néanmoins intéresser d'autres laboratoires travaillant sur la manipulation fine.

RechercheOpinion
1 source