Aller au contenu principal
InternVLA-A1.5 : unifier compréhension, prévision latente et action pour une généralisation compositionnelle
IA physiquearXiv cs.RO 

InternVLA-A1.5 : unifier compréhension, prévision latente et action pour une généralisation compositionnelle

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent InternVLA-A1.5, un modèle unifie de manipulation robotique qui embarque a la fois les capacités sémantiques d'un VLM preentraine et une prévision physique du futur, le tout dans une seule politique de contrôle. L'architecture conserve un backbone VLM natif qui continue de s'entrainer sur des taches de question-réponse visuelle et de prédiction de sous-taches, auquel est attache un expert léger dédié a la génération continue d'actions. L'innovation clé porte sur la prévision du futur, reformulée comme un problème de "latent-querying": un petit ensemble de jetons de prévision apprenables condense les éléments du futur pertinents pour la tache en un code latent compact, sous la supervision d'un modèle de génération vidéo preentraine et gelé, sans jamais apprendre de génération au niveau du pixel. La branche vidéo est abandonnee au moment de l'inférence, ce qui préservé le contrôle en temps réel. Preentraine sur 1,2 million d'épisodes robotiques et 3 millions d'échantillons multimodaux, InternVLA-A1.5 obtient les meilleurs résultats globaux sur six benchmarks de simulation, et affiche en conditions réelles la généralisation compositionnelle la plus solide sur des combinaisons d'instructions inédites.

Ce travail s'attaque a un problème récurrent des modèles VLA unifies: entrainer conjointement compréhension sémantique et prédiction d'action tend a dégrader les priors du VLM d'origine, créé des interférences entre objectifs hétérogènes, et oblige souvent a réapprendre la prévision visuelle depuis zero en espace pixel, sans exploiter les modèles de génération vidéo déjà entraines. En évitant cette dernière étape couteuse tout en gardant un contrôle temps réel, l'approche laisse entrevoir, pour les intégrateurs et les équipes de recherche en robotique, une voie pour combiner raisonnement de haut niveau et dynamique physique sans sacrifier la vitesse d'exécution ni la robustesse face a des consignes formulées différemment de celles vues a l'entrainement, un point sensible pour tout déploiement commercial au-delà de la démo.

Le papier s'inscrit dans la vague des modèles vision-langage-action généralistes portée ces deux dernières années par des acteurs comme Physical Intelligence avec pi-0, Nvidia avec GR00T N2, ou Figure AI avec Helix, tous confrontes au même arbitrage entre sémantique préservée et dynamique apprise. InternVLA-A1.5 reste pour l'instant une contribution de recherche publiée sur arXiv, évaluée sur benchmarks de simulation et expériences réelles limitées, et non un produit déployé a grande échelle; la suite logique serait une validation sur des plateformes robotiques tierces et des taches manufacturières plus complexes pour confirmer que les gains de généralisation tiennent hors laboratoire.

À lire aussi

MachEmbodied-U0 : un modèle unifié de compréhension et de génération pour l'IA incarnée
1arXiv cs.RO 

MachEmbodied-U0 : un modèle unifié de compréhension et de génération pour l'IA incarnée

Publié le 23 septembre 2026 sur arXiv (2609.25627v1), MachEmbodied-U0 (ME-U0) est un modèle fondation unifié pour la robotique incarnée, combinant compréhension et génération via une architecture Mixture-of-Transformers : prédiction de sous-tâches et ancrage d'affordance guident une génération conjointe de dynamique visuelle et d'actions par flow matching. La dynamique visuelle future couvre RGB, profondeur, normales de surface et flux optique, alignés aux commandes fines par un encodage de position rotatif multi-fréquence (MRPE). Le modèle a été pré-entraîné sur environ 4 200 heures de démonstrations issues de jeux de données robotiques et de vidéos égocentriques humaines. En simulation, avec la seule supervision native de chaque benchmark, ME-U0 atteint un score moyen de 17,66 sur RoboDojo, une échelle propre à ce simulateur et donc difficile à comparer à d'autres benchmarks, ainsi que des taux de réussite de 99,0% sur LIBERO et 82,5% sur LIBERO-Plus. Les auteurs rapportent aussi des validations sur des tâches de manipulation robotique réelle. Le résultat central tient à l'unification : les modèles vision-langage-action (VLA) comme Pi-0 ou GR00T N2 offrent de solides priors sémantiques sans modéliser explicitement l'évolution de la scène, tandis que les modèles monde-action prédisent la dynamique visuelle sans exposer la structure sémantique et spatiale nécessaire à une manipulation fine ; ME-U0 couple les deux pour combler cet écart. Pour les intégrateurs et chercheurs, le point notable est la capacité en zero-shot : sans supervision dédiée, le modèle prédit sous-tâches, affordances et dynamique visuelle sur des observations inédites, simulées ou réelles, un signe de transférabilité au-delà du seul benchmark d'entraînement. ME-U0 s'inscrit dans la vague de modèles fondation pour la robotique généraliste, aux côtés de Pi-0 (Physical Intelligence), GR00T N2 (NVIDIA) ou Helix (Figure AI), qui unifient tous perception, raisonnement et contrôle moteur dans un seul réseau entraîné sur des corpus massifs de démonstrations et de vidéos humaines. Le travail reste à ce stade une publication de recherche arXiv, sans partenaire industriel ni calendrier de commercialisation annoncés ; les auteurs le présentent comme une preuve de concept, la suite logique étant l'extension des essais réels sur davantage de plateformes robotiques.

IA physiqueOpinion
1 source
Pelican-Unified 1.0 : un modèle d'IA incarnée unifié pour la compréhension, le raisonnement, l'imagination et l'action
2arXiv cs.RO 

Pelican-Unified 1.0 : un modèle d'IA incarnée unifié pour la compréhension, le raisonnement, l'imagination et l'action

Une équipe de recherche a publié Pelican-Unified 1.0 (arXiv 2605.15153), un modèle de fondation incarné qui intègre dans un seul checkpoint quatre capacités habituellement confiées à des modules distincts : compréhension visuelle, raisonnement, imagination et génération d'actions robotiques. L'architecture repose sur un unique VLM (Vision-Language Model) qui encode scènes, instructions et historiques d'actions dans un espace sémantique partagé. Ce même VLM génère en un seul forward pass des chaînes de pensée orientées tâche, projetées dans une variable latente dense. Un module baptisé Unified Future Generator (UFG) conditionne ensuite sur cette latente pour produire simultanément vidéos futures et séquences d'actions via deux têtes de sortie dans le même processus de débruitage (denoising). Les performances annoncées : 64,7 sur huit benchmarks VLM standards (meilleur parmi les modèles de taille comparable), 66,03 sur WorldArena (premier rang) et 93,5 sur RoboTwin (deuxième meilleure moyenne parmi les méthodes comparées). L'article est déposé en preprint, sans validation par les pairs à ce stade. L'enjeu architectural est direct : les systèmes robotiques avancés actuels reposent quasi universellement sur des experts spécialisés distincts pour percevoir, raisonner, planifier et exécuter. Ce papier cherche à démontrer qu'un modèle unique, optimisé conjointement sur des pertes de langage, vidéo et action, peut égaler ces spécialistes sans compromis de performance. Si ces résultats se confirment hors simulation, l'impact pour les intégrateurs est double : un seul checkpoint à maintenir et une meilleure généralisation inter-tâches. Le couplage imagination-action dans le même processus de débruitage rappelle l'approche de Physical Intelligence avec Pi-0.5, mais l'intégration du raisonnement textuel dans la même passe constitue un degré d'unification plus poussé. Le score sur RoboTwin reste néanmoins un indicateur sim-to-real à valider en conditions réelles. La course aux modèles VLA (Vision-Language-Action) s'est accélérée en 2024-2025 avec Pi-0 et Pi-0.5 de Physical Intelligence, GR00T N2 de NVIDIA, et les modèles RT-X de Google DeepMind, chacun maintenant des composants partiellement séparés pour la planification et la génération motrice. Pelican-Unified 1.0 se positionne comme une alternative radicalement unifiée, mais reste au stade académique : aucun déploiement, aucun partenariat industriel annoncé, et l'équipe auteure n'est pas identifiée dans le résumé public, ce qui limite l'évaluation de la crédibilité institutionnelle. La revendication de "premier modèle unifié" mérite d'être nuancée, plusieurs architectures combinant déjà compréhension et action. Les prochaines étapes naturelles passent par une validation sur des benchmarks en conditions réelles et une soumission à CoRL ou ICRA.

IA physiqueOpinion
1 source
UniTacVLA : compréhension et prédiction tactiles unifiées dans les modèles vision-langage-action
3arXiv cs.RO 

UniTacVLA : compréhension et prédiction tactiles unifiées dans les modèles vision-langage-action

UniTacVLA, un modèle vision-langage-action (VLA) tactile, vise à résoudre un point faible connu des VLA classiques : la manipulation dextre en contact riche, comme l'insertion, l'essuyage, l'assemblage ou l'ajustement de précision. Contrairement aux approches vision-tactile-langage-action (VTLA) existantes qui traitent le signal tactile comme une simple entrée auxiliaire passive, l'équipe de recherche propose un espace latent tactile unifié qui modélise conjointement l'état tactile courant et les changements de contact futurs, via un raisonnement en chaîne de pensée tactile et une prédiction tactile progressive (coarse-to-fine). Ce prior tactile alimente ensuite un contrôleur mixte tactile-action combinant retour tactile en temps réel et retour prédit, pour corriger à haute fréquence des chunks d'action calculés à basse fréquence. Les expériences ont été menées en conditions réelles sur quatre catégories de tâches à fort contact (ajustement, insertion, essuyage, assemblage), testées à la fois en environnement propre et sous perturbations externes. L'enjeu dépasse la simple amélioration de benchmark. La manipulation en contact riche reste l'un des goulots d'étranglement majeurs empêchant les bras robotiques et humanoïdes de passer de la démonstration en laboratoire au déploiement industriel réel, notamment pour des tâches d'assemblage fin où la seule vision ne suffit pas à garantir la précision ou la robustesse face aux perturbations. En traitant le tactile comme un signal dynamique et prédictif plutôt que comme un simple capteur passif, UniTacVLA s'attaque directement à l'écart persistant entre les VLA génériques, entraînés majoritairement sur des données visuelles, et les exigences physiques réelles de l'assemblage industriel ou de la manipulation fine en conditions non contrôlées. Les auteurs revendiquent des gains sur le taux de succès, la précision de manipulation et la robustesse au contact par rapport aux méthodes existantes, ce qui, si confirmé à plus grande échelle, renforcerait l'argument selon lequel l'intégration tactile profonde est nécessaire pour les tâches dextres, et pas seulement un ajout marginal. Ce travail s'inscrit dans une vague plus large de recherche visant à doter les modèles VLA de capacités multimodales au-delà de la vision et du langage, à mesure que des acteurs comme Physical Intelligence (Pi-0) ou NVIDIA (GR00T) poussent leurs propres modèles génération vers la production industrielle. Les architectures VTLA précédentes, limitées par un traitement passif du tactile, constituent la ligne de base que ce papier cherche à dépasser. La publication, un prépublication arXiv, ne mentionne pas de partenariat industriel ni de calendrier de déploiement commercial ; les prochaines étapes attendues porteraient sur l'extension à davantage de types de capteurs tactiles et de tâches, ainsi que sur une validation à plus grande échelle en dehors du cadre contrôlé des expériences décrites.

IA physiqueActu
1 source
GIF : génération à base d'agents de compositions d'objets interactifs et fonctionnels pour l'apprentissage des robots
4arXiv cs.RO 

GIF : génération à base d'agents de compositions d'objets interactifs et fonctionnels pour l'apprentissage des robots

Des chercheurs ont publié sur arXiv, sous la référence 2609.05927 (version 2, qui remplace une publication antérieure), un système baptisé GIF, conçu pour générer automatiquement des scènes d'objets fonctionnels et interactifs destinées à l'entraînement et à l'évaluation de modèles de manipulation robotique en simulation. Le pipeline découpe le problème en deux étapes distinctes : un module nommé CoGen reconstruit des maillages 3D séparés par instance avec des poses initiales grossières, en combinant les forces des modèles génératifs 2D et 3D existants, puis un second module, GPRM, affine la pose relative entre les objets sous une double contrainte géométrique et physique. Un vérificateur basé sur un modèle vision-langage (VLM) sélectionne ensuite, parmi les candidats produits, celui qui correspond le mieux à la spécification structurée demandée. Les auteurs ont construit un benchmark couvrant huit classes représentatives de géométries de contact et ont comparé GIF à des générateurs de scènes considérés comme état de l'art. Résultat : le système améliore à la fois la qualité des objets générés et la justesse des relations spatiales entre eux, tout en faisant chuter le taux de collision sous la barre de 1%. Les données produites ont ensuite servi à entraîner des politiques de manipulation, avec une progression des performances observée à mesure que la diversité des scènes augmente, aussi bien en simulation qu'en déploiement réel. Cette contribution vise un maillon précis, et souvent négligé, de la chaîne d'entraînement des modèles de manipulation de type VLA : la génération de scènes. Les méthodes existantes se limitaient surtout à des agencements grossiers d'objets, sans modéliser la façon dont ils s'emboîtent ou interagissent physiquement, ce qui limite leur utilité pour des tâches fines comme ouvrir un couvercle ou insérer une pièce. En automatisant la production de compositions à faible taux de collision, GIF s'attaque directement au goulot d'étranglement des données d'entraînement pour la manipulation robotique, un enjeu central pour les équipes qui cherchent à réduire l'écart entre démonstrations en simulation et comportements robustes en conditions réelles. L'observation d'une montée en performance liée à la diversité des scènes, confirmée à la fois en simulation et sur robot réel, constitue l'élément le plus significatif pour les intégrateurs, car elle appuie l'hypothèse selon laquelle davantage de données synthétiques bien construites profite au transfert vers le monde réel. Ce travail s'inscrit dans la lignée des recherches sur la génération automatique de scènes de simulation pour la robotique, un domaine qui a jusqu'ici privilégié le placement grossier d'objets plutôt que la composition fine de leurs relations fonctionnelles et de contact. Les auteurs positionnent explicitement GIF face aux générateurs de scènes existants sans toutefois nommer d'acteur commercial concurrent, l'article restant à ce stade une contribution de recherche publiée sur arXiv plutôt qu'un produit déployé. La suite annoncée par les auteurs porte sur l'extension de cette génération de données synthétiques à plus grande échelle pour l'entraînement de politiques de manipulation, avec des premiers résultats de transfert vers le monde réel déjà rapportés, mais sans calendrier ni partenaire industriel précisé.

IA physiquePaper
1 source