Aller au contenu principal
Évaluation comparative de modèles génératifs de trajectoires pour le contrôle par inférence active
RecherchearXiv cs.RO 

Évaluation comparative de modèles génératifs de trajectoires pour le contrôle par inférence active

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.05692, deuxième version) GenAIF, un cadre de commande par inférence active générative. Un seul modèle génératif de trajectoires, entraîné sur des démonstrations et des interventions d'action mesurées, fournit deux éléments. Le premier est une politique conditionnée par un objectif. Le second est une correspondance probabiliste entre états et observations. Les auteurs en tirent trois exigences pour le modèle: des propositions d'actions utiles, une prédiction fidèle sous actions imposées, et une évidence d'observation probabiliste pour la mise à jour des croyances et le calcul du gain d'information attendu. Ils comparent quatre familles (diffusion, Transformers autorégressifs, autoencodeurs variationnels conditionnels ou CVAE, et flow matching) sur une tâche de manipulation MuJoCo avec plusieurs conditions physiques. La diffusion donne le meilleur contrôle sur toutes les dynamiques testées. Le CVAE offre une prédiction à court horizon comparable pour une inférence nettement plus rapide. Après un changement d'inclinaison non annoncé, la diffusion préentraînée met à jour sa croyance le plus vite parmi les modèles d'origine. Un fine-tuning sur des démonstrations de récupération accélère encore l'identification et maintient un suivi précis.

Pour les équipes qui construisent des politiques apprises, le résultat chiffre un arbitrage concret entre qualité de contrôle et coût d'inférence. La diffusion est la plus performante mais la plus lourde, le CVAE est un compromis crédible quand la latence compte, et la réutilisation de trajectoires réduit le calcul. L'intérêt tient aussi à la capacité d'adaptation. Un modèle capable de dire quand ses observations contredisent ses prédictions peut détecter un changement physique, comme une charge ou une pente modifiée, sans modèle dynamique explicite. Les limites sont nettes: tout reste en simulation, sur une seule tâche, et le résumé ne donne aucun chiffre de taux de réussite ni de temps de calcul. L'écart simulation-réel n'est donc pas abordé, et il s'agit d'un travail académique, pas d'un produit.

Le travail se situe au croisement de deux courants. Les politiques génératives dominent la manipulation apprise: Diffusion Policy, ACT (basé sur un CVAE) et Pi-0 (flow matching) en sont les références. L'inférence active, issue des neurosciences computationnelles, peine à s'imposer en robotique appliquée faute de modèles de dynamique exploitables. GenAIF propose de combler ce manque avec des modèles appris sur démonstrations. La suite logique passe par une validation sur robots physiques, davantage de tâches et des comparaisons directes avec les politiques de type VLA déjà déployées.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

Évaluation comparative des modèles du monde pour l'apprentissage continu sur des tâches compositionnelles
1arXiv cs.RO 

Évaluation comparative des modèles du monde pour l'apprentissage continu sur des tâches compositionnelles

Un article publié sur arXiv (2609.22055v1, section cross-listing) présente un nouveau benchmark destiné à évaluer la capacité des "world models" à apprendre en continu sur des tâches de manipulation robotique. Baptisé benchmark de continual learning compositionnel, l'outil construit des séquences de tâches où chaque nouvelle tâche recombine des éléments déjà rencontrés, en factorisant cette composition selon deux axes distincts : l'action et la perception. L'objectif est de séparer deux capacités souvent confondues dans les mesures d'adaptation classiques, la vitesse d'apprentissage de tâches inédites d'un côté, la réutilisation de connaissances déjà acquises de l'autre. Les auteurs testent plusieurs world models considérés comme état de l'art, combinés à des méthodes de continual learning standards, ainsi qu'un modèle modulaire dont le socle de dynamique intègre des composants explicitement conçus pour être réutilisés. Le code et les détails du benchmark sont publiés sur un site dédié au projet, object814.github.io/Compositional-Continual-Learning. Le résultat central est que l'architecture modulaire offre un meilleur compromis entre réutilisation des connaissances et oubli catastrophique que les méthodes de continual learning conventionnelles, mais qu'aucune approche testée ne résout le problème dans son ensemble. Pour les laboratoires qui développent des modèles génériques de type VLA destinés à équiper des robots manipulateurs en usine ou en logistique, ce constat vient nuancer l'hypothèse implicite selon laquelle un modèle suffisamment large finirait par s'adapter à de nouveaux environnements sans réentraînement complet ni perte de performance sur les tâches antérieures. Le benchmark fournit en somme un outil de diagnostic plus rigoureux que les mesures d'adaptation globales habituellement citées dans les communiqués sur les robots généralistes, en isolant précisément où l'apprentissage échoue. Ce travail s'inscrit dans la continuité des recherches sur le continual learning appliqué à la robotique, un champ où les benchmarks existants mesuraient rarement séparément la vitesse d'apprentissage et la réutilisation de connaissances. En se concentrant spécifiquement sur les world models, composants de plus en plus centraux dans les architectures de contrôle robotique moderne, les auteurs positionnent leur contribution comme un outil d'évaluation plutôt qu'un nouveau modèle concurrent. La publication du benchmark en accès libre laisse présager son adoption par d'autres équipes pour tester leurs propres architectures, sans qu'aucun calendrier de déploiement industriel ne soit annoncé à ce stade.

RecherchePaper
1 source
Génération de code adaptative pour le contrôle de robots
2arXiv cs.RO 

Génération de code adaptative pour le contrôle de robots

Des chercheurs proposent, dans un preprint arXiv (2610.09588v1), une architecture de contrôle robotique à double IA pour piloter des robots dans des environnements inconnus et dynamiques à partir d'intentions formulées en langage naturel. Un grand modèle de langage (LLM) traduit des objectifs de haut niveau en code exécutable. Ce code est limité à une bibliothèque robotique formelle et contraint par une syntaxe vérifiable. Un modèle vision-langage (VLM) assure l'ancrage sémantique, c'est-à-dire le lien entre les mots et ce que le robot perçoit, grâce à un processus de distillation. Le système ajoute des déclencheurs de replanification pilotés par l'environnement, fondés sur des seuils géométriques et sémantiques. Il intègre aussi une surveillance continue à l'exécution et une boucle de planification adaptative. Les auteurs l'ont évalué sur plusieurs modèles de pointe. Le résumé ne donne ni DOF, ni temps de cycle, ni taux de réussite chiffré, ni plateforme robotique, ni site de déploiement. Il s'agit d'une contribution de recherche, sans produit ni déploiement. L'enjeu porte sur la façon d'utiliser les LLM en robotique. L'approche n'est pas celle des modèles vision-langage-action (VLA) de bout en bout, qui produisent directement des actions. Elle génère du code contraint à une bibliothèque de primitives, donc auditable, vérifiable avant exécution et borné par ce que le robot sait faire. Pour un intégrateur ou un responsable industriel, cette propriété compte dans les contextes où la traçabilité et la sécurité priment. Le travail cible trois verrous : l'écart de formalisation entre une intention floue et une action exécutable, l'écart de taxonomie quand l'environnement présente des objets ou situations imprévus, et le suivi de l'état et de la progression dans le temps. Il soutient que ancrer l'IA générative dans une boucle réactive et contrainte permet de remplir des intentions complexes malgré l'incertitude. La prudence s'impose pourtant. Le résumé ne chiffre rien, et un benchmark sur modèles de pointe ne dit pas comment le système tient face aux latences, aux erreurs de perception ou aux pannes matérielles d'un site réel. Cette publication prolonge la ligne de travaux qui font écrire du code aux LLM pour commander des robots, popularisée par des approches comme Code as Policies, et qui s'oppose aux politiques apprises de bout en bout de type Pi-0, Helix ou GR00T. Les auteurs inscrivent leur démarche dans la vision de robots comme systèmes adaptatifs complexes, passant de bibliothèques de commandes rigides à une autonomie fondée sur l'intention. Le texte ne cite pas de partenaire industriel, de calendrier ni d'étape suivante. Les prochains jalons à surveiller sont la publication des résultats détaillés, d'éventuels essais sur robot physique et la comparaison directe avec les VLA sur des tâches longues en environnement ouvert.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Entraînement au moment de l'inférence pour les modèles vision-langage-action à prévision visuelle (VLA)
3arXiv cs.RO 

Entraînement au moment de l'inférence pour les modèles vision-langage-action à prévision visuelle (VLA)

Des chercheurs proposent T³VF (Test-Time Training Visual Foresight VLA), une méthode d'adaptation à l'inférence publiée sur arXiv en mai 2025 (réf. 2605.08215). Les architectures Visual Foresight VLA, qui figurent parmi les plus performantes pour le contrôle de robots manipulateurs, fonctionnent en deux temps : elles prédisent d'abord une image future représentant l'état visuel attendu après l'action, puis génèrent la commande motrice à partir de cette prédiction. Cette dépendance en cascade crée une vulnérabilité double aux situations hors-distribution (OOD) : une prédiction visuelle dégradée corrompt directement la décision motrice en aval. T³VF exploite l'écart entre l'image future prédite et l'observation réellement reçue comme signal de supervision naturel, permettant au modèle de s'ajuster en continu pendant l'exécution, sans modification architecturale ni modules auxiliaires. Un mécanisme de filtrage adaptatif sélectionne les mises à jour pertinentes pour éviter la dérive par accumulation d'erreurs indiscriminée. Pour les équipes de déploiement, l'enjeu est direct : les VLA sont benchmarkés en laboratoire mais confrontés en production à des variations de scène (éclairage, textures, disposition des objets) rarement couvertes par les données d'entraînement. T³VF propose une adaptation sans annotation humaine ni nouvelle session d'entraînement, le robot se corrigeant à partir de ses propres observations, avec un surcoût d'inférence qualifié de modeste par les auteurs, une affirmation à vérifier selon les environnements cibles. Si les résultats se confirment à plus grande échelle, la méthode pourrait réduire les cycles de re-fine-tuning lors du passage en production, un poste de coût opérationnel significatif pour les intégrateurs industriels. Les VLA s'imposent depuis 2023 comme architecture dominante en manipulation robotique, portés par des modèles comme RT-2 (Google DeepMind), OpenVLA ou Pi-0 de Physical Intelligence. Les variantes Visual Foresight, qui ajoutent une prédiction d'état futur avant l'action, ont montré des gains sur les tâches de précision, mais leur fragilité face aux shifts de distribution restait peu adressée dans la littérature. Ce travail s'inscrit dans un courant croissant de Test-Time Training (TTT) appliqué à la robotique, distinct du fine-tuning classique en ce qu'il n'exige aucune supervision externe. Aucun partenariat industriel ni timeline de transfert technologique n'est mentionné : ce pré-print académique ne décrit pas de produit ou de déploiement commercialisé associé.

RechercheOpinion
1 source
Robots humanoïdes : accélérer la génération de trajectoires par diffusion et distillation par cohérence
4arXiv cs.RO 

Robots humanoïdes : accélérer la génération de trajectoires par diffusion et distillation par cohérence

Une équipe de recherche propose un framework de planification de trajectoires contraintes pour bras manipulateurs en interaction homme-robot (HRI). Le point de départ : quand la pose de l'effecteur terminal est entièrement fixée, imposer en plus l'évitement de collisions et d'auto-collisions comme simple tâche secondaire dans l'espace nul devient difficile, ce qui complique la génération de trajectoires sûres. Les chercheurs génèrent d'abord, via les algorithmes RRT et RRT*, un jeu de données de trajectoires respectant ces contraintes, puis entraînent dessus un modèle de diffusion produisant des trajectoires articulaires par échantillonnage guidé. Une distillation de cohérence réduit ensuite le temps d'inférence, et un terme de régularisation du jerk pondéré par articulation est ajouté à la fonction de perte pour lisser les trajectoires. En simulation, le modèle de cohérence génère 150 candidats en moins de 100 millisecondes, avec un taux de réussite élevé, et la régularisation du jerk réduit nettement les à-coups articulaires et à l'effecteur terminal. Ce résultat vise un verrou concret pour les robots collaboratifs travaillant près d'humains : les planificateurs classiques par échantillonnage comme RRT sont trop lents pour du replanning temps réel, tandis que les modèles de diffusion, efficaces pour capturer des distributions de trajectoires contraintes, restent coûteux en inférence à cause du débruitage itératif. En ramenant la génération à quelques étapes sans perte visible de qualité, la distillation de cohérence rapproche les planificateurs appris de la latence exigée par un usage embarqué, un enjeu direct pour les intégrateurs de cobots industriels et les concepteurs de systèmes HRI, où la sécurité ne doit pas se payer en réactivité. Le travail s'inscrit dans la lignée des approches par diffusion appliquées à la planification de mouvement et à l'apprentissage par imitation en robotique, où la vitesse de génération reste le principal obstacle face aux contrôleurs classiques. Les modèles de cohérence, conçus à l'origine pour accélérer la génération d'images, sont ici transposés à la manipulation robotique pour contourner ce compromis vitesse-qualité. Les résultats restent toutefois cantonnés à la simulation : la validation sur bras robotique physique, avec perception humaine réelle, constitue l'étape logique suivante avant tout déploiement en environnement collaboratif.

RecherchePaper
1 source