Aller au contenu principal
RecherchearXiv cs.RO 

Video2STL : ancrer des spécifications temporelles générées par un VLM pour l'apprentissage des robots

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Video2STL est un cadre logiciel qui convertit des vidéos sans annotation d'actions en spécifications paramétriques de logique temporelle de signaux (Signal Temporal Logic, STL), puis s'en sert pour entraîner des robots. Un modèle vision-langage (VLM) en extrait une trace d'événements sémantiques indépendante de l'embodiment et construit une banque de spécifications symboliques. Le modèle fixe la structure de la tâche, tandis que les seuils numériques des prédicats et les bornes temporelles sont calibrés à partir de trajectoires robotiques réussies. Pour l'apprentissage, les auteurs séparent deux échelles de temps. Des spécifications à court horizon fournissent des récompenses denses via la robustesse quantitative sur fenêtre glissante. Un moniteur causal appliqué à une spécification à long horizon verse une récompense de progression unique pour chaque préfixe temporel valide. Sur quatre tâches de manipulation, Video2STL atteint 85,8 % de succès « au moins une fois » et 67,0 % de succès en fin d'épisode. Le PPO dense natif obtient 81,5 % et 59,5 %, et Text2Reward 65,0 % et 42,3 %. En locomotion quadrupède, les politiques générées avec Qwen-3.8 et GPT-5.6 atteignent 100 % de succès de 0,3 à 2,1 m/s, avec une efficacité énergétique restée compétitive à haute vitesse.

Le point notable tient à la lisibilité de la récompense. Les méthodes actuelles transforment les images en scores de similarité ou de valeur scalaires, ou demandent à un modèle de fondation d'écrire directement du code de récompense. Dans les deux cas, la structure temporelle de la tâche reste difficile à inspecter, à ancrer dans le monde physique et à réutiliser. Une spécification STL se lit, se vérifie et se modifie, ce qui compte pour un intégrateur qui doit justifier le comportement d'une politique auprès d'un client. Le transfert entre morphologies, de vidéos humaines ou animales vers un robot, est aussi un argument pour réduire le coût de collecte de démonstrations dédiées. Les résultats appellent toutefois des réserves : l'écart avec le PPO natif est modeste (environ 4 points en succès unique), l'avantage sur Text2Reward est plus net, et l'évaluation porte seulement sur quatre tâches et un banc de locomotion, sans déploiement réel annoncé. Le seuil de succès en fin d'épisode, à 67 %, reste loin d'un niveau industriel.

Ce travail s'inscrit dans la lignée des méthodes de récompense générées par LLM (Text2Reward, Eureka) et de l'apprentissage à partir de vidéos, qui butent sur la définition de ce qu'il faut transférer. La logique temporelle est déjà employée en robotique pour la vérification et la planification, mais rarement comme pont entre perception par VLM et apprentissage par renforcement. Il s'agit d'un preprint arXiv, accompagné d'une page projet, sans produit ni calendrier de commercialisation. Les prochaines étapes probables sont la validation sur robot physique, l'extension à des tâches plus longues et à des VLA (vision-language-action models) pour comparaison, et l'évaluation de la robustesse face à des spécifications erronées produites par le VLM.

Dans nos dossiers

À lire aussi

STT-LfD : apprentissage par démonstration pour robots à dynamique inconnue, via des tubes spatio-temporels
1arXiv cs.RO 

STT-LfD : apprentissage par démonstration pour robots à dynamique inconnue, via des tubes spatio-temporels

Des chercheurs présentent STT-LfD, un nouveau cadre d'apprentissage par démonstration (Learning from Demonstration) qui unifie l'apprentissage du mouvement et le contrôle pour des systèmes Euler-Lagrange dont la dynamique reste inconnue, c'est-à-dire la plupart des robots mobiles et manipulateurs industriels réels. Publié sur arXiv (2607.00534) début juillet 2026, l'article décrit une méthode qui s'appuie sur des processus gaussiens hétéroscédastiques pour apprendre des tubes spatio-temporels, une enveloppe qui encode les exigences de précision variables dans le temps d'une tâche démontrée. Un contrôleur en boucle fermée, à forme close, applique ensuite ces contraintes tout en respectant les limites physiques des actionneurs, sans passer par une identification explicite du système. Les auteurs valident l'approche sur deux plateformes matérielles : un robot mobile et un bras manipulateur à 7 degrés de liberté (DOF), et rapportent de meilleures performances que les méthodes de référence en robustesse face aux perturbations et en vitesse de calcul. L'enjeu dépasse la seule prouesse technique. Les approches classiques d'apprentissage par démonstration découplent généralement la planification de mouvement du contrôle : elles apprennent une trajectoire de référence fixe, puis la suivent avec un contrôleur classique, quitte à perdre en robustesse dès qu'une perturbation survient. STT-LfD renverse la logique en traitant la démonstration elle-même comme une spécification de sécurité pilotée par les données, plutôt que comme une cible rigide à reproduire. Pour les intégrateurs industriels, l'intérêt pratique est de pouvoir déployer un contrôleur performant sans phase coûteuse d'identification dynamique du système, un frein courant au déploiement rapide de bras manipulateurs ou de robots mobiles sur des lignes hétérogènes. Cela va dans le sens d'une tendance plus large en robotique : réduire la dépendance à des modèles physiques précis au profit de méthodes data-driven plus rapides à mettre en œuvre. Le travail s'inscrit dans la lignée des recherches sur les tubes de sécurité et le contrôle par barrières (funnel control), déjà explorées pour garantir des performances sous incertitude, mais appliquées ici spécifiquement au cadre de l'apprentissage par démonstration. Il reste à ce stade un résultat de recherche académique, publié en prépublication sans revue par les pairs, testé sur un nombre limité de plateformes matérielles en laboratoire. Les prochaines étapes attendues concernent l'extension à des tâches de manipulation plus complexes et la comparaison directe avec des architectures d'apprentissage de politiques plus récentes, du type transformeurs vision-langage-action, sur des benchmarks communs.

RecherchePaper
1 source
Apprentissage unifié de la structure temporelle des tâches et du timing des actions pour la manipulation bimanuelle en robotique
2arXiv cs.RO 

Apprentissage unifié de la structure temporelle des tâches et du timing des actions pour la manipulation bimanuelle en robotique

Une publication mise à jour sur arXiv (2603.06538, version 2) présente une méthode pour la manipulation bimanuelle robotique qui unifie deux niveaux de raisonnement temporel jusqu'ici traités séparément : la structure symbolique d'une tâche (quelles actions précèdent, suivent ou chevauchent les autres) et le calage concret de chaque main (instant de déclenchement, durée). Le système apprend ces contraintes à partir de démonstrations humaines et en dérive des plans d'exécution paramétrés dans le temps pour un robot à deux bras. Il combine trois briques : une représentation en trois dimensions des délais fondée sur des modèles de mélange gaussien multivariés pour le niveau subsymbolique, un algorithme dérivé de Davis-Putnam-Logemann-Loveland qui classe tous les assignements sans contradiction des relations d'Allen, correspondant aux différents modes d'exécution possibles d'une tâche, et un planificateur par optimisation qui fusionne ces contraintes symboliques et subsymboliques. Les auteurs montrent quantitativement que les contraintes symboliques inférées sont plus précises que celles d'approches heuristiques antérieures, et que les plans générés se rapprochent davantage des démonstrations humaines que la démonstration la plus caractéristique prise comme référence, avec des essais qualitatifs menés en simulation et sur robots réels dont le nombre et les spécifications ne sont pas détaillés. Coordonner deux bras exige de savoir non seulement quel geste doit en précéder un autre, mais exactement quand le déclencher et combien de temps lui accorder, faute de quoi les mouvements se désynchronisent ou entrent en collision, un problème central pour tout intégrateur déployant des cellules bimanuelles en assemblage ou en logistique. La plupart des pipelines existants séparaient la planification symbolique de haut niveau du calage bas niveau des trajectoires, créant une rupture entre la tâche planifiée et son exécution physique ; en réunissant les deux couches dans un cadre appris par démonstration, ce travail cible un angle mort fréquent de l'apprentissage par imitation, qui reproduit souvent des gestes isolés sans capturer la logique de coordination entre bras. Si les résultats se confirment hors laboratoire, cela réduirait le travail manuel de programmation des séquences et des temporisations, un poste coûteux dans le déploiement de robots à deux bras, et fournirait un argument concret face au scepticisme ambiant sur l'écart entre démonstrations soignées et robustesse en conditions réelles. La méthode s'inscrit dans la lignée des travaux de planification robotique s'appuyant sur l'algèbre des intervalles d'Allen, un formalisme classique pour raisonner sur des relations temporelles qualitatives, combiné ici à des modèles de mélange gaussien déjà employés en apprentissage par démonstration pour encoder la variabilité des trajectoires humaines. Les auteurs situent leur contribution par rapport à des approches heuristiques antérieures pour l'extraction de contraintes symboliques, sans nommer de système concurrent précis ni d'institution, le résumé publié restant volontairement générique sur les auteurs et le matériel robotique utilisé. À ce stade, il s'agit d'une contribution de recherche en prépublication, validée en simulation et sur banc réel, sans indication de transfert vers un produit commercial ou un pilote industriel identifié, ni de calendrier de suite annoncé.

RecherchePaper
1 source
Un tokeniseur d'actions hiérarchique spatio-temporel pour l'apprentissage par imitation en contexte en robotique
3arXiv cs.RO 

Un tokeniseur d'actions hiérarchique spatio-temporel pour l'apprentissage par imitation en contexte en robotique

Des chercheurs ont publié sur arXiv (référence 2604.15215v2) un travail portant sur HiST-AT, un tokeniseur d'actions hiérarchique et spatiotemporel conçu pour l'apprentissage par imitation en contexte. Le principe central repose sur deux niveaux successifs de quantification vectorielle : le premier niveau affecte chaque action à des sous-clusters fins, tandis que le second regroupe ces sous-clusters en clusters plus larges. L'extension spatiotemporelle va plus loin en récupérant simultanément les actions et leurs horodatages associés, permettant au modèle d'exploiter à la fois la géométrie des mouvements et leur séquençage temporel. Les évaluations ont été conduites sur plusieurs benchmarks de manipulation robotique en simulation et en conditions réelles, et les auteurs revendiquent un nouveau niveau de performance de référence sur les tâches d'apprentissage par imitation en contexte. Ce résultat intéresse directement les équipes qui travaillent sur le déploiement rapide de robots dans de nouvelles tâches industrielles sans collecter des milliers de démonstrations. L'apprentissage par imitation en contexte, calqué sur le few-shot prompting des grands modèles de langage, vise à permettre à un robot d'exécuter une nouvelle tâche à partir de quelques exemples fournis dynamiquement, sans réentraînement. La qualité du tokeniseur d'actions est ici le maillon critique : une discrétisation trop grossière des trajectoires efface l'information fine de manipulation ; trop granulaire, elle rend l'espace de tokens ingérable. Le fait que l'approche hiérarchique améliore les résultats par rapport à une quantification à un seul niveau, et que l'ajout de l'information temporelle amplifie encore ce gain, suggère que la structure latente des tâches de manipulation est intrinsèquement multiscale. L'apprentissage par imitation en contexte pour la robotique s'est fortement développé depuis 2023, porté par des modèles comme ACT, Diffusion Policy, et plus récemment les architectures de type VLA (Vision-Language-Action) telles que OpenVLA, pi-zero de Physical Intelligence ou GR00T N2 de NVIDIA. La tokenisation des actions est un point de friction commun à toutes ces approches : comment convertir des trajectoires continues en séquences discrètes manipulables par un transformer. HiST-AT apporte une réponse structurée à ce problème, mais il s'agit à ce stade d'un résultat de recherche publié en preprint, sans validation industrielle ni déploiement annoncé. Les prochaines étapes naturelles seront d'évaluer la robustesse en dehors des benchmarks académiques, notamment sur des tâches de manipulation à haute fréquence ou en environnement non contrôlé.

RechercheOpinion
1 source
Auto-apprentissage à partir de démonstrations générées automatiquement pour la manipulation robotique visuelle
4arXiv cs.RO 

Auto-apprentissage à partir de démonstrations générées automatiquement pour la manipulation robotique visuelle

Un preprint publie sur arXiv le 11 aout 2026 (2608.07553) décrit une méthode d'apprentissage auto-supervise pour la manipulation robotique visuelle, dans laquelle le robot génère lui-même ses démonstrations autour d'une pose cible au lieu de dépendre d'une téléopération humaine ou d'un enseignement kinesthésique. Le pipeline, base sur ROS 2 et le simulateur Isaac Sim, produit des paires image-pose étiquetées sans calibration extrinsèque explicite entre camera et robot, avec deux jeux de données distincts, l'un pour l'affinage planaire, l'autre pour l'approche grossière en trois dimensions. Un réseau convolutif régressé la translation et la rotation relatives a partir d'une seule image RGB montee au poignet, et pilote un contrôleur grossier-vers-fin qui approche d'abord l'objet puis affine l'alignement final. Teste en simulation et sur un bras collaboratif réel UR5e équipe d'une pince et d'une camera monoculaire, le système réduit la dispersion planaire finale de 9,69 mm a 5,38 mm en simulation, et atteint en conditions réelles des taux de réussite de préhension de 66,6% et 63,6% sur deux des trois objets testes sans rotation, avec une robustesse partielle en cas de rotation. Cette approche cible un goulot d'étranglement connu de l'industrie: la plupart des pipelines de manipulation exigent une programmation spécifique a l'objet, une annotation manuelle ou une calibration camera-robot précise, ce qui freine le déploiement chez les intégrateurs. En générant ses propres démonstrations en simulation avant transfert vers le réel, la méthode réduit l'effort de mise en place, un argument qui parle directement aux intégrateurs voulant éviter des phases de téléopération couteuses. Les résultats restent toutefois modestes, avec des taux de réussite de 63 a 67% sur seulement trois objets, et les auteurs reconnaissent eux-mêmes des difficultés persistantes en prédiction de profondeur et en généralisation. Le travail se positionne ainsi en contrepoint des modèles de fondation VLA massifs de type GR00T N2 ou Pi-0: une alternative plus légère, ciblée sur une tache étroite, sans la promesse de généralisation zero-shot de ces derniers. Le papier s'inscrit dans une lignée académique de recherches sur le transfert sim-to-real et la génération automatique de données d'entrainement, sans affiliation industrielle mise en avant ni partenariat commercial annonce. Aucun pilote ni calendrier de déploiement n'est mentionne: les auteurs présentent ces travaux comme une preuve de concept, les prochaines étapes évoquées portant sur l'amélioration de l'estimation de profondeur et l'extension a un plus grand nombre d'objets avant d'envisager une application industrielle plus large.

RecherchePaper
1 source