Aller au contenu principal
RecherchearXiv cs.RO 

RESETTLE : récupération robotique par recherche déclenchée par désaccord et contrôle correctif efficace

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

RESETTLE, un framework de récupération d'erreurs pour la manipulation robotique, est décrit dans un preprint arXiv (2610.12185) qui cible un problème concret des politiques robotiques gelées : corriger une dérive d'exécution sans payer la latence d'un raisonnement vision-langage répété ou d'une optimisation de trajectoire en ligne. Le système, indépendant du modèle de base, se greffe à l'interface d'exécution des actions. Il déclenche une récupération lorsque deux propositions d'action, échantillonnées indépendamment dans des conditions identiques, divergent de façon persistante. Il récupère alors une démonstration de référence pour la même tâche à l'aide d'un encodeur V-JEPA adapté. Il combine ensuite un a priori d'asservissement d'état et un résiduel visuel protégé pour exécuter une seule action corrective, avant de rendre la main à la politique de base. Les gains annoncés en simulation, sur six politiques de base, atteignent 8,70 points de succès absolus sur LIBERO-Plus, 6,28 sur Meta-World et 6,83 sur RoboCasa Tabletop. Des améliorations sont aussi rapportées sur quatre tâches réelles avec deux politiques. Avec QwenPI, la latence de surveillance et de récupération est inférieure de 74,04 % à 93,57 % à celle de la surveillance et de la planification de VoLoAgent pour les appels d'outils de saisie et de dépose. Le taux de succès de Harness VLA sur le test Swap de LIBERO-Pro passe de 42 % à 50 %.

L'intérêt pour l'industrie tient à la position choisie : la robustesse est traitée comme une couche externe, légère et réutilisable, sans réentraîner ni modifier la politique. Pour un intégrateur qui exploite déjà un VLA (modèle vision-langage-action) en production, cela évite de dépendre d'un modèle de raisonnement lourd à chaque anomalie, source de latence qui retarde l'intervention. Le désaccord entre deux échantillons de la politique sert de signal d'incertitude bon marché, sans capteur ni superviseur supplémentaire. La compatibilité avec une planification agentique de haut niveau, illustrée par le passage de 42 % à 50 % sur LIBERO-Pro Swap, suggère une brique complémentaire plutôt qu'un concurrent des architectures à base d'agents. Les réserves sont nettes. Les gains absolus restent modestes, entre 6 et 9 points en simulation. Les benchmarks sont connus et les quatre tâches réelles sont peu nombreuses. La comparaison de latence avec VoLoAgent porte sur des appels d'outils précis, pas sur le temps de cycle d'une tâche complète. Rien n'indique non plus un déploiement industriel. Il s'agit d'un résultat de recherche, pas d'un produit.

Le travail s'inscrit dans la montée des VLA généralistes et dans un constat désormais partagé : ces politiques échouent souvent par accumulation d'écarts, que l'imitation seule corrige mal. Les approches concurrentes de détection et de récupération reposent généralement sur des modèles vision-langage rappelés à chaque étape ou sur de la planification itérative, ce que RESETTLE cherche à éviter. Le choix de V-JEPA, une famille d'encodeurs vidéo à prédiction latente, reflète l'intérêt croissant pour les représentations de monde dans la robotique. Le code est publié sur GitHub par le laboratoire JIA-Lab. Les suites logiques seront des tests sur davantage de tâches physiques, des mesures de latence en boucle fermée sur matériel embarqué et une validation sur des cas de manipulation industrielle plus longs, où la récupération d'erreur conditionne la disponibilité réelle des systèmes.

À lire aussi

Communication orientée objectif pour une détection et récupération rapide des pannes en robotique
1arXiv cs.RO 

Communication orientée objectif pour une détection et récupération rapide des pannes en robotique

Une équipe de chercheurs a publié sur arXiv (2601.18765v2) un cadre baptisé Goal-oriented Communication (GoC), conçu pour accélérer la détection et la récupération de pannes (Fault Detection and Recovery, FDR) dans les robots industriels autonomes déployés en usines intelligentes. La méthode repose sur une co-conception de la boucle communication-calcul-contrôle (3C) orientée explicitement vers l'objectif FDR, plutôt que de traiter ces trois niveaux indépendamment. Pour la détection, GoC extrait un graphe de scène 3D (3D-SG) comme représentation sémantique de l'environnement et surveille les changements de relations spatiales entre objets pour identifier les anomalies. Pour la récupération, le cadre fine-tune un petit modèle de langage (SLM) via Low-Rank Adaptation (LoRA), renforcé par distillation de connaissances depuis un LLM, et génère les trajectoires de récupération. Un module de jumeau numérique léger, ne reconstituant que les contours d'objets pertinents à la tâche, affine ces trajectoires quand un contrôle fin est nécessaire. En simulation, GoC réduit le temps de FDR jusqu'à 82,6 % et améliore le taux de succès des tâches (ex. tri de pièces) jusqu'à 76 % par rapport aux frameworks de référence utilisant des VLM pour la détection et des LLM pour la récupération. Ces résultats sont toutefois issus exclusivement de simulations; aucun déploiement physique ni banc d'essai industriel réel n'est rapporté. L'intérêt industriel de GoC tient à deux arbitrages clairs. D'abord, remplacer un VLM ou LLM embarqué par un SLM spécialisé réduit la latence de façon significative, ce qui est critique dans des cellules robotisées où une anomalie non détectée en quelques dizaines de millisecondes peut provoquer des collisions ou des rebuts coûteux. Ensuite, la représentation par graphe de scène 3D offre une abstraction compacte et interprétable de l'espace de travail, potentiellement plus robuste aux variations d'éclairage ou de texture qu'une approche purement pixellique. Pour les intégrateurs et les OEM qui déploient des bras ou des cellules pick-and-place, cela suggère une voie vers des systèmes FDR embarquables sur des contrôleurs à ressources contraintes, sans passer par un cloud ou un serveur GPU dédié. La distinction SLM/LLM va dans le sens d'une tendance de fond: l'industrie cherche à internaliser l'intelligence, pas à l'externaliser. Ce travail s'inscrit dans un corpus actif de recherches sur la robotique cognitive en milieux industriels incertains, en réponse aux limites bien documentées des architectures réactives classiques face aux pannes atypiques. Les approches concurrentes les plus citées mobilisent GPT-4V ou des modèles de la famille LLaVA comme détecteurs de pannes visuelles, au prix d'une latence incompatible avec les exigences temps-réel des lignes de production. GoC ne nomme pas d'entreprise partenaire ni de pilote terrain; il reste à ce stade un prototype académique dont le transfert industriel nécessiterait une validation sur hardware réel, en particulier sur la robustesse du graphe de scène 3D face aux occlusions et aux environnements encombrés. Aucun acteur européen n'est impliqué dans l'étude publiée. Les prochaines étapes naturelles seraient une validation physique et une comparaison sur des benchmarks standardisés comme FaultBench ou les scénarios de la NIST Assembly Task Board.

RecherchePaper
1 source
TrAct : relier le contrôle robotique et la prédiction visuelle par les trajectoires visuelles
2arXiv cs.RO 

TrAct : relier le contrôle robotique et la prédiction visuelle par les trajectoires visuelles

Des chercheurs présentent TrAct, un framework de décision robotique fonde sur un modèle du monde et structure autour de trois composants, dans un article publie sur arXiv (2608.24101). VLAT (Vision-Language-Action-and-Track) prédit conjointement des actions candidates et les trajectoires visuelles associées a partir d'une observation et d'une instruction en langage naturel. TWM (track-conditioned world model) projette ensuite les conséquences visuelles futures de ces trajectoires. VLAC (vision-language reward model) note les résultats prédits pour sélectionner la meilleure paire action-trajectoire, qui est alors exécutée par le robot. Sur un nouveau benchmark de simulation baptise LIBERO-INTEGRAL et sur un bras Franka en conditions réelles, TrAct fait passer le taux de réussite de 27% a 55% en simulation et de 49% a 76% en réel, compare a la référence Pi-0.5. Le module TWM améliore par ailleurs la qualité de prédiction vidéo par rapport a un modèle du monde conditionne uniquement par l'action (AWM). L'enjeu tient au problème cible: les actions robotiques sont spécifiques a chaque plateforme mécanique et ne correspondent que faiblement aux changements visuels dans l'image, ce qui limite leur usage comme signal de conditionnement pour les modèles du monde. Les tracks visuels, indépendants de l'embodiment, offrent un guide dense et spatialement précis pour anticiper l'action correcte, en s'insérant comme représentation intermédiaire entre perception, prédiction et contrôle. TrAct s'attaque ainsi a l'écart persistant entre performances en simulation et généralisation en conditions réelles, un point faible récurrent des architectures VLA. Les gains face a Pi-0.5, référence crédible du secteur, sont notables, mais le benchmark LIBERO-INTEGRAL est propose par les auteurs eux-mêmes et l'article n'a pas encore été relu par les pairs, ce qui appelle une reproduction indépendante avant toute conclusion définitive pour l'industrie. Ces travaux s'inscrivent dans la vague de recherche sur les modèles Vision-Language-Action, aux cotes de Pi-0 et Pi-0.5 chez Physical Intelligence, GR00T N2 chez Nvidia ou Helix chez Figure AI. L'usage d'un bras Franka Emika comme plateforme d'évaluation reste un standard académique, loin des déploiements en usine revendiques par des acteurs comme Figure (Figure 03) ou Tesla (Optimus). Aucun acteur français ou européen, tel Wandercraft, Pollen Robotics ou Enchanted Tools, n'apparait dans cette étude, qui demeure a ce stade une contribution de recherche en preprint, sans partenariat industriel ni calendrier de déploiement annonce.

RechercheOpinion
1 source
Génération d'actions robotiques continues et cohérentes par correspondance de flux sensible aux fréquences
3arXiv cs.RO 

Génération d'actions robotiques continues et cohérentes par correspondance de flux sensible aux fréquences

Une équipe de recherche propose FAFM (Frequency-Aware Flow Matching), une méthode de génération d'actions robotiques présentée en préprint arXiv (2606.20135, juin 2026), qui reformule le problème du flow matching pour la manipulation robotique dans le domaine fréquentiel. Le principe : plutôt que de prédire directement des séquences d'actions discrètes (des "chunks"), FAFM applique une transformée en cosinus discrète (DCT) sur ces séquences pour les convertir en coefficients fréquentiels, effectue le flow matching sur ces coefficients, puis reconstruit des actions continues via expansion en base cosinus. Pour garantir la cohérence temporelle, la méthode ajoute une contrainte de type Sobolev sur la dérivée temporelle du premier ordre, ce qui pénalise les changements brusques et atténue les erreurs hautes fréquences. L'approche s'applique sans paramètres réseau supplémentaires, aussi bien aux politiques de flow matching autonomes qu'aux modèles vision-langage-action (VLA). Les résultats sont validés sur les benchmarks LapGym, LIBERO et évitement d'obstacles, ainsi qu'en déploiement réel sur un bras Franka. L'intérêt industriel est direct : la fragmentation des fréquences de contrôle est un problème concret lors de l'agrégation de données de démonstration provenant de robots différents (certains à 10 Hz, d'autres à 50 Hz), et les méthodes actuelles de diffusion policy ou de flow matching standard y sont explicitement vulnérables. Les actions temporellement incohérentes qui en résultent dégradent la stabilité du contrôle en boucle fermée, un facteur bloquant pour le déploiement en production. Le fait que FAFM améliore simultanément le taux de succès, la fluidité du mouvement, la robustesse aux biais mécaniques et la vitesse de convergence sans modifier l'architecture existante est une proposition de valeur claire pour les intégrateurs : pas de refonte du pipeline, pas de surcoût computationnel. La compatibilité avec les VLA est également notable, car ces modèles dominent les annonces récentes (pi-0 de Physical Intelligence, GR00T N2 de NVIDIA) et souffrent précisément de ce type d'artefacts temporels à l'inférence. Le flow matching s'est imposé ces dix-huit derniers mois comme alternative crédible à la diffusion policy (Chi et al., 2023, Columbia), avec des temps d'inférence plus courts et une meilleure expressivité multimodale. Les travaux récents de Physical Intelligence (pi-0, pi-0.5) et de Figure AI ont largement adopté ce paradigme pour leurs politiques générales. FAFM s'inscrit dans une tendance de raffinement de ces fondations plutôt que de rupture : on optimise la stabilité et la généralisation inter-fréquences, deux verrous identifiés lors des premiers déploiements industriels à grande échelle. La validation sur Franka reste modeste en termes de diversité de tâches, et le code est disponible sous revue anonyme, ce qui signifie que la méthode n'est pas encore auditée par la communauté. Les prochaines étapes naturelles seraient une validation sur des plateformes humanoïdes multi-articulées et sur des datasets hétérogènes à grande échelle, là où la question des fréquences mixtes est la plus aiguë.

RecherchePaper
1 source
Génération de programmes robotiques ancrée sur la récupération d'information et correction par simulation via le Model Context Protocol
4arXiv cs.RO 

Génération de programmes robotiques ancrée sur la récupération d'information et correction par simulation via le Model Context Protocol

Un article de recherche publié sur arXiv (identifiant 2608.21417v1, catégorie "cross") décrit un système qui génère, valide et corrige automatiquement des programmes robotiques ABB RAPID à partir de descriptions en langage naturel. Le cœur du système est un pipeline de génération augmentée par récupération (RAG) à double flux, qui ancre la génération de code dans de la documentation technique vérifiée et des modèles de production, afin de réduire les erreurs spécifiques au domaine que produisent les modèles de langage non ancrés. Un serveur MCP (Model Context Protocol) sur mesure relie le client LLM directement au logiciel ABB RobotStudio pour l'upload automatique du code, l'exécution de simulations et la remontée de diagnostics. L'évaluation combine un benchmark de récupération sur 30 requêtes, des vérifications ciblées de génération de code, et des études de cas dans RobotStudio sur une cellule simulée de prise et dépose (pick-and-place). La boucle de simulation révèle des échecs d'exécution invisibles aux seuls contrôles statiques et sémantiques : erreurs de hauteur de relâchement de ventouse, cibles de placement inaccessibles, et mouvements de récupération dépendant de la configuration du bras. L'enjeu dépasse la simple démonstration technique : la fabrication flexible exige une reprogrammation rapide des robots industriels à chaque changement de variante produit, un goulot d'étranglement classique pour les intégrateurs. En couplant génération de code ancrée et retour d'exécution issu de la simulation industrielle, les auteurs montrent une voie concrète pour fiabiliser l'usage des LLM sur des langages robotiques propriétaires comme RAPID. Le résultat le plus honnête de l'étude reste sa limite assumée : l'approche réduit, mais n'élimine pas, le besoin d'un paramétrage expert et d'une supervision finale humaine, une nuance qui contraste avec le discours souvent plus optimiste sur l'autonomie complète des agents IA en programmation industrielle. Ce travail s'inscrit dans un usage émergent du protocole MCP, popularisé par Anthropic, comme pont standardisé entre modèles de langage et logiciels d'ingénierie métier, ici RobotStudio d'ABB. Contrairement aux approches VLA orientées manipulation physique de robots humanoïdes, cette recherche cible la génération de code pour bras industriels classiques, à un stade purement académique et simulé, sans déploiement en usine ni partenariat industriel annoncé à ce jour.

UELe système cible RAPID, le langage propriétaire d'ABB, acteur industriel européen majeur, ce qui pourrait à terme intéresser les intégrateurs robotique en Europe utilisant cette plateforme.

RecherchePaper
1 source