Aller au contenu principal
RecherchearXiv cs.RO 

CIRRA : réconciliation continue des instructions à deux niveaux pendant l'exécution, pour des robots agents incarnés dans des tâches domestiques interactives

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs proposent CIRRA (Continual Instruction Reconciliation for Robot Agents), un cadre destiné aux robots domestiques qui doivent intégrer une nouvelle consigne utilisateur pendant qu'une tâche est déjà en cours. Le travail, publié sur arXiv (2610.08862v1), introduit aussi CHIRP (Continual Household Instruction Reconciliation and Planning), un benchmark textuel de 120 épisodes couvrant huit environnements domestiques et six catégories d'activités quotidiennes. Sur CHIRP, CIRRA atteint 74,2 % d'accord de décision, soit 30 points de pourcentage de plus que la meilleure méthode de replanification testée. Selon les auteurs, chaque décision de fusion correcte produit un planning bien placé et sans conflit. Sur un humanoïde Unitree G1, le système interrompt la compétence en cours au bon moment dans tous les essais et surpasse toutes les références sur chaque métrique. Le nombre d'essais réels et les valeurs absolues ne figurent pas dans le résumé.

CIRRA repose sur deux niveaux. Un raisonneur sémantique à base de LLM ancre d'abord la consigne entrante sur une compétence exécutable unique et lève les ambiguïtés sur l'action et le lieu. Un niveau structurel, piloté par des règles, conserve la séquence de sous-tâches en cours comme « colonne vertébrale » d'exécution. Il génère des candidats d'intégration en insérant les nouvelles sous-tâches dans les segments correspondant au même lieu. Le LLM n'évalue alors que les segments modifiés, pour repérer dépendances et conflits et retenir l'insertion la plus cohérente. Les sous-tâches communes sont réutilisées afin d'éviter les exécutions redondantes.

L'intérêt est pratique. La plupart des agents embarqués pilotés par LLM régénèrent ou révisent en profondeur le reste du plan à chaque nouvelle consigne, ce qui crée de l'ambiguïté, des incohérences logiques et des gestes inutiles. Restreindre le raisonnement à des segments locaux réduit ce risque et limite aussi le coût d'inférence. Cela illustre une tendance du secteur : combiner un LLM avec des contraintes symboliques plutôt que de s'en remettre à une planification entièrement générative. Les réserves sont claires. Le benchmark est textuel, donc l'incertitude de perception et les échecs de manipulation n'y apparaissent pas. Un taux de 74,2 % laisse aussi un quart des décisions erronées, ce qui reste loin de ce qu'exige un robot qui évolue chez des particuliers. La démonstration sur G1 valide la ponctualité de l'interruption, mais pas la robustesse sur de longues séquences.

Le travail s'inscrit dans la lignée des planificateurs LLM pour robots d'intérieur, de type SayCan et de ses successeurs, qui supposent généralement une consigne unique et un plan fixe. La gestion d'instructions arrivant en cours d'exécution, avec reconfiguration continue, reste peu traitée dans la littérature. L'Unitree G1, humanoïde accessible largement répandu dans les laboratoires, sert de plateforme de validation courante. Aucun pilote commercial ni calendrier de déploiement n'est annoncé. Les prochaines étapes probables sont une extension du benchmark à des environnements simulés ou réels avec perception, et la mesure du coût de calcul face aux approches de replanification complète.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

IA incarnée : perception et action pour l'exécution de tâches par un robot humanoïde en construction
1arXiv cs.RO 

IA incarnée : perception et action pour l'exécution de tâches par un robot humanoïde en construction

Des chercheurs publient sur arXiv (référence 2608.01600v1, soumis début août 2026) un système de perception et d'action destiné aux robots humanoïdes pour l'exécution de tâches de construction. L'architecture combine deux réseaux de neurones profonds : Humanoid-PoseNet, qui capture les postures d'un ouvrier lors d'une démonstration et les traduit en poses mécaniquement réalisables pour un robot humanoïde, puis Humanoid-ActionNet, qui apprend à partir de ces poses traduites les actions que le robot peut réellement exécuter. Testé sur huit tâches liées au chantier, le système atteint une erreur moyenne de suivi de mouvement de 82,45 mm en MPJPE (Mean Per Joint Position Error, l'écart moyen par articulation entre le geste de référence et celui reproduit par le robot). L'abstract ne cite aucun modèle de robot précis, aucun site de déploiement ni partenaire industriel : il s'agit d'un travail de recherche méthodologique et non d'un produit commercialisé. L'enjeu porte sur un goulot d'étranglement bien identifié de l'apprentissage par démonstration chez les humanoïdes : la différence de morphologie et de degrés de liberté (DOF) entre un corps humain et un robot rend la traduction directe des mouvements captés souvent instable ou irréalisable mécaniquement. En séparant explicitement l'étape de retargeting des poses (PoseNet) de l'apprentissage de l'action (ActionNet), l'étude propose une réponse ciblée à ce problème, potentiellement transposable à d'autres tâches physiques répétitives et dangereuses en environnement non structuré, un terrain bien plus exigeant pour un humanoïde que l'entrepôt logistique. Le chiffre de 82,45 mm reste toutefois difficile à juger sans point de comparaison ni contexte sur la difficulté relative des huit tâches testées. Le secteur de la construction, confronté à une pénurie de main-d'œuvre et à des tâches physiquement éprouvantes, est régulièrement cité comme débouché naturel pour les humanoïdes, aux côtés des usines et entrepôts déjà ciblés par Figure, Agility Robotics ou Unitree. Ce travail se positionne en amont de tout déploiement commercial : les auteurs le présentent eux-mêmes comme une « étape précoce » vers des collaborateurs humanoïdes de chantier, sans calendrier de pilotes ni annonce industrielle à ce stade.

RecherchePaper
1 source
CIDER : distillation interactive continue pour l'apprentissage par renforcement incarné
2arXiv cs.RO 

CIDER : distillation interactive continue pour l'apprentissage par renforcement incarné

Des chercheurs en robotique ont publié en août 2026 sur arXiv (référence 2608.21899v1) un article décrivant CIDER (Continual Interactive Distillation for Embodied Reinforcement Learning), un cadre d'apprentissage par renforcement continu pour bras manipulateurs. Le système part d'un constat pratique : l'apprentissage par renforcement interactif en boucle humaine sur robot réel permet déjà d'acquérir une politique de manipulation efficace pour une tâche donnée en quelques dizaines de minutes, mais aucune méthode existante ne parvenait à enchaîner plusieurs tâches sans oubli catastrophique des compétences précédentes. CIDER gèle la politique historique cumulée pour en faire un modèle "professeur" avant chaque nouvel apprentissage, puis alterne apprentissage de la nouvelle tâche et distillation de rétention, avec un mécanisme de séparation des gradients ("gradient routing") qui distingue ceux dédiés à l'acquisition de la nouvelle tâche de ceux dédiés à la préservation des comportements acquis. L'équipe a testé un unique acteur partagé sur six tâches de manipulation réelles, domestiques et industrielles, chaque nouvelle tâche étant apprise en 10 à 20 minutes tout en conservant un taux de succès mesuré élevé sur les tâches précédentes, alors que toutes les méthodes de référence comparées oublient au moins une compétence en cours de séquence. Ce résultat compte dans un secteur où l'apprentissage continu reste l'un des principaux verrous pour des robots véritablement polyvalents. La plupart des politiques de manipulation actuelles, qu'elles reposent sur des modèles vision-langage-action comme Pi-0, GR00T N2 ou Helix, sont entraînées hors ligne sur de larges jeux de données agrégés plutôt que mises à jour en continu sur le terrain ; ajouter une tâche implique généralement un nouveau cycle d'entraînement et une revalidation complète des compétences existantes. En montrant qu'un seul acteur peut apprendre séquentiellement six tâches réelles sans réentraînement complet ni dégradation mesurée des tâches antérieures, CIDER ouvre une piste pour des intégrateurs qui voudraient faire évoluer un robot déployé en usine ou en environnement domestique en lui ajoutant des tâches au fil de l'eau, sans immobiliser la ligne pour une campagne de réentraînement globale. Il s'agit néanmoins d'un résultat de recherche obtenu en laboratoire sur six tâches et un seul bras robotique, pas d'un produit commercialisé ni d'un déploiement en flotte. CIDER s'inscrit dans la lignée des travaux récents sur l'apprentissage par renforcement interactif en boucle humaine, qui ont déjà montré qu'un robot pouvait acquérir une tâche de manipulation en quelques dizaines de minutes avec une supervision humaine ponctuelle ; la contribution ici est d'étendre ce paradigme à l'apprentissage continu, un problème jusque-là traité surtout via l'apprentissage par imitation à grande échelle sur des modèles fondation de type VLA plutôt que par du renforcement en ligne. Les auteurs positionnent explicitement leur approche face aux méthodes existantes de renforcement continu en conditions réelles, qui ne contraignent pas le comportement antérieur et souffrent donc d'un oubli sévère. Des études d'ablation accompagnent l'article pour isoler les choix de conception qui gouvernent l'arbitrage entre stabilité, soit la conservation des acquis, et plasticité, soit la capacité à apprendre du nouveau, un compromis classique en apprentissage continu. L'article ne mentionne ni partenariat industriel, ni feuille de route de déploiement au-delà du laboratoire, ni calendrier de suite annoncé.

RecherchePaper
1 source
REI-Bench : les agents incarnés peuvent-ils comprendre des instructions humaines vagues pour planifier des tâches ?
3arXiv cs.RO 

REI-Bench : les agents incarnés peuvent-ils comprendre des instructions humaines vagues pour planifier des tâches ?

Des chercheurs ont publié REI-Bench (arXiv:2505.10872), le premier benchmark dédié à évaluer comment les planificateurs de tâches robotiques basés sur des grands modèles de langage (LLM) gèrent les instructions humaines vagues. L'étude porte spécifiquement sur les expressions référentielles (ER), formulations dont le sens dépend du contexte dialogique et de l'environnement immédiat, comme "prends ça" ou "mets-le là-bas". Les expériences montrent que cette ambiguïté fait chuter le taux de succès des planificateurs jusqu'à 36,9 points de pourcentage. L'analyse des cas d'échec révèle que la majorité provient d'objets manquants dans les plans générés : le modèle ne résout pas correctement la référence et omet l'objet cible de la séquence d'actions. Ce résultat est significatif pour les intégrateurs et les équipes qui déploient des robots en environnement non contrôlé. La quasi-totalité des benchmarks existants, et donc des pipelines de planification actuels, supposent des instructions claires et structurées, ce qui correspond à un utilisateur expert. Or, les populations prioritaires pour la robotique de service (personnes âgées, enfants, opérateurs non formés) sont précisément celles qui formulent des instructions les plus ambiguës. La dégradation mesurée n'est pas marginale : un écart de 37 points sur le taux de succès représente un planificateur fonctionnel en labo qui devient inutilisable en conditions réelles. Le papier souligne également que les approches classiques d'atténuation, prompts enrichis, chaînes de pensée (chain-of-thought), apprentissage en contexte (in-context learning), ne suffisent pas à combler cet écart. Pour y répondre, les auteurs proposent une méthode appelée "task-oriented context cognition" : avant de générer le plan d'action, le système produit explicitement une instruction reformulée et désambiguïsée à partir du contexte environnemental et dialogique. Cette approche atteint l'état de l'art sur REI-Bench en surpassant les baselines précitées. Le benchmark s'inscrit dans un effort plus large de la communauté pour combler le fossé entre performances en simulation et déploiement réel, un problème central pour des acteurs comme Boston Dynamics, Agility Robotics ou les startups européennes telles qu'Enchanted Tools, dont les robots humanoïdes devront interagir avec des utilisateurs non techniques. Les prochaines étapes naturelles seraient d'intégrer REI-Bench dans les pipelines d'évaluation de modèles VLA (vision-language-action) comme pi0 ou OpenVLA, où la résolution de références visuelles et linguistiques est un point de friction connu.

UEL'approche de désambiguïsation proposée (task-oriented context cognition) est directement applicable aux équipes européennes développant des robots de service pour utilisateurs non techniques, notamment les startups comme Enchanted Tools dont les humanoïdes devront gérer des instructions vagues d'opérateurs non formés.

RecherchePaper
1 source
L'apprentissage par imitation continu reste-t-il ancré ? Un benchmark à perturbations linguistiques pour la rétention des tâches en robotique
4arXiv cs.RO 

L'apprentissage par imitation continu reste-t-il ancré ? Un benchmark à perturbations linguistiques pour la rétention des tâches en robotique

Un benchmark publié sur arXiv (2610.00542v1) s'attaque à une question que les évaluations classiques d'apprentissage par imitation continu laissent de côté : un robot qui conserve ses anciennes compétences reste-t-il réellement guidé par le langage ? Les auteurs construisent un protocole fondé sur LIBERO, avec des variantes d'instructions qui préservent le sens (paraphrases) et d'autres qui le modifient, pour les quatre suites Goal, Spatial, Object et Long. Les expériences de politiques portent surtout sur LIBERO-Goal. Les politiques y sont évaluées après chaque étape d'apprentissage séquentiel, avec les instructions originales puis paraphrasées. Plusieurs méthodes représentatives d'imitation continue sont comparées dans leurs hypothèses d'origine. Trois diagnostics complètent les métriques habituelles d'apprentissage et d'oubli : la robustesse sémantique, l'adaptation à l'objectif et la sensibilité au langage. Le matériel complémentaire est publié sur une page projet intitulée « stillgrounded ». Le résultat principal tient en une phrase : de bonnes performances en apprentissage continu ne garantissent pas un ancrage langagier fiable. Une politique peut afficher un taux de réussite élevé sans avoir conservé le lien entre l'instruction et l'action. Elle peut s'appuyer sur des indices de scène, des associations d'objets ou une structure de tâche mémorisée. Pour les intégrateurs et les responsables techniques qui envisagent des robots pilotés par VLA (vision-language-action) et mis à jour en continu, le point est concret. Un robot qui exécute correctement « ses » tâches en conditions de test peut échouer ou agir de façon incohérente si la consigne est reformulée ou modifiée. Cela relativise aussi les scores de benchmark en rétention de tâches, qui peuvent surestimer la fiabilité réelle d'une compétence retenue. Ces diagnostics permettent de distinguer une compétence conservée et correctement guidée d'une compétence conservée par simple mémorisation du contexte. Il s'agit d'un travail académique en simulation : aucun chiffre de performance n'est donné dans le résumé, et la portée des conclusions reste à vérifier dans le détail des expériences, qui se concentrent sur une seule suite. Ce travail s'inscrit dans le prolongement de LIBERO, benchmark de référence pour l'apprentissage tout au long de la vie en manipulation robotique, devenu terrain d'essai courant pour les politiques conditionnées par le langage. La question de l'ancrage rejoint des critiques déjà formulées sur les modèles VLA, soupçonnés d'ignorer partiellement le texte au profit de régularités visuelles. Aucun acteur industriel n'est directement concerné : il s'agit d'un outil d'évaluation, pas d'un produit. Sa valeur dépendra de son adoption par les équipes qui développent des politiques généralistes et des méthodes d'apprentissage continu. La suite logique serait son extension aux autres suites de LIBERO, puis à des politiques de grande taille et à des données réelles, seules capables de montrer si l'écart entre rétention et ancrage se retrouve hors simulation.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source