CIRRA : réconciliation continue des instructions à deux niveaux pendant l'exécution, pour des robots agents incarnés dans des tâches domestiques interactives
Des chercheurs proposent CIRRA (Continual Instruction Reconciliation for Robot Agents), un cadre destiné aux robots domestiques qui doivent intégrer une nouvelle consigne utilisateur pendant qu'une tâche est déjà en cours. Le travail, publié sur arXiv (2610.08862v1), introduit aussi CHIRP (Continual Household Instruction Reconciliation and Planning), un benchmark textuel de 120 épisodes couvrant huit environnements domestiques et six catégories d'activités quotidiennes. Sur CHIRP, CIRRA atteint 74,2 % d'accord de décision, soit 30 points de pourcentage de plus que la meilleure méthode de replanification testée. Selon les auteurs, chaque décision de fusion correcte produit un planning bien placé et sans conflit. Sur un humanoïde Unitree G1, le système interrompt la compétence en cours au bon moment dans tous les essais et surpasse toutes les références sur chaque métrique. Le nombre d'essais réels et les valeurs absolues ne figurent pas dans le résumé.
CIRRA repose sur deux niveaux. Un raisonneur sémantique à base de LLM ancre d'abord la consigne entrante sur une compétence exécutable unique et lève les ambiguïtés sur l'action et le lieu. Un niveau structurel, piloté par des règles, conserve la séquence de sous-tâches en cours comme « colonne vertébrale » d'exécution. Il génère des candidats d'intégration en insérant les nouvelles sous-tâches dans les segments correspondant au même lieu. Le LLM n'évalue alors que les segments modifiés, pour repérer dépendances et conflits et retenir l'insertion la plus cohérente. Les sous-tâches communes sont réutilisées afin d'éviter les exécutions redondantes.
L'intérêt est pratique. La plupart des agents embarqués pilotés par LLM régénèrent ou révisent en profondeur le reste du plan à chaque nouvelle consigne, ce qui crée de l'ambiguïté, des incohérences logiques et des gestes inutiles. Restreindre le raisonnement à des segments locaux réduit ce risque et limite aussi le coût d'inférence. Cela illustre une tendance du secteur : combiner un LLM avec des contraintes symboliques plutôt que de s'en remettre à une planification entièrement générative. Les réserves sont claires. Le benchmark est textuel, donc l'incertitude de perception et les échecs de manipulation n'y apparaissent pas. Un taux de 74,2 % laisse aussi un quart des décisions erronées, ce qui reste loin de ce qu'exige un robot qui évolue chez des particuliers. La démonstration sur G1 valide la ponctualité de l'interruption, mais pas la robustesse sur de longues séquences.
Le travail s'inscrit dans la lignée des planificateurs LLM pour robots d'intérieur, de type SayCan et de ses successeurs, qui supposent généralement une consigne unique et un plan fixe. La gestion d'instructions arrivant en cours d'exécution, avec reconfiguration continue, reste peu traitée dans la littérature. L'Unitree G1, humanoïde accessible largement répandu dans les laboratoires, sert de plateforme de validation courante. Aucun pilote commercial ni calendrier de déploiement n'est annoncé. Les prochaines étapes probables sont une extension du benchmark à des environnements simulés ou réels avec perception, et la mesure du coût de calcul face aux approches de replanification complète.
Pas d\'impact direct sur la France/UE
Dans nos dossiers




