Aller au contenu principal
RecherchearXiv cs.RO 

Imitation conditionnée par un plan pour récupérer des objets malgré l'auto-occlusion en encombrement dense

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent TRACE, un cadre d'imitation conditionnée par un plan, conçu pour extraire un objet d'un encombrement dense lorsque le bras robotique masque lui-même les objets qu'il déplace. Le système initialise un jumeau numérique à partir d'une seule observation non occultée. Un enseignant privilégié, qui accède à l'état complet de la scène simulée, y génère une trajectoire nominale fixe. Un étudiant récurrent combine le contexte local de cette trajectoire, des observations partielles des objets et la proprioception pour choisir des actions qui corrigent les écarts par rapport à la prédiction. Le clonage comportemental initialise l'étudiant, puis DAgger l'affine avec des étiquettes de l'enseignant sur les états réellement visités par l'étudiant. En simulation, sur 511 scènes de test, TRACE atteint 90,7 % de succès, contre 43,4 % pour la simple relecture de la trajectoire nominale et 96,7 % pour l'enseignant en boucle fermée. À budget égal de 26 373 étiquettes, la supervision sur les états de l'étudiant donne 87,8 %, contre 66,7 % pour le clonage des seules démonstrations expertes. Sur un UR5e, le taux de succès est de 90,0 %, contre 95,0 % pour l'enseignant, et le temps d'exécution total passe de 192,7 s à 67,3 s.

L'intérêt tient à ce que le résultat cible un goulot concret de la manipulation en environnement encombré : les retraits répétés du bras pour retrouver de la visibilité. L'enseignant en boucle fermée en impose en moyenne 16,8 par essai pendant la poussée, ce qui explique l'essentiel de l'écart de durée. TRACE les évite et ne conserve qu'un retrait final pour évaluer la saisissabilité de l'objet. Pour un intégrateur, le gain d'un facteur 2,9 sur le temps de cycle, pour une perte de cinq points de succès, est le compromis à retenir. Le déploiement ne requiert ni requêtes à l'enseignant ni simulations en ligne pendant la poussée, ce qui allège les contraintes de calcul embarqué. L'expérience montre aussi que l'échantillonnage sur les états de l'étudiant apporte un gain au-delà du seul nombre d'étiquettes, un argument en faveur de DAgger face au clonage pur. Les réserves sont classiques : l'échantillon réel (probablement 20 essais, d'après les pourcentages) est mince, un seul bras est testé, et la méthode suppose une première vue dégagée pour construire le jumeau numérique.

Ces travaux s'inscrivent dans la lignée des approches enseignant-étudiant avec information privilégiée, déjà courantes en locomotion et en manipulation, ici appliquées au cas précis de l'auto-occultation. Ils se distinguent des politiques généralistes de type VLA (vision-langage-action), comme Pi-0 ou GR00T, qui visent la généralité plutôt que la robustesse sur une tâche étroite. Il s'agit d'une prépublication arXiv sans produit ni déploiement industriel annoncé. Les auteurs promettent de publier code et données sur trace-retrieval.github.io, ce qui permettra de vérifier les résultats. Les suites logiques seraient de tester d'autres bras et d'autres densités d'encombrement, puis de traiter des scènes où l'observation initiale est elle-même partiellement occultée, condition plus proche des applications de picking en entrepôt.

À lire aussi

Apprentissage par imitation conditionné par phase avec récupération autonome d'échec pour la manipulation robuste d'objets déformables
1arXiv cs.RO 

Apprentissage par imitation conditionné par phase avec récupération autonome d'échec pour la manipulation robuste d'objets déformables

Des chercheurs ont publié le 29 mai 2026 un article (arXiv:2605.29407) présentant un système robotique capable de manipuler des objets déformables, comme des vêtements, avec une récupération autonome en cas d'échec. Le système, baptisé PHASER, repose sur une architecture hiérarchique en boucle fermée : un encodeur ACT (Action Chunking with Transformers) conditionné via FiLM (Feature-wise Linear Modulation) adapte l'extraction de features selon la phase courante de la tâche, permettant à une politique unifiée de produire des comportements distincts à chaque étape sans dupliquer les modèles. Un prédicteur de phase multimodal fusionne retour visuel, force et pose en temps réel pour estimer l'état courant et détecter les échecs de contact invisibles à la caméra. Un contrôleur d'impédance hybride assure l'exécution compliante. Validé sur la tâche d'accrochage et de retrait d'un T-shirt en manipulation bimanuelle, le système fait passer le taux de succès de 56 % à 87 % grâce à la récupération autonome des erreurs. Ce résultat est notable car la manipulation d'objets déformables reste un des verrous les plus résistants de la robotique industrielle et domestique : les propriétés mécaniques imprévisibles du tissu rendent caduques les approches rigides classiques. Le problème de state aliasing, où des observations visuellement similaires exigent des actions contradictoires selon la phase, sabote les politiques d'imitation standard en inférence markovienne. En conditionnant la politique sur la phase estimée plutôt que sur l'observation brute, et en intégrant le retour de force comme signal de détection d'anomalie, les auteurs montrent qu'il est possible de construire un pipeline sim-to-real sans oracle externe. Les études d'ablation confirment que le conditionnement FiLM surpasse significativement les baselines non conditionnées et celles à token-level, et l'analyse t-SNE valide que les représentations apprises sont bien séparées par phase. L'approche s'inscrit dans la lignée des travaux sur l'imitation learning pour la manipulation dextre, notamment ACT (Chi et al., 2023) et les Diffusion Policies, qui peinent sur les objets non rigides. Elle se distingue des frameworks VLA (Vision-Language-Action) à grande échelle, comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, qui misent sur la généralisation par préentraînement massif plutôt que sur la structure de la tâche. PHASER adopte une stratégie inverse : contrainte forte sur la structure de phase, données limitées, récupération explicite. Les auteurs publient le code et les vidéos en open access. Les prochaines étapes naturelles incluent l'extension à d'autres classes de vêtements et la réduction de la dépendance à l'interface de télé-opération haptique pour la collecte de données d'entraînement.

RecherchePaper
1 source
OccPlanner : planificateur par diffusion conditionné par l'occupation pour la navigation vers un objectif visuel
2arXiv cs.RO 

OccPlanner : planificateur par diffusion conditionné par l'occupation pour la navigation vers un objectif visuel

OccPlanner, un planificateur de navigation robotique conditionné par occupation 3D, cible la navigation "pixel-goal" : l'objectif est désigné directement dans l'image caméra du robot, sans profondeur métrique ni information de franchissabilité fournie a priori. Présenté dans un article arXiv (référence 2608.14160v1), le système ancre ce pixel-cible dans un espace métrique égocentrique en le conditionnant séquentiellement sur le contexte visuel temporel et des caractéristiques d'occupation locale 3D apprises. Les auteurs introduisent également L3ROcc, une méthode qui convertit des vidéos de navigation RGB monoculaires en annotations d'occupation 3D locale centrées robot, via reconstruction géométrique et raisonnement de visibilité par lancer de rayons. Entraîné sur le jeu de données InternData-N1 et évalué en simulation "closed-loop" sur quatre catégories de scènes inédites issues d'InternScenes, OccPlanner fait passer le taux de succès moyen de 20,81% à 71,55% par rapport à la méthode de référence NavDP sur des distances-cibles de 5 à 8 mètres, atteignant 86,20% et 84,92% dans des scènes encombrées faciles et difficiles respectivement. Des essais réels en boucle ouverte sur un robot quadrupède Unitree Go2 apportent des indices préliminaires de transfert simulation-vers-réel. Ce résultat s'attaque à un verrou concret de la navigation robotique par vision : transformer un simple pixel désigné dans une image en objectif de déplacement sûr et atteignable, sans capteur de profondeur dédié ni carte préalable. Le gain de performance rapporté, un triplement du taux de succès face à une méthode existante, suggère que la modélisation explicite de l'occupation 3D locale comble une partie du fossé entre perception 2D et planification 3D continue, un problème central pour les intégrateurs qui déploient des robots mobiles autonomes (AMR) en environnements encombrés et changeants. Reste que les résultats en conditions réelles se limitent à des essais en boucle ouverte sur une seule plateforme, le Go2 de Unitree, ce qui constitue une preuve de concept plutôt qu'une validation de déploiement opérationnel. Ce travail s'inscrit dans la lignée des recherches en navigation guidée par langage ou par image, où la comparaison avec NavDP sert de référence de performance existante dans le domaine. Il s'appuie sur des jeux de données de simulation à grande échelle, InternData-N1 pour l'entraînement et InternScenes pour l'évaluation, reflétant une tendance du secteur à générer des données d'entraînement synthétiques massives plutôt que de dépendre uniquement de captures réelles coûteuses. La prochaine étape naturelle, non couverte par cette publication, consisterait à valider le système en boucle fermée sur robot physique et sur davantage de plateformes matérielles avant d'envisager une intégration industrielle.

RecherchePaper
1 source
Engagement sélectif pour la récupération d'objets guidée par le langage en observabilité partielle
3arXiv cs.RO 

Engagement sélectif pour la récupération d'objets guidée par le langage en observabilité partielle

Un article publié sur arXiv (référence 2609.23131v1, catégorie "nouveau") présente un système robotique en boucle fermée destiné à retrouver un objet désigné en langage naturel par rapport à un contenant de référence, dans des scènes partiellement observables. À chaque étape, le système arbitre entre quatre options: recueillir davantage de preuves visuelles, interagir avec la scène, saisir un candidat, ou s'abstenir. Il maintient une croyance conjointe persistante sur l'identité de la cible, sa relation au contenant et sa présence, structurée en trois hypothèses (objet suivi, cible non observée, cible absente), mise à jour par des observations catégorielles issues d'un modèle vision-langage (VLM) conditionnées par le point de vue. L'éligibilité de la prise est calibrée par prédiction conforme et combinée à la faisabilité robotique pour décider du moment de l'engagement, tandis qu'une planification en espace de croyances à horizon fini sélectionne les actions de collecte d'information. Sur cinq scénarios simulés, la méthode réussit 19 épisodes sur 25, contre 12 sur 25 pour la meilleure référence adaptée à la tâche, et c'est la seule politique testée à obtenir au moins une réussite dans chacun des cinq scénarios. Des essais sur robot réel montrent une ré-observation en boucle fermée et une récupération autonome après des échecs de prise provoqués artificiellement, mais des échecs de point de vue injectés se traduisent par de faux abandons, le robot renonçant à tort. Ces résultats s'adressent directement à un problème connu de la manipulation robotique en logistique et en intralogistique: la plupart des systèmes actuels supposent une observabilité quasi complète de la scène, ce qui s'effondre dès qu'un objet est partiellement occulté dans un bac ou un tiroir. En formalisant explicitement le choix entre agir, observer davantage ou renoncer, ce travail illustre une piste pour réduire les échecs silencieux des pipelines vision-langage-action (VLA) déployés en conditions réelles, où la confiance mal calibrée d'un modèle mène souvent à des prises ratées plutôt qu'à un report prudent. Les auteurs notent toutefois eux-mêmes une limite importante: leurs ablations montrent que le système complet ne surpasse pas systématiquement des variantes simplifiées, ce qui nuance la promesse d'un gain automatique lié à la complexité du cadre proposé. Ce travail s'inscrit dans la lignée des recherches académiques sur la prise de décision sous incertitude en robotique de manipulation, à la croisée des modèles vision-langage et de la planification bayésienne, sans lien annoncé avec un produit commercial ou un déploiement industriel. Il reste à ce stade au niveau de la validation en simulation complétée par des essais limités sur robot physique, et non un système prêt à l'emploi. Les auteurs ne mentionnent ni partenariat industriel ni calendrier de transfert vers une plateforme commerciale, ce qui distingue clairement cette contribution des annonces produit du secteur des humanoïdes ou des bras robotiques en entrepôt.

RecherchePaper
1 source
4arXiv cs.RO 

EmbodiRSI : l'auto-amélioration récursive pour une adaptation des robots économe en données

Des chercheurs publient sur arXiv EmbodiRSI, un système « agentique » d'auto-amélioration récursive (RSI) pour adapter des politiques de manipulation robotique à de nouvelles tâches et environnements. Le principe repose sur une boucle « real-to-sim-to-real » : une simulation spécifique à la tâche est construite à partir du scénario de déploiement cible, puis sert d'environnement peu coûteux pour améliorer la politique par itérations avant son retour sur le robot physique. Deux mécanismes ferment la boucle. La Collaborative Error Correction génère, avec l'aide d'un agent, des trajectoires correctives à partir des états que la politique a réellement atteints. L'Adaptive Data Collection oriente la génération de démonstrations expertes vers les faiblesses actuelles de la politique. Sur trois environnements de table et 14 sous-tâches, le taux de réussite autonome en simulation, équilibré par scène, passe de 50,4 % à 83,5 % en deux mises à jour RSI. Avec 400 trajectoires simulées adaptatives et seulement dix trajectoires réelles de raffinement par sous-tâche, le système atteint 83,1 % de réussite réelle, contre 75,0 % pour une adaptation à partir de 200 démonstrations réelles par sous-tâche. L'enjeu est le coût de la donnée, principal goulot d'étranglement du déploiement de politiques de type VLA ou d'imitation chez les intégrateurs. Ici, le volume de données réelles est divisé par vingt (10 contre 200 démonstrations par sous-tâche) pour un résultat supérieur de plus de huit points. Si ce résultat se confirme, la simulation spécifique au site cesse d'être un simple banc d'essai et devient un espace de travail réutilisable pour le préchauffage, l'évaluation répétable, le diagnostic des échecs et la génération ciblée de données. Cela réduit la dépendance à la téléopération, coûteuse en main-d'œuvre. Le résultat nuance aussi l'idée que le sim-to-real exige une simulation généraliste : une simulation étroite, construite pour un seul déploiement, peut suffire. Des réserves s'imposent toutefois. Les tâches sont de la manipulation sur table, le nombre de sous-tâches est limité, la fidélité de la reconstruction de scène n'est pas détaillée dans le résumé, et aucun temps de cycle, taux de panne ni coût de construction de la simulation n'est donné. Le travail reste une prépublication, sans pilote industriel annoncé. Ce travail s'inscrit dans la poussée actuelle vers l'adaptation efficace en données des politiques généralistes, alors que le fine-tuning post-entraînement par démonstrations réelles reste la pratique dominante. Il rejoint les approches de reconstruction de scènes pour la simulation (real-to-sim), de génération de données synthétiques et de boucles d'amélioration pilotées par des agents, explorées par les grands laboratoires et les équipes derrière des modèles comme Pi-0 ou GR00T. L'originalité tient au pilotage de la collecte par les échecs observés de la politique, plutôt qu'à une génération de données uniforme. Les prochaines étapes à surveiller sont la validation sur des tâches plus longues et sur des objets déformables ou en contact riche, la réplication par des tiers, la publication du code et des benchmarks, et surtout un test en conditions industrielles, où la variabilité des scènes dépasse largement celle d'un plateau de laboratoire.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source