Aller au contenu principal
RecherchearXiv cs.RO 

EgoPush : réarrangement multi-objets à la première personne pour robots mobiles via observabilité contrainte du superviseur

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs du laboratoire AI4CE publient une version mise à jour sur arXiv (2602.18071v2) d'EgoPush, un système qui permet à un robot mobile de réarranger plusieurs objets en les poussant vers des positions définies relativement à un point d'ancrage, en utilisant uniquement une caméra RGB-D embarquée, sans estimation de pose globale, sans suivi externe ni carte au moment du déploiement. Le système a été transféré en zero-shot sur un TurtleBot, testé dans des scènes contrôlées puis visuellement encombrées. Le résultat central de l'étude concerne l'apprentissage par distillation enseignant-élève: trois "enseignants" privilégiés, disposant d'un accès complet à l'état de la scène et entraînés avec des récompenses, une architecture et des hyperparamètres identiques, dépassent tous 98% de réussite. Pourtant, leurs "élèves" égocentriques distillés à partir de ces enseignants n'atteignent respectivement que 0%, 54,8% et 87,3% de réussite, la seule variable étant la fonction d'observation de l'enseignant. La solution proposée consiste à contraindre l'enseignant lui-même à des indices visuels limités, ne révélant les références de cible que lorsque l'ancrage est visible au centre du champ de vision, afin que sa supervision reste transmissible à un élève basé sur la profondeur, distillé en ligne. Deux éléments techniques supplémentaires soutiennent cette approche: une interface objet-centrée à rôles groupés partagée entre enseignant et élève, et des récompenses à décroissance temporelle par étapes pour gérer l'attribution de crédit sur des horizons longs. Code, vidéos et une version jouable de la tâche sont publiés sur ai4ce.github.io/EgoPush.

Cette étude a une portée avant tout méthodologique pour la recherche en manipulation mobile: elle montre que l'échec fréquent de la distillation sim-to-réel dans les tâches de réarrangement ne vient pas nécessairement de l'architecture ou de l'algorithme d'apprentissage, mais de la façon dont l'enseignant privilégié perçoit la scène pendant son propre entraînement. Pour les équipes travaillant sur des robots mobiles de manutention ou des AMR en environnement encombré, le résultat suggère qu'il est possible de s'affranchir d'une brique SLAM ou de cartographie globale pour des tâches de poussée d'objets, un enjeu concret puisque l'action de pousser modifie continuellement la scène qu'un système de cartographie devrait par ailleurs reconstruire.

Ce travail s'inscrit dans la lignée des méthodes de "privileged learning" déjà utilisées pour la locomotion de robots à pattes, où un enseignant omniscient guide un élève aux capteurs limités, mais l'applique ici au réarrangement d'objets par poussée, une tâche encore peu couverte par cette littérature. Il se distingue nettement des approches VLA à grande échelle (type GR00T N2, Pi-0 ou Helix) qui visent la généralisation via des modèles fondation entraînés sur des données massives: EgoPush reste une contribution de recherche ciblée, publiée en preprint, testée sur un seul robot en laboratoire, et non un produit ou un pilote industriel.

Dans nos dossiers

À lire aussi

MR-SLAM : supervision spatiale immersive pour la cartographie multi-robots via réalité mixte
1arXiv cs.RO 

MR-SLAM : supervision spatiale immersive pour la cartographie multi-robots via réalité mixte

Une équipe de chercheurs présente MR-SLAM, un système de supervision en réalité mixte permettant à un opérateur unique de téléopérer simultanément une flotte de robots en cours de cartographie. L'opérateur porte un casque Meta Quest 3 et visualise, via la vue passthrough superposée au monde physique, trois TurtleBot3 simulés naviguer dans l'espace, pendant que des panneaux de tableau de bord ancrés spatialement affichent en temps réel l'état de la cartographie de chaque robot. Côté serveur, chaque robot exécute une instance indépendante de SLAM Toolbox sous ROS 2 (Robot Operating System 2), et leurs grilles d'occupation sont fusionnées en continu. Sur cinq sessions d'évaluation de neuf minutes, le système a maintenu un débit de 8,83 plus ou moins 0,16 Hz, cartographié 17,9 plus ou moins 0,8 m² fusionnés et atteint 94,7 plus ou moins 0,5 % de cohérence inter-instances. Une session additionnelle a enregistré une gigue médiane de transformation de 6,3 ms et une couverture de 26,7 m² sur un espace de référence de 41 m². Il s'agit d'une prépublication arXiv (2605.16432), conduite sur robots simulés en environnement contrôlé, et non d'un produit commercialisé. La contribution adresse un vrai goulet d'étranglement opérationnel : à mesure que les flottes robotiques grandissent, les interfaces 2D classiques imposent une charge cognitive croissante à l'opérateur, contraint de reconstruire mentalement la géométrie de l'espace à partir de plusieurs fenêtres de cartes planaires. La réalité mixte avec ancrage spatial délègue cette reconstruction à la perception naturelle humaine. Le taux de cohérence de 94,7 % est encourageant pour la fusion multi-robots, mais les chiffres restent à nuancer : environnement contrôlé de moins de 30 m², trois robots seulement, et couverture incomplète (65 % de la grille de référence atteinte dans la session additionnelle). Pour les intégrateurs industriels et les décideurs B2B, le signal utile est la validité de principe sur matériel grand public (Meta Quest 3, environ 500 euros), ce qui ouvre une voie à des solutions de supervision moins coûteuses que des postes de contrôle dédiés. Le problème de la supervision spatiale de flottes multi-robots est un chantier actif depuis l'essor des AMR dans la logistique et l'inspection industrielle. Les approches dominantes reposent sur des interfaces RVIZ ou des tableaux de bord web 2D, sans restitution de profondeur ni de contexte spatial. Les stacks concurrentes en SLAM multi-robots incluent Cartographer de Google et Nav2 sous ROS 2 ; côté supervision en réalité mixte, les travaux antérieurs ciblaient surtout les bras manipulateurs plutôt que les flottes mobiles. Aucun partenariat industriel ni calendrier de déploiement n'est annoncé. Les prochaines étapes naturelles sont la validation sur robots physiques réels, à plus grande échelle et dans des espaces industriels non contrôlés.

UEImpact indirect et lointain : les intégrateurs européens d'AMR en logistique pourraient à terme bénéficier d'interfaces de supervision moins coûteuses basées sur du matériel grand public, mais aucun acteur FR/EU n'est impliqué et le système reste au stade de préprint sur robots simulés.

RecherchePaper
1 source
Les modèles du monde latents comprennent-ils les contraintes de sécurité partiellement observables ?
2arXiv cs.RO 

Les modèles du monde latents comprennent-ils les contraintes de sécurité partiellement observables ?

Une équipe de chercheurs publie sur arXiv (2510.06492v2) une étude systématique des défaillances des modèles du monde latents face à des contraintes de sécurité partiellement observables. Appliquée à un bras manipulateur Franka Research 3 sur des tâches de cuisine, la recherche identifie deux modes de défaillance distincts. Le premier, appelé "estimation gap", survient quand l'observation courante ne révèle pas une grandeur critique pour la sécurité : la température d'une surface de cuisson, invisible en RGB seul, en est l'exemple central. Le second, le "prediction gap", désigne les situations où la défaillance devient observable dès qu'elle se produit, mais ne peut être anticipée à partir des observations disponibles. Les auteurs proposent deux diagnostics quantitatifs associés : une mesure d'observabilité de sécurité basée sur l'information mutuelle, et une mesure de prédictibilité future fondée sur des rollouts simulés. Deux stratégies de mitigation sont ensuite validées en hardware : la supervision multimodale privilégiée (ajout de capteurs thermiques ou tactiles au flux RGB) pour combler les estimation gaps, et la calibration de risque conforme (conformal risk calibration) pour les prediction gaps, avec des résultats mesurés sur le robot réel. Ces résultats posent une question structurante pour le secteur : les représentations latentes produites par un world model entraîné sur observations RGB sont-elles suffisantes pour garantir un contrôle fiable en environnement industriel ? La réponse empirique ici est non, et ce constat a des implications directes pour les intégrateurs qui déploient des bras robotisés sur des lignes de production où des variables non-visuelles (température, force de contact, couple) conditionnent la sécurité. La calibration conforme, issue de la théorie statistique de la prédiction, permet de borner le risque de violation de contrainte sans retrainer le modèle, ce qui représente un avantage pratique pour les déploiements existants. La contrepartie documentée est une conservatisme accru du contrôleur, se traduisant par une réduction du taux de complétion des tâches : la sécurité est améliorée, mais au prix d'une productivité moindre, un arbitrage classique que les COO devront quantifier pour leur contexte. Le travail s'inscrit dans la lignée des world models de type Dreamer et RSSM (Recurrent State Space Model), popularisés par DeepMind, qui apprennent une représentation compressée de l'état du monde pour planifier en espace latent. Cette approche gagne du terrain face aux politiques purement réactives, notamment dans les architectures VLA (Vision-Language-Action) portées par des équipes comme Physical Intelligence (Pi-0), Google DeepMind (GR00T) ou Figure AI. La plupart de ces modèles s'appuient sur des flux RGB ou RGBD, ignorant les modalités thermiques ou haptiques, ce que cette étude remet en cause sur des tâches à risque. Le Franka Research 3 est le banc d'essai standard de la communauté, ce qui facilite la reproductibilité. Les prochaines étapes probables incluent l'extension à des configurations multi-bras, l'intégration dans des pipelines VLA de production, et la question ouverte de savoir comment sélectionner automatiquement les modalités nécessaires à la sécurité pour une tâche donnée.

RechercheActu
1 source
Titre curvature-contraint et à vitesse constante pour l'arrivée simultanée distribuée dans les systèmes multi-robots
3arXiv cs.RO 

Titre curvature-contraint et à vitesse constante pour l'arrivée simultanée distribuée dans les systèmes multi-robots

Une équipe de recherche propose, dans un article publié le 17 juillet 2026 sur arXiv (2607.14781v1), une méthode de contrôle distribué permettant à plusieurs robots mobiles d'atteindre un point cible exactement au même instant, tout en respectant deux contraintes fortes : une courbure de trajectoire limitée et une vitesse constante (potentiellement différente d'un robot à l'autre). Ce type de contrainte correspond typiquement aux drones à voilure fixe, qui ne peuvent ni s'arrêter ni tourner sur place. L'approche s'appuie sur le protocole de consensus maximum et sur les propriétés géométriques des chemins de Dubins, une famille de trajectoires courbes à rayon minimal largement utilisée en planification de mouvement. Les auteurs introduisent une variable de temps virtuel et conçoivent une loi de contrôle hybride, combinant commande optimale et commande proportionnelle saturée, qui pousse chaque robot à converger vers le temps virtuel maximal observé parmi ses voisins. Le dispositif a été validé par simulations et expérimentations, avec une preuve théorique d'optimalité du temps d'arrivée dans certains cas. L'enjeu dépasse l'exercice académique : la synchronisation d'arrivée est une brique fondamentale pour l'encerclement coopératif, les opérations de secours après catastrophe ou la surveillance environnementale par flotte de drones ou d'AMR. Un point souvent négligé dans les démonstrations de coordination multi-robots est justement la contrainte de courbure et de vitesse constante, qui rapproche le problème des conditions réelles de vol plutôt que d'un cadre idéalisé où les robots peuvent accélérer, freiner ou pivoter librement. Le caractère distribué et le faible besoin en communication rendent la méthode potentiellement adaptable à des essaims de taille variable sans coordinateur central, un critère clé pour les intégrateurs qui cherchent à déployer des flottes robustes aux pertes de liaison. Le problème de l'arrivée simultanée s'inscrit dans la lignée des travaux sur les chemins de Dubins et le contrôle formation de drones à voilure fixe, un champ de recherche actif depuis plusieurs années en robotique aérienne militaire et civile. Contrairement aux approches centralisées classiques, qui exigent un calcul global des trajectoires, la méthode proposée ici mise sur la scalabilité et le temps réel. L'article ne mentionne pas de partenariat industriel ni de calendrier de transfert technologique ; il s'agit à ce stade d'une contribution théorique et expérimentale en laboratoire, dont l'application à des essaims commerciaux ou militaires reste à démontrer à plus grande échelle.

RecherchePaper
1 source
Organisation robotique de bureau : une approche multi-primitive pour manipuler des objets hétérogènes via les contraintes environnementales
4arXiv cs.RO 

Organisation robotique de bureau : une approche multi-primitive pour manipuler des objets hétérogènes via les contraintes environnementales

Une équipe de recherche a déposé sur arXiv (référence 2605.02135, mai 2025) un framework de manipulation pour robots de service dédié à l'organisation de bureaux, capable de traiter simultanément des objets rigides et déformables posés à plat sur une surface. Le système repose sur trois primitives de manipulation exploitant l'environnement physique : un saisissement par contact direct pour les petits objets, un push-grasp assisté par le bord de la table pour les objets rigides plans, et un geste de levering (soulèvement par effet de levier) pour les objets déformables plans comme des feuilles de papier ou des pochettes. Un pipeline de perception géométrique, entraîné sur des datasets augmentés d'objets de bureau peu courants, assure l'estimation de pose et la détection des contraintes physiques disponibles, notamment les arêtes de table. Un planificateur de tâches orchestre ces primitives pour des séquences multi-objets incluant collecte et empilement. Les expériences en conditions réelles démontrent la robustesse de l'approche, et le code source ainsi que les vidéos sont publiés en accès libre. L'intérêt principal de ce travail est l'exploitation systématique des contraintes environnementales comme ressource de manipulation plutôt que comme obstacle, une inversion de perspective qui améliore la robustesse sans nécessiter de hardware dédié tel que ventouses ou pinces spécialisées. La gestion des objets déformables, longtemps considérée comme un verrou pour les robots de service, est ici abordée sans apprentissage end-to-end, ce qui favorise la traçabilité et le débogage en contexte d'intégration industrielle. Pour un intégrateur ou un COO logistique, ce type de framework à primitives explicites est plus directement industrialisable que les approches VLA (Vision-Language-Action) dont la robustesse en déploiement réel à grande échelle reste discutée dans la littérature. Ce travail s'inscrit dans le courant du task-and-motion planning (TAMP), qui cherche à combiner la robustesse des primitives classiques avec la flexibilité perceptive nécessaire aux environnements non structurés, en alternative aux méthodes d'imitation ou de reinforcement learning pur. Il se positionne sans atteindre encore leur généralisabilité sur de larges catalogues d'objets, ce qui constitue la limite principale de l'approche. Les acteurs actifs sur la manipulation fine de bureau incluent Google DeepMind avec ses travaux RT-2 et π0, Physical Intelligence, et côté académique des labos comme ETH Zurich ou CMU ; aucun acteur francophone ou européen n'est directement impliqué dans ce papier. Les suites naturelles seraient d'étendre ces primitives à des objets tridimensionnels non plans et d'évaluer le passage à l'échelle sur des manipulateurs commerciaux comme le Kinova Gen3 ou le Franka Research 3.

RecherchePaper
1 source