Aller au contenu principal
Apprendre à lancer des objets en toute sécurité dans des environnements à obstacles multiples
RecherchearXiv cs.RO 

Apprendre à lancer des objets en toute sécurité dans des environnements à obstacles multiples

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE
Apprendre à lancer des objets en toute sécurité dans des environnements à obstacles multiples
▶ Voir sur YouTube

Une équipe de recherche en robotique présente dans un article publié sur arXiv (2607.06388v1) une nouvelle méthode permettant à un bras robotique d'apprendre à lancer des objets dans un panier cible tout en évitant des obstacles disposés aléatoirement dans la scène. Baptisée PFR (representation par champ de potentiel), l'approche encode sur une grille de taille fixe à la fois l'attraction exercée par le panier et la répulsion générée par les obstacles, ce qui permet à des politiques d'apprentissage par renforcement de généraliser à un nombre et à des configurations d'obstacles quelconques, y compris jamais vus à l'entraînement. La politique est d'abord initialisée à partir de démonstrations kinesthésiques, puis optimisée en simulation à l'aide de trois algorithmes de référence, SAC, DDPG et TD3, SAC obtenant les résultats les plus stables. Sur robot réel, avec des objets à lancer inédits, le système atteint jusqu'à 90% de réussite dans des scènes encombrées, un transfert simulation-réel jugé robuste par les auteurs.

Ce résultat comble un angle mort des travaux précédents comme TossingBot, qui apprenaient à lancer des objets à partir d'entrées visuelles mais supposaient un espace de travail dégagé, une hypothèse rarement vérifiée en environnement industriel réel (entrepôt, ligne de tri, cellule partagée avec d'autres équipements). Pour les intégrateurs et les décideurs en logistique ou en manutention, la capacité à placer un objet hors de portée directe du bras tout en évitant des obstacles dynamiques ouvre la voie à des cellules de tri plus denses et moins contraintes en termes d'agencement, sans multiplier les capteurs de sécurité périmétrique. Le taux de succès élevé sur objets et configurations non vus en fait aussi un argument en faveur des représentations d'état compactes plutôt que des encodages explicites de chaque obstacle, plus coûteux à faire passer à l'échelle.

Le travail s'inscrit dans la lignée des recherches sur le lancer robotique initiées par TossingBot, en y ajoutant la dimension de l'évitement d'obstacles restée peu étudiée jusqu'ici. Les auteurs comparent explicitement leur représentation par champ de potentiel à des encodages d'état classiques pour démontrer son avantage en généralisation. Une vidéo de démonstration accompagne la publication, mais aucun calendrier de déploiement industriel ni partenariat commercial n'est mentionné à ce stade: il s'agit pour l'instant d'un résultat de recherche académique, pas d'un produit prêt à intégrer.

Dans nos dossiers

À lire aussi

Naviguer ou déplacer l'obstacle : planification parmi des obstacles mobiles en environnements inconnus
1arXiv cs.RO 

Naviguer ou déplacer l'obstacle : planification parmi des obstacles mobiles en environnements inconnus

Une équipe de chercheurs propose un nouveau cadre de planification pour le problème dit de « Navigation Among Movable Obstacles » (NAMO), décrit dans un article déposé sur arXiv le 19 septembre 2026 (arXiv:2609.19541v1). Le problème traité est le suivant : lorsque tous les chemins vers un objectif sont bloqués, un robot mobile doit décider quels objets déplacer, dans quel ordre, et où les positionner pour dégager un passage. Contrairement aux planificateurs NAMO classiques, qui supposent une carte de l'environnement connue à l'avance, ce travail cible le cas d'un environnement inconnu, découvert progressivement par les capteurs embarqués du robot. Le système choisit en ligne entre naviguer ou relocaliser un objet, en comparant des plus courts chemins calculés en traitant chaque objet mobile détecté soit comme un obstacle fixe, soit comme un élément amovible. Pour la relocalisation, l'approche recherche, à la différence des méthodes existantes limitées à un raisonnement local, des séquences de déplacements interdépendantes, et s'appuie sur un grand modèle de langage (LLM) pour biaiser l'échantillonnage des solutions candidates. Les auteurs rapportent, en simulation numérique, un passage à l'échelle sur des environnements encombrés nécessitant des relocalisations en chaîne, avec une meilleure qualité de plan que les méthodes de référence existantes. Ce travail s'attaque à un angle mort connu de la robotique mobile autonome : la plupart des systèmes déployés aujourd'hui évitent le problème en supposant un couloir dégagé ou s'arrêtent simplement face à un obstacle, ce qui limite leur autonomie hors des entrepôts optimisés. En traitant explicitement l'ambiguïté entre chemin praticable dans l'espace inexploré et blocage réel nécessitant une relocalisation, l'approche se rapproche des conditions réelles de déploiement en environnement humain non structuré (hôpital, domicile, espace de service), plutôt que du cas contrôlé de l'entrepôt cartographié. Le recours à un LLM comme simple biais d'échantillonnage plutôt que comme contrôleur direct illustre une tendance plus large à intégrer les modèles de langage en appoint de pipelines de planification géométrique classiques, sans sacrifier leurs garanties de sécurité. Pour les intégrateurs, il s'agit toutefois d'une contribution académique validée uniquement en simulation, sans démonstration sur robot physique à ce stade. Le NAMO est étudié depuis plusieurs décennies comme extension du problème classique de planification de chemin sans collision, mais les approches se divisent généralement entre celles qui exigent une carte complète préétablie et des méthodes plus récentes pour environnements inconnus, restées cantonnées à des décisions locales et incapables de planifier des séquences de déplacements dépendantes entre elles. C'est cette lacune que comble le framework présenté, en combinant recherche par échantillonnage et guidage par LLM. L'article ne mentionne ni plateforme robotique spécifique, ni partenaire industriel, ni calendrier d'essais sur matériel réel : il s'agit d'un pré-print académique, et non d'une annonce produit. Une validation sur robot physique et une comparaison directe avec les planificateurs déployés en logistique restent les étapes attendues pour confirmer l'intérêt pratique de l'approche.

RecherchePaper
1 source
Adaptation des compétences avec prise en compte de la sécurité pour l'apprentissage par renforcement en environnements dynamiques
2arXiv cs.RO 

Adaptation des compétences avec prise en compte de la sécurité pour l'apprentissage par renforcement en environnements dynamiques

Une équipe de chercheurs présente Dist-GPRL, un framework d'apprentissage par renforcement guidé par la sécurité pour l'adaptation de compétences robotiques, dans une prépublication arXiv (2609.11433v1). Construit sur une paramétrisation de trajectoires par processus gaussiens (GP), le système adapte séquentiellement des fenêtres locales de points de passage plutôt que la trajectoire complète à chaque étape, la covariance du GP assurant des mises à jour cohérentes dans le temps et réduisant les difficultés d'attribution de crédit propres à l'adaptation globale. La sécurité combine un a priori de sous-espace faisable dérivé du planificateur Hausdorff Approximation Planner (HAP) et des récompenses fondées sur un champ de distance aux obstacles mis à jour dynamiquement, complétées par un régularisateur qui préserve les profils de vitesse et d'accélération démontrés. Testé sur deux tâches de manipulation d'objets dynamiques, d'abord en simulation puis transféré à l'exécution réelle sur robot, Dist-GPRL affiche un taux de réussite plus élevé, moins de collisions et un apprentissage plus stable que les méthodes de référence. L'enjeu dépasse la démonstration académique. La plupart des cadres RL d'adaptation de compétences imposent des observations fixes ou des schedules d'exploration rigides pour rester stables, ce qui les rend inadaptés dès qu'un environnement encombré ou des objets mobiles entrent en jeu, un scénario courant en manipulation industrielle. En intégrant la sécurité directement dans la boucle d'exploration plutôt qu'en garde-fou externe, ce travail s'attaque à un point de friction réel pour les intégrateurs qui veulent déployer des politiques apprises près d'obstacles ou d'opérateurs. Le transfert simulation vers réel réussi, même circonscrit à deux tâches, reste un indice utile mais ne vaut pas preuve de robustesse à grande échelle. La méthode s'inscrit dans la lignée des approches de paramétrisation de compétences par processus gaussiens, réputées compactes mais fragiles face aux changements d'environnement, défaut que Dist-GPRL cherche à corriger en s'appuyant sur le planificateur HAP pour la garantie géométrique de sécurité. Elle se distingue ainsi des architectures VLA de bout en bout type Pi-0 ou GR00T N2, en combinant planification classique et apprentissage par renforcement plutôt qu'un modèle unique bout à bout. La publication ne mentionne ni partenaire industriel, ni robot commercial, ni calendrier de déploiement: il s'agit à ce stade d'une contribution de recherche validée en simulation et sur un banc réel limité, sans pilote industriel annoncé.

RecherchePaper
1 source
Apprentissage de la faisabilité des mouvements à partir de nuages de points en environnements encombrés
3arXiv cs.RO 

Apprentissage de la faisabilité des mouvements à partir de nuages de points en environnements encombrés

Une équipe de chercheurs a publié sur arXiv (réf. 2606.26700) une étude sur la prédiction de faisabilité de mouvement pour un bras manipulateur à 7 degrés de liberté (7-DOF), opérant dans des environnements encombrés à partir d'observations RGB-D brutes. Le coeur du travail est GRASPFC-PTX, un transformeur appliqué à des nuages de points 3D, capable de prédire si une saisie est réalisable sans reconstruire de modèle CAO de l'environnement. Pour entraîner et évaluer leur approche, les auteurs ont constitué ce qu'ils présentent comme le premier benchmark à grande échelle de ce type : 2,7 millions d'étiquettes de faisabilité de saisie couvrant 88 objets scannés et 190 scènes de table encombrées. Trois familles d'architectures ont été comparées dans des conditions d'entraînement identiques (réseaux MLP, CNN volumétriques, transformeurs sur nuages de points). GRASPFC-PTX atteint un AUROC de 0,996 sur des objets non vus lors de l'entraînement, et produit ses prédictions bien plus rapidement que les planificateurs à base d'échantillonnage (SBMPs) classiques comme RRT ou PRM. Le goulot d'étranglement visé est précis : dans les pipelines de task and motion planning (TAMP), les tentatives de planification infaisables par les SBMPs consomment du temps de calcul sans résultat utile. Un prédicteur fiable en amont permet de filtrer ces tentatives avant qu'elles n'alourdissent la boucle de planification. Ce qui distingue cette contribution des approches existantes, c'est son fonctionnement en espace de configuration à haute dimension (7-DOF) à partir de perceptions brutes, sans supposer une géométrie simplifiée ni des paramètres d'objets connus. Pour les intégrateurs de manipulation industrielle ou de robotique logistique, cela ouvre la voie à un module greffable sur une cellule existante sans reconstruire le modèle numérique de chaque pièce. La certification d'infaisabilité de mouvement était jusqu'ici principalement traitée pour des espaces de faible dimension et des géométries simples. La montée en puissance des architectures transformeurs sur nuages de points, dans la lignée de PointNet++ et PCT, rend désormais ces prédicteurs plus généraux et applicables à des scènes réalistes. Ce travail s'inscrit dans une tendance plus large où l'apprentissage profond vient court-circuiter les planificateurs géométriques classiques dans des environnements non structurés. Le préprint ne mentionne ni déploiement industriel ni partenariat ; il s'agit d'une contribution de recherche fondamentale avec benchmark public, ce qui en fait un point de référence potentiel pour les équipes travaillant sur la manipulation en milieu réel. Les étapes naturelles seraient d'étendre le benchmark à des scènes dynamiques et de tester la robustesse face au bruit de capteur en conditions réelles.

RecherchePaper
1 source
Interleaved POMDP planning pour la recherche multi-objets dans des environnements domestiques multi-pièces inconnus
4arXiv cs.RO 

Interleaved POMDP planning pour la recherche multi-objets dans des environnements domestiques multi-pièces inconnus

Une équipe de recherche propose Inter-POMDP, un nouvel algorithme de planification pour la recherche multi-objets par des robots dans des environnements domestiques inconnus, comportant plusieurs pièces. Le problème central est la recherche d'objets sous incertitude massive : positions inconnues, obstacles non observés, espaces encombrés. Les POMDP (processus de décision markoviens partiellement observables) offrent un cadre théorique solide pour ce type de problème, mais deviennent ingérables à grande échelle. La solution proposée décompose la tâche en deux niveaux interconnectés : un planificateur de haut niveau, basé sur l'algorithme POUCT, raisonne sur la distribution probable des objets grâce à des croyances sous forme d'histogrammes informées par un LLM, tandis qu'un planificateur de mouvement de bas niveau modélise l'incertitude de navigation via des croyances par particules tenant compte des obstacles, utilisées comme connaissance de domaine pour guider le niveau supérieur. Testé en simulation et en conditions réelles, Inter-POMDP réduit le nombre de collisions jusqu'à 63 %, le nombre d'étapes de navigation jusqu'à 35 %, et améliore le taux de détection jusqu'à 32 % par rapport aux méthodes de référence. Des vidéos de démonstration sont disponibles en ligne. Pour l'industrie robotique, ce travail illustre une tendance de fond : l'utilisation de grands modèles de langage non pas pour remplacer la planification formelle, mais pour l'informer, en fournissant des a priori sémantiques (où chercher une tasse, un livre) qui réduisent l'espace de recherche combinatoire des POMDP classiques. C'est une piste concrète pour rendre les robots domestiques et de service capables de tâches de recherche et de rangement dans des environnements réels non cartographiés à l'avance, un scénario encore mal résolu malgré les progrès des architectures VLA. Les gains rapportés sur collisions et efficacité de navigation, s'ils se confirment hors laboratoire, intéressent directement les intégrateurs travaillant sur la navigation autonome en intérieur. Ce travail s'inscrit dans la lignée des recherches en planification POMDP hiérarchique, un champ actif depuis plusieurs années face à l'explosion combinatoire des POMDP plats. La nouveauté ici est le couplage explicite avec un LLM pour informer les croyances de haut niveau. Il s'agit à ce stade d'une publication de recherche (arXiv, avant relecture par les pairs), pas d'un produit ou d'un déploiement commercial ; les prochaines étapes attendues sont une validation sur des flottes robotiques plus larges et une comparaison avec d'autres approches hybrides LLM-planification.

RecherchePaper
1 source