Aller au contenu principal
Apprentissage de la faisabilité des mouvements à partir de nuages de points en environnements encombrés
RecherchearXiv cs.RO 

Apprentissage de la faisabilité des mouvements à partir de nuages de points en environnements encombrés

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de chercheurs a publié sur arXiv (réf. 2606.26700) une étude sur la prédiction de faisabilité de mouvement pour un bras manipulateur à 7 degrés de liberté (7-DOF), opérant dans des environnements encombrés à partir d'observations RGB-D brutes. Le coeur du travail est GRASPFC-PTX, un transformeur appliqué à des nuages de points 3D, capable de prédire si une saisie est réalisable sans reconstruire de modèle CAO de l'environnement. Pour entraîner et évaluer leur approche, les auteurs ont constitué ce qu'ils présentent comme le premier benchmark à grande échelle de ce type : 2,7 millions d'étiquettes de faisabilité de saisie couvrant 88 objets scannés et 190 scènes de table encombrées. Trois familles d'architectures ont été comparées dans des conditions d'entraînement identiques (réseaux MLP, CNN volumétriques, transformeurs sur nuages de points). GRASPFC-PTX atteint un AUROC de 0,996 sur des objets non vus lors de l'entraînement, et produit ses prédictions bien plus rapidement que les planificateurs à base d'échantillonnage (SBMPs) classiques comme RRT ou PRM.

Le goulot d'étranglement visé est précis : dans les pipelines de task and motion planning (TAMP), les tentatives de planification infaisables par les SBMPs consomment du temps de calcul sans résultat utile. Un prédicteur fiable en amont permet de filtrer ces tentatives avant qu'elles n'alourdissent la boucle de planification. Ce qui distingue cette contribution des approches existantes, c'est son fonctionnement en espace de configuration à haute dimension (7-DOF) à partir de perceptions brutes, sans supposer une géométrie simplifiée ni des paramètres d'objets connus. Pour les intégrateurs de manipulation industrielle ou de robotique logistique, cela ouvre la voie à un module greffable sur une cellule existante sans reconstruire le modèle numérique de chaque pièce.

La certification d'infaisabilité de mouvement était jusqu'ici principalement traitée pour des espaces de faible dimension et des géométries simples. La montée en puissance des architectures transformeurs sur nuages de points, dans la lignée de PointNet++ et PCT, rend désormais ces prédicteurs plus généraux et applicables à des scènes réalistes. Ce travail s'inscrit dans une tendance plus large où l'apprentissage profond vient court-circuiter les planificateurs géométriques classiques dans des environnements non structurés. Le préprint ne mentionne ni déploiement industriel ni partenariat ; il s'agit d'une contribution de recherche fondamentale avec benchmark public, ce qui en fait un point de référence potentiel pour les équipes travaillant sur la manipulation en milieu réel. Les étapes naturelles seraient d'étendre le benchmark à des scènes dynamiques et de tester la robustesse face au bruit de capteur en conditions réelles.

Dans nos dossiers

À lire aussi

Apprentissage des affordances 3D pour l'insertion de lames en environnement encombré
1arXiv cs.RO 

Apprentissage des affordances 3D pour l'insertion de lames en environnement encombré

VulcanVoxel, un nouveau système de perception robotique présenté dans un article publié le 2 juillet sur arXiv (2607.02549), résout un problème concret de la logistique automatisée : comment une lame robotique doit-elle balayer des articles entassés dans des bacs en tissu pour créer un espace d'insertion, lors des opérations de stowing (rangement) en entrepôt. Plutôt que de prédire une pose unique pour la lame comme le font les approches classiques, le système reconstruit un champ d'occupation 3D voxel par voxel via un autoencodeur masqué, conditionné sur la géométrie de la scène. Entraîné sur 10 000 épisodes réels de rangement en entrepôt sans aucune annotation humaine, VulcanVoxel atteint un taux de couverture top-5 de 0,89, contre 0,71 pour la meilleure référence basée sur des poses SE(3). Une version distillée du modèle permet une inférence directe RGB vers voxel en seulement 30 millisecondes, contre 1,4 seconde pour l'approche voxel-à-voxel complète. Les chercheurs ont aussi publié un jeu de données d'épisodes réels d'insertion de lame, avec observations RGB-D et trajectoires de pose, disponible sur armbench.com. L'intérêt de ce travail dépasse le cas d'usage de la lame de stowing : il pointe une limite structurelle des méthodes actuelles d'apprentissage d'affordances, y compris les objectifs génératifs récents comme le flow matching. Ces méthodes, entraînées sur des données produites par une seule politique d'exécution, n'apprennent qu'une distribution unimodale et ne peuvent pas récupérer les alternatives géométriques équivalentes qui existent réellement dans une scène encombrée. En reformulant le problème dans l'espace plutôt que dans l'espace des poses, VulcanVoxel capture nativement cette multimodalité. Pour les intégrateurs et responsables d'automatisation d'entrepôt, le gain de vitesse (times 45 environ) est ce qui rend l'approche déployable en cadence de production réelle, là où le calcul voxel-à-voxel complet resterait trop lent. Le contexte de cette recherche est celui des systèmes de stowing en production qui génèrent, selon les auteurs, des millions d'épisodes de manipulation, un volume caractéristique des opérations d'automatisation logistique à grande échelle, comme celles qu'on associe généralement au jeu de données ArmBench. L'article positionne explicitement son approche contre les méthodes de pose SE(3) et les modèles génératifs unimodaux dominants dans le secteur, et la publication du jeu de données d'insertion de lame ouvre la voie à des comparaisons futures sur ce type de tâche de manipulation par affordances de volume libre, un sous-problème encore peu étudié comparé à la préhension classique.

RecherchePaper
1 source
Navigation agile pour robots quadrupèdes dans des environnements encombrés par apprentissage
2arXiv cs.RO 

Navigation agile pour robots quadrupèdes dans des environnements encombrés par apprentissage

Des chercheurs présentent VOP-Nav, un système de navigation pour robots quadrupèdes conçu pour évoluer dans des environnements denses et dynamiques, où l'occlusion des capteurs et l'imprévisibilité des déplacements humains posent des défis majeurs. Le cœur du système est un réseau baptisé VOP-Net, qui traite des données LiDAR multi-frames captées en local pour encoder implicitement les contraintes dynamiques de l'environnement et prédire une zone de vitesse sûre, dérivée de la théorie des Velocity Obstacles (VO). Fait notable, cette prédiction VO sert un double rôle : elle alimente la politique de navigation en inférence, et sert de signal de récompense pendant l'entraînement pour favoriser des trajectoires sûres. Le système a été évalué dans le simulateur Isaac Gym, puis déployé en conditions réelles sur un robot quadrupède Unitree Go2, en intérieur comme en extérieur, sans pipeline explicite de détection et de suivi d'obstacles. L'enjeu dépassé ici est un compromis classique en robotique mobile : les méthodes à base de modèle comme les Velocity Obstacles garantissent la sécurité en théorie, mais s'effondrent en environnement dense car elles dépendent d'estimations précises du mouvement des obstacles, difficiles à obtenir dans une foule. À l'inverse, les approches d'apprentissage de bout en bout sont plus robustes mais manquent de capacité de prédiction, ce qui produit soit des collisions, soit des comportements trop prudents. En hybridant les deux, VOP-Nav vise directement le goulot d'étranglement qui freine le déploiement de quadrupèdes et, plus largement, de plateformes mobiles autonomes dans des espaces partagés avec des humains, entrepôts, hôpitaux, bureaux, un enjeu suivi de près par les intégrateurs travaillant avec des plateformes comme Go2 ou Spot. Le papier s'inscrit dans la lignée des travaux sur la navigation sociale et l'évitement d'obstacles dynamiques, où les méthodes géométriques classiques (VO, ORCA) et l'apprentissage par renforcement coexistent sans avoir jusqu'ici bien fusionné. Publié comme preprint arXiv (2607.15036), le travail n'a pas encore fait l'objet de revue par les pairs ; les auteurs revendiquent des taux de réussite supérieurs à leurs bases de comparaison en simulation, sans toutefois préciser de chiffres exacts ni le protocole complet d'évaluation, un point à surveiller avant toute extrapolation vers un déploiement industriel à grande échelle.

RecherchePaper
1 source
Passage à l'échelle de l'apprentissage du mouvement aligné à la scène pour la traversée perceptive d'environnements encombrés par un humanoïde
3arXiv cs.RO 

Passage à l'échelle de l'apprentissage du mouvement aligné à la scène pour la traversée perceptive d'environnements encombrés par un humanoïde

Un preprint arXiv (2609.18732v1) publié mi-septembre 2026 présente PASSAGE, un système de planification et de suivi de mouvement conditionné par la perception, pour des robots humanoïdes traversant des environnements encombrés en enjambant, contournant ou se baissant devant les obstacles. Entraîné sur 100 heures de mouvements humains captés en réalité virtuelle et par capture inertielle sur 1500 scènes, un planificateur par flow-matching génère des trajectoires courtes exécutées à 50 Hz par un contrôleur corps entier avec retour géométrique, puis affiné par apprentissage par renforcement, contrôleur figé. Passer de 6 à 100 heures de données porte le taux de succès sans contact de 48,1% à 68,9% sur des scènes inédites, jusqu'à 70,3% avec augmentation de scène validée. Le système fonctionne entièrement en embarqué sur un Jetson AGX Orin, avec LiDAR 3D, cartographie en ligne, planification à 6,25 Hz et contrôle à 50 Hz, testé sur 50 configurations physiques inédites sans carte préconstruite ni calcul déporté. Le résultat s'attaque à un verrou du déploiement humanoïde hors laboratoire : choisir et enchaîner, depuis la seule perception embarquée, le bon comportement de franchissement selon la géométrie rencontrée, sans bibliothèque de mouvements ni récompense spécifique à chaque obstacle. Une seule paire planificateur-contrôleur généralise ici à des géométries jamais vues, ce qui va dans le sens d'un passage à l'échelle des données de démonstration plutôt que de l'ingénierie tâche par tâche, comme le montrent déjà les modèles vision-langage-action en manipulation tels que Pi-0, GR00T N2 ou Helix. Ce travail illustre un basculement de la recherche humanoïde, concentrée jusqu'ici sur la manipulation avec les modèles vision-langage-action, vers la locomotion en environnement non structuré, restée en retrait malgré la course menée par Figure, Tesla ou Unitree. Le choix du flow-matching pour générer les trajectoires prolonge une tendance déjà observée après les modèles de diffusion. Le preprint ne précise ni plateforme robotique commerciale ni entreprise porteuse : il reste, à ce stade, un résultat de recherche testé en simulation et sur un nombre limité de configurations physiques réelles, sans calendrier de transfert vers un produit. Aucun acteur français ou européen n'y figure.

RecherchePaper
1 source
Apprentissage de la locomotion humanoïde adaptée à la scène en environnement 3D encombré à partir de démonstrations humaines immersives
4arXiv cs.RO 

Apprentissage de la locomotion humanoïde adaptée à la scène en environnement 3D encombré à partir de démonstrations humaines immersives

Des chercheurs présentent Moving Through Clutter (MTC), un système d'apprentissage par démonstration pour la locomotion humanoïde en environnement encombré, décrit dans un article publié sur arXiv (2609.21107) fin septembre 2026. Alors que les travaux précédents sur l'imitation de mouvements humains ont surtout produit des prouesses dynamiques en espace dégagé, comme la danse ou les arts martiaux, MTC s'attaque à la traversée d'espaces tridimensionnels contraints par des obstacles. Le pipeline collecte des démonstrations humaines dans des environnements de réalité virtuelle générés de façon procédurale, ce qui évite de construire physiquement des décors d'obstacles coûteux. Un algorithme de retargeting tenant compte de la scène convertit ensuite ces mouvements humains en trajectoires exploitables par le robot, en imposant une marge de sécurité stricte entre le corps du robot et la géométrie environnante pour garantir une traversée sans collision. La politique de locomotion ainsi entraînée est déployée sur un humanoïde Unitree G1. Sur le benchmark interne MTC-Challenge, conçu pour la traversée multi-obstacles, le robot atteint un taux de réussite sans collision de 70,2% sur des scénarios variés, incluant la reptation dans des passages à faible hauteur et le passage par des interstices étroits. Ce travail cible un angle mort de la robotique humanoïde actuelle: la plupart des démonstrations publiques (marche, danse, sauts) se déroulent en terrain dégagé, alors que les usages industriels visés, entrepôts, usines, chantiers, exigent une navigation fine autour d'obstacles tridimensionnels denses comme des étagères basses, tuyauteries ou racks. Pour les intégrateurs et décideurs qui évaluent le déploiement d'humanoïdes en environnement logistique, un taux de 70,2% de traversées réussies signale que le problème est loin d'être résolu au niveau de fiabilité attendu en production, même si la méthode montre que l'apprentissage par démonstration immersive en VR peut générer des comportements corporels complexes sans motion capture sur décor physique coûteux. Cela confirme aussi que la génération procédurale de données synthétiques reste un levier clé pour faire monter en échelle l'apprentissage de compétences humanoïdes avancées. Le champ de la locomotion humanoïde par imitation a produit ces deux dernières années des démonstrations spectaculaires sur des plateformes comme Unitree G1, Figure ou Optimus, mais la traversée d'environnements encombrés restait peu explorée. MTC s'inscrit dans cette lignée en élargissant le périmètre à des scènes tridimensionnelles complexes plutôt qu'à du terrain plat. Le choix du G1 d'Unitree, plateforme abordable largement utilisée en recherche académique, confirme son rôle de banc d'essai de référence face à des plateformes plus onéreuses comme Figure 03. L'article ne mentionne ni partenaire industriel ni calendrier de déploiement pilote: il s'agit à ce stade d'un travail de recherche évalué sur un benchmark maison, sans validation en environnement réel de production.

RecherchePaper
1 source