Aller au contenu principal
RecherchearXiv cs.RO 

SE(3) : champs de potentiel neuronaux pour trajectoires à 6 DOF depuis des images, sans reconstruction 3D explicite

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente sur arXiv (arXiv:2609.24864, 22 septembre 2026) un champ de potentiel neuronal SE(3) qui planifie des trajectoires de préhension à 6 degrés de liberté directement depuis des images RGB posées, sans reconstruction 3D explicite. Le réseau est supervisé par la distance géodésique jusqu'à la prise, calculée dans l'espace libre reconstruit à partir des mêmes images pendant l'entraînement, ce qui évite les minima locaux qui font frôler l'obstacle ou bloquer la trajectoire dans les champs de potentiel classiques. Testé sur deux scènes de table avec des départs obstrués, exécuté sur un bras UR10, il converge à moins de 3 cm de la prise et produit 100% de trajectoires sans collision, contre 25% et 0% pour une supervision par image seule; la marge de sécurité moyenne passe de moins d'un centimètre à 8,6-8,8 cm, les contacts du bras chutent de 20,6-50,4% à 2,7-5,5% des configurations exécutées, la réussite de préhension atteint 90,0% et 40,0% selon la scène, et la planification prend environ 2 secondes contre 67 à 133 secondes pour un RRT* appliqué à une reconstruction des mêmes images.

Pour les intégrateurs, ce travail cible le goulot d'étranglement du pick-and-place en environnement encombré: la reconstruction 3D préalable, coûteuse et fragile en précision, sur laquelle reposent encore la plupart des pipelines de vérification de collision. En supprimant cette étape tout en corrigeant la faiblesse historique des champs de potentiel, la méthode ramène la planification à une cadence compatible avec des applications industrielles, là où un RRT* classique reste 30 à 60 fois plus lent sur les mêmes données visuelles. Les auteurs précisent toutefois que cet écart tient surtout au coût de vérification de collision sur une reconstruction dense, non à la complexité du planificateur, une nuance qui invite à la prudence avant d'extrapoler ces gains à des scènes plus complexes.

Les champs de potentiel artificiels sont une technique de planification connue depuis les années 1980, prisée pour sa rapidité mais écartée des usages critiques à cause des minima locaux que ce travail corrige par supervision géodésique plutôt que par réglage manuel des gradients. Les tests restent limités à deux scènes de table et un seul bras robotique, sans déploiement industriel annoncé; les échecs résiduels, attribués à l'exécuteur cartésien plutôt qu'au champ de potentiel lui-même, orientent les prochaines étapes vers des contrôleurs d'exécution plus robustes et des scènes d'encombrement plus denses avant toute validation en conditions réelles.

Dans nos dossiers

À lire aussi

Apprentissage de l'anticipation sans trajectoires explicites pour les politiques de diffusion 3D
1arXiv cs.RO 

Apprentissage de l'anticipation sans trajectoires explicites pour les politiques de diffusion 3D

Un preprint publié sur arXiv en septembre 2026 (2609.20669) présente Movement Trend Guidance (MTG), une méthode qui améliore les politiques de diffusion 3D en manipulation robotique. Construite au-dessus du modèle de référence DP3 (3D Diffusion Policy), elle n'ajoute que 3,52% de paramètres supplémentaires. À partir d'un court historique d'observations, le système apprend une représentation latente compacte de l'évolution de l'interaction, supervisée à l'entraînement par des états futurs épars du gripper; à l'inférence, seul ce latent sert de signal de conditionnement, injecté via une branche FiLM ajoutée au goulot d'étranglement du réseau UNet. Les gains face à DP3 sont nets sur trois bancs d'essai: 62,8% contre 56,1% en entraînement mixte sur 50 tâches de RoboTwin2.0, 71,93% contre 37,08% sur LIBERO-40, et 72,0% contre 49,0% sur cinq tâches évaluées en conditions réelles, sur le benchmark DexArt. L'enjeu dépasse le score brut. Les politiques de diffusion génèrent des mouvements géométriquement plausibles à partir de l'observation présente, mais laissaient jusqu'ici l'anticipation de la suite de l'interaction émerger implicitement de l'apprentissage de l'action seule. MTG rend cette anticipation explicite sans imposer de trajectoire planifiée, une alternative légère aux modèles du monde ou à la prédiction de trajectoire explicite, plus coûteux en calcul. Pour les intégrateurs et les équipes de recherche, le signal clé est que ce gain de robustesse, dont un quasi-doublement du taux de réussite sur LIBERO-40, s'obtient pour un surcoût d'architecture marginal, ce qui facilite une adoption dans des piles déjà basées sur DP3. Le travail reste toutefois un résultat de preprint non relu par les pairs, évalué selon le protocole propre des auteurs; l'écart entre benchmark et déploiement industriel réel reste à confirmer à plus grande échelle. DP3 combine diffusion générative et observations en nuages de points 3D pour l'apprentissage par imitation de tâches de manipulation. RoboTwin2.0, LIBERO-40 et DexArt sont des bancs d'essai standards du secteur pour comparer les politiques de manipulation, en simulation et, pour partie, en conditions réelles. MTG s'inscrit dans une recherche plus large, menée en parallèle des grands modèles vision-langage-action comme Pi-0, GR00T N2 ou Helix, qui cherchent tous à doter les politiques robotiques d'une meilleure anticipation à long horizon sans planification de trajectoire coûteuse. Aucun acteur commercial français ou européen n'est associé à ces travaux, qui restent une contribution académique; ni date de publication du code ni pilote industriel ne sont mentionnés, la suite logique étant une revue par les pairs puis une éventuelle intégration dans des piles VLA commerciales existantes.

RecherchePaper
1 source
C-3TO : optimisation continue de trajectoires 3D sur champs de distances euclidiennes signées neuronaux
2arXiv cs.RO 

C-3TO : optimisation continue de trajectoires 3D sur champs de distances euclidiennes signées neuronaux

Une équipe de recherche a publié sur arXiv (identifiant 2509.20084v2) un framework de planification de trajectoires 3D baptisé C-3TO (Continuous 3D Trajectory Optimization), ciblant la navigation autonome de drones en environnements encombrés. Le coeur du système repose sur un champ de distance signée euclidien (ESDF) neuronal mis à jour en temps réel, sur lequel les trajectoires sont optimisées de façon continue plutôt que sur une grille discrétisée. Celles-ci sont paramétrées par des polynômes de cinquième ordre, ce qui garantit la continuité des dérivées jusqu'à l'accélération et au-delà. L'optimisation s'effectue en deux étapes non linéaires successives qui mettent en balance efficacité computationnelle, sécurité vis-à-vis des obstacles et régularité du mouvement. Les expériences menées démontrent que le système génère des trajectoires à la fois collision-free et dynamiquement faisables. L'intérêt de cette approche tient à un point précis : les méthodes classiques construisent des ESDFs discrètes et interpolent entre les voxels pour obtenir les gradients, ce qui introduit des erreurs numériques lors de l'optimisation. En travaillant directement sur une représentation neuronale continue, C-3TO dispose de gradients exacts sur l'intégralité du chemin, pas seulement aux noeuds d'une grille. Pour les systèmes de replanification locale embarquée sur drone, cela réduit potentiellement le risque de trajectoires sous-optimales autour d'obstacles complexes. La flexibilité du framework dans le réglage de la taille des fenêtres locales et des paramètres d'optimisation le rend adaptable sans redéveloppement majeur, un argument pertinent pour les équipes d'intégration en robotique aérienne. Le domaine de la planification de trajectoires en temps réel pour UAV est actif depuis plusieurs années, avec des travaux notables autour des EGO-Planner (Zhu et al., 2021) et FASTER (Tordesillas et al., 2022), qui s'appuient eux aussi sur des représentations de distance pour l'évitement d'obstacles. C-3TO se positionne comme une évolution méthodologique de cet écosystème, en substituant le réseau neuronal à la grille voxel traditionnelle. Le paper n'annonce pas de déploiement matériel ni de validation sur plateforme physique en conditions réelles ; les résultats présentés restent à ce stade expérimentaux, et la robustesse sim-to-real n'est pas adressée explicitement.

RecherchePaper
1 source
TRACE : optimisation ergodique de trajectoire pour la reconstruction active de scène
3arXiv cs.RO 

TRACE : optimisation ergodique de trajectoire pour la reconstruction active de scène

Des chercheurs du Spike Lab de l'université Johns Hopkins publient sur arXiv (arXiv:2608.02304v1) TRACE, un système de planification de trajectoire pour la reconstruction active de scènes en 3D par Gaussian splatting. Le constat de départ : les systèmes existants sélectionnent leur prochaine vue caméra au coup par coup, selon le principe du « next-best-view » (NBV), puis relient chaque vue choisie par une planification de chemin à courte portée. Cette approche ignore la structure globale de l'information disponible sur la scène et produit des trajectoires inefficaces, où le capteur perd du temps de déplacement entre les points de vue retenus. TRACE reformule le problème comme une couverture ergodique : la statistique spatiale moyennée dans le temps de la trajectoire du capteur doit correspondre à une distribution cible d'information, calculée en continu à partir de l'incertitude et de la visibilité de la carte en cours de construction. Le calcul des trajectoires repose sur un planificateur à horizon dit « kernel-ergodique », combinant flux de gradient et déplétion d'empreinte, ce qui boucle directement cartographie et optimisation de trajectoire. Sur le jeu de données Replica, TRACE améliore le PSNR de 1,5 dB par rapport aux méthodes NBV de référence ; le code est publié sur GitHub (spikelab-jhu/trace-active-reconstruction). Ce résultat s'attaque à un angle mort classique de la cartographie active en robotique : la plupart des pipelines (drones d'inspection, robots mobiles équipés de caméras, capture pour jumeaux numériques) traitent la sélection de vue et la planification de chemin comme deux problèmes séparés résolus l'un après l'autre, ce qui sacrifie l'efficacité globale de la mission à des décisions locales optimales à chaque étape. En unifiant les deux dans un seul problème de couverture ergodique, TRACE ouvre une piste pour réduire le temps de vol ou de déplacement nécessaire pour atteindre une qualité de reconstruction donnée, un paramètre critique pour l'autonomie énergétique d'un drone ou le temps d'immobilisation d'un site industriel en cours de numérisation. Le gain de 1,5 dB reste toutefois mesuré sur un seul jeu de données (Replica, surtout des scènes intérieures synthétiques) face à un nombre limité de baselines NBV : la généralisation à des environnements réels, bruités et à grande échelle n'est pas encore démontrée. Le travail s'inscrit dans la lignée des méthodes de prochaine meilleure vue, d'abord développées pour la cartographie robotique puis adaptées aux représentations neuronales de scène, NeRF d'abord, Gaussian splatting depuis 2023, qui ont remis le placement de caméra au centre du problème puisque la qualité de reconstruction dépend directement de la couverture obtenue. L'approche ergodique elle-même n'est pas neuve en robotique, elle a déjà servi à la recherche et à la surveillance distribuée, mais son couplage direct avec une carte Gaussian-splatting incertaine constitue l'apport revendiqué ici. Publié comme un article de recherche pur, sans annonce produit ni partenaire industriel cité, TRACE appelle désormais des tests sur robots réels et des comparaisons avec d'autres planificateurs actifs récents ; le code ouvert sur GitHub devrait faciliter une réplication rapide par la communauté.

RecherchePaper
1 source
IMPACT : Lagrangien augmenté à ensemble actif implicite pour l'optimisation rapide de trajectoires à contact implicite
4arXiv cs.RO 

IMPACT : Lagrangien augmenté à ensemble actif implicite pour l'optimisation rapide de trajectoires à contact implicite

Des chercheurs ont déposé mi-mai 2026 sur arXiv (arXiv:2605.09127) un préprint décrivant IMPACT, un nouvel algorithme d'optimisation de trajectoires en contact implicite (CITO). La méthode repose sur une formulation augmented-Lagrangian pour résoudre les programmes mathématiques à contraintes de complémentarité (MPCC) qui gouvernent la planification de mouvements impliquant des contacts physiques, sans qu'il soit nécessaire de spécifier à l'avance la séquence des modes de contact. L'implémentation en C++ a été évaluée sur deux benchmarks open-source de référence, CITO et CI-MPC (model predictive control implicite en contact) : sur le premier, IMPACT affiche des accélérations comprises entre 2,9x et 70x par rapport aux solveurs existants les plus compétitifs, avec une moyenne géométrique de 13,8x. Sur les tâches de manipulation dextère en simulation (CI-MPC), la qualité du contrôle progresse également. Une validation sur robot physique a été conduite sur une tâche de poussée d'un objet en T, tâche simple mais représentative du problème de contact. La CITO est une approche unifiée pour planifier et contrôler des robots dans des environnements à contacts multiples, qu'il s'agisse de manipulation d'objets complexes ou de locomotion. Son atout principal est de ne pas imposer de séquence de modes de contact en entrée, éliminant une étape d'ingénierie manuelle coûteuse et peu robuste aux situations imprévues. Le verrou historique était le mauvais conditionnement numérique des MPCC sous-jacents, qui rendait les solveurs génériques instables et prohibitivement lents pour des applications embarquées. Un gain de 13,8x en moyenne géométrique sur des benchmarks standardisés est un signal fort : IMPACT rapproche le CI-MPC d'une viabilité en boucle fermée rapide. Pour les intégrateurs et les équipes de robotique dextère, c'est une avancée concrète vers des manipulateurs capables de gérer des contacts variés sans reprogrammation manuelle à chaque changement de tâche. La CITO mobilise des équipes académiques depuis une décennie, notamment au MIT, à Carnegie Mellon et à ETH Zurich. Les solveurs polyvalents comme IPOPT ou SNOPT montraient des limites sévères sur les MPCC liés au contact ; des travaux récents comme CALIPSO avaient amorcé des améliorations, mais sans garanties de stationnarité systématiques ni gains de vitesse aussi prononcés. IMPACT introduit une identification implicite des branches de modes de contact à la volée pendant les itérations d'optimisation, ce qui constitue sa différence algorithmique principale. Le code est soumis aux benchmarks publics, ce qui permettra à la communauté de reproduire et d'auditer les chiffres annoncés. La suite logique serait l'intégration dans des contrôleurs embarqués sur robots manipulateurs industriels ou humanoïdes, où la planification en contact temps réel reste un problème largement ouvert.

RecherchePaper
1 source