Aller au contenu principal
RecherchearXiv cs.RO 

Volume balayé signé stochastique par réseau de neurones pour l'optimisation de trajectoire sous contraintes probabilistes en temps réel

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Publiée sur arXiv en septembre 2026 (référence 2609.21211), une étude présente une méthode de planification de trajectoires sans collision pour bras manipulateurs, nommée stochastic neural signed swept volume. Vérifier qu'un mouvement continu ne heurte rien oblige aujourd'hui à choisir entre tester quelques états discrets le long du trajet, au risque de manquer un obstacle, ou à calculer le volume complet balayé par le robot, trop coûteux en temps réel ; les modèles neuronaux existants restent trop imprécis pour servir d'autre chose qu'un filtre grossier en amont d'un vérificateur classique. Les auteurs apprennent plutôt une fonction de distance signée du volume balayé sous forme probabiliste, intégrant incertitude et bruit de capteurs dans une optimisation de trajectoire sous contraintes probabilistes, validée sur des manipulations en haute dimension, en simulation et sur robot réel.

Pour les intégrateurs et équipes R&D en robotique industrielle, l'intérêt dépasse la démonstration académique : la plupart des planificateurs déployés sacrifient aujourd'hui soit la sécurité, soit la vitesse, faute d'une vérification continue à la fois fiable et rapide. En dotant un réseau de neurones d'une estimation de sa propre incertitude, l'approche vise à le sortir de son rôle habituel de pré-filtre grossier pour l'utiliser directement dans la boucle d'optimisation, ce qui répondrait à la critique récurrente sur la fragilité des modèles de collision appris face au bruit de capteur réel, précisément le scénario testé ici sur matériel physique et pas seulement en simulation. Il s'agit néanmoins d'une prépublication arXiv non relue par les pairs, sans partenaire industriel identifié.

Ces travaux prolongent la lignée de recherche sur la vérification continue de collision et l'approximation du volume balayé, longtemps dominée par des calculs géométriques coûteux ou des heuristiques conservatrices avant l'arrivée de fonctions de distance signée neuronales, rapides mais peu fiables. En y ajoutant une formulation probabiliste et une optimisation sous contraintes stochastiques, l'étude cherche à réduire l'écart entre la vitesse des méthodes apprises et la fiabilité exigée pour planifier des mouvements en environnement incertain, un enjeu qui concerne autant les bras industriels que les futurs robots mobiles ou humanoïdes opérant près d'humains. Ni institution ni feuille de route de déploiement ne sont précisées ; l'extension à davantage de degrés de liberté et l'intégration dans des piles logicielles existantes en seraient les suites logiques.

Dans nos dossiers

À lire aussi

Robotique forestière : optimisation stochastique de trajectoire sous contraintes pour une grue forestière optimale en temps
1arXiv cs.RO 

Robotique forestière : optimisation stochastique de trajectoire sous contraintes pour une grue forestière optimale en temps

Des chercheurs présentent TSC-VP-STO, une extension de l'algorithme VP-STO (Via-Point-based Stochastic Trajectory Optimization) destinée à la planification de trajectoires pour les grues forestières autonomes. Le problème initial de VP-STO est qu'il impose une configuration articulaire terminale fixe, définie avant même l'optimisation, ce qui limite l'exploitation de la redondance cinématique propre à ces bras manipulateurs à plusieurs degrés de liberté (DOF). TSC-VP-STO remplace cette contrainte rigide par une contrainte dans l'espace de la tâche, permettant d'optimiser conjointement la trajectoire et les degrés de liberté redondants de la posture finale. Les auteurs formalisent l'approche via une décomposition de l'espace de configuration et une contrainte d'atteignabilité spécifique à la cinématique des grues forestières. Les essais, menés sur plusieurs cibles de planification et configurations de points de passage, montrent une réduction de 12 à 15% de la durée des trajectoires en moyenne par rapport à VP-STO, avec une meilleure répartition de l'utilisation du débit hydraulique. La méthode a été validée en conditions réelles sur une grue forestière, incluant un cycle complet de chargement de grumes. L'enjeu dépasse le seul cas des grues forestières: il touche à l'automatisation de tout manipulateur hydraulique cinématiquement redondant soumis à des contraintes de débit de pompe non linéaires et globalement couplées, un problème classique en robotique industrielle lourde (foresterie, BTP, manutention). Optimiser la posture terminale plutôt que de la figer permet de mieux équilibrer la demande hydraulique entre articulations, un gain concret pour les intégrateurs cherchant à réduire les temps de cycle sans changer le matériel. La validation sur machine réelle, et pas seulement en simulation, renforce la crédibilité des gains annoncés, un point que les décideurs industriels scrutent généralement avec prudence face aux démonstrations purement simulées. Ce travail s'inscrit dans la continuité de VP-STO, déjà présenté comme quasi temps-optimal pour la planification hybride de grues forestières, et prolonge une littérature plus large sur l'optimisation stochastique de trajectoires sous contraintes robotiques. Publié comme prépublication arXiv, il reste à ce stade un résultat de recherche appliquée plutôt qu'un produit commercialisé, mais son déploiement réel sur une grue en exploitation forestière constitue une étape notable vers une adoption industrielle.

UECette optimisation profite potentiellement aux intégrateurs robotiques européens du secteur forestier et de la manutention lourde (Scandinavie, BTP), sans acteur français ou européen explicitement cite dans l'article.

RecherchePaper
1 source
PISTO : inférence proximale pour l'optimisation stochastique de trajectoires
2arXiv cs.RO 

PISTO : inférence proximale pour l'optimisation stochastique de trajectoires

Des chercheurs ont publié sur arXiv (arXiv:2605.07215) un algorithme de planification de trajectoires robotiques appelé PISTO (Proximal Inference for Stochastic Trajectory Optimization). Leur contribution centrale est de démontrer que STOMP, méthode stochastique classique, minimise implicitement une divergence KL par rapport à une distribution de trajectoires de Boltzmann, révélant une structure d'inférence variationnelle (VI) sous-jacente. PISTO exploite cette observation en ajoutant une régularisation KL entre propositions gaussiennes successives, ce qui stabilise les mises à jour et produit une interprétation de type trust-region. L'algorithme reste entièrement sans dérivées et s'appuie sur un échantillonnage Monte Carlo à pondération d'importance. Sur les benchmarks de planification de bras robotiques, PISTO atteint 89 % de taux de succès contre 63 % pour CHOMP et 68 % pour STOMP, tout en générant des trajectoires plus courtes et plus lisses, à deux fois la vitesse des méthodes stochastiques concurrentes. Des validations complémentaires sur des tâches de locomotion et manipulation contact-rich en simulation MuJoCo montrent des performances supérieures aux baselines CEM et MPPI en termes de récompense cumulée. Pour les intégrateurs et ingénieurs en planification de mouvement, l'absence totale de dérivées est une caractéristique décisive : elle permet de traiter des fonctions de coût non-différentiables ou discontinues, fréquentes dans les environnements industriels réels (détection de collisions, zones interdites, contraintes non paramétriques). Le gain de vitesse d'un facteur deux par rapport aux méthodes stochastiques existantes réduit directement les temps de cycle dans les applications de planification en ligne, point critique pour la robotique collaborative et les systèmes pick-and-place haute cadence. La validation sur MuJoCo avec contacts ouvre des perspectives vers la locomotion humanoïde et la manipulation dextre, bien que ces résultats restent pour l'instant entièrement simulés, sans validation sur matériel physique. PISTO s'inscrit dans la lignée de STOMP (développé chez Willow Garage et présenté à l'ICRA 2011) et de ses concurrents gradient-based tels que CHOMP, ainsi que des méthodes stochastiques modernes MPPI (popularisé par NVIDIA en 2017) et CEM. Soumis comme preprint arXiv sans révision par les pairs à ce stade, l'article n'annonce ni déploiement industriel ni partenariat commercial. Son impact pratique dépendra de la mise à disposition du code source et de validations expérimentales sur robot réel, étapes absentes de la publication actuelle.

RecherchePaper
1 source
Contrôle en temps réel par DDP contraint pour l'équilibre sous-actionné des robots à pattes
3arXiv cs.RO 

Contrôle en temps réel par DDP contraint pour l'équilibre sous-actionné des robots à pattes

Des chercheurs présentent ABC-DDP, un framework de "Differential Dynamic Programming" (DDP) sous contraintes de commande, conçu pour le contrôle en temps réel de robots à pattes sous-actionnés. Publié sur arXiv sous la référence 2608.18552, le papier propose une méthode basée sur un gradient projeté accéléré (APG) qui calcule les solutions contraintes et identifie les ensembles actifs sans recourir à des inversions répétées des conditions de Karush-Kuhn-Tucker (KKT), un goulot d'étranglement classique du DDP standard. Une "contrainte virtuelle" est intégrée dans un schéma de tir multiple orienté faisabilité, permettant une optimisation stable même à partir d'initialisations dynamiquement infaisables. En simulation, la méthode pilote un robot quadrupède via un contrôle prédictif de modèle (MPC) à horizon court fonctionnant en temps réel : elle démontre une station debout stable sur deux pattes face à des perturbations externes, ainsi qu'un catwalk lent, une marche verticale et une course à haute vitesse, le tout au sein d'un unique cadre MPC unifié. Les auteurs revendiquent la première démonstration d'une station debout statique sur deux pattes d'un quadrupède obtenue par MPC temps réel à horizon fini. Le résultat cible un problème concret pour les concepteurs de contrôleurs de robots à pattes : le DDP classique gère mal les contraintes de commande (couple, position articulaire) sans alourdir considérablement le calcul, ce qui limite son usage en boucle temps réel sur des robots humanoïdes ou quadrupèdes. En évitant les inversions KKT répétées, ABC-DDP promet une charge de calcul compatible avec des cadences MPC élevées, même dans des régimes fortement sous-actionnés comme la station debout sur deux membres, un cas extrême d'instabilité pour un quadrupède. Il s'agit toutefois pour l'instant de résultats exclusivement en simulation : aucun déploiement sur robot physique n'est rapporté, et la robustesse aux incertitudes de modèle, au bruit des capteurs ou aux délais matériels réels reste à démontrer avant toute application industrielle. Le DDP est une technique d'optimisation de trajectoire largement utilisée dans le contrôle prédictif des robots à pattes, mais sa version classique peine historiquement à intégrer des contraintes de commande explicites sans recourir à des solveurs coûteux, ce qui pousse souvent les équipes vers des approximations ou des architectures hybrides. ABC-DDP s'inscrit dans cette lignée de travaux cherchant à fiabiliser le MPC temps réel pour la locomotion dynamique, un axe de recherche partagé par les laboratoires travaillant sur les quadrupèdes et les humanoïdes. Le papier, publié en août 2026 en tant que preprint arXiv, ne mentionne ni entreprise ni plateforme matérielle spécifique : il s'agit d'une contribution académique en optimisation de contrôle. Les suites attendues, non détaillées dans l'article, seraient une validation expérimentale sur robot physique et une extension à des morphologies bipèdes ou humanoïdes, où la sous-actuation pose des défis similaires, voire plus sévères.

RecherchePaper
1 source
4arXiv cs.RO 

Pilotage sûr et en temps réel des politiques par optimisation de trajectoire dans l'espace du bruit pour des politiques génératives en une étape

Une publication déposée sur arXiv (référence 2609.21220, catégorie "new") présente INSPO, une méthode pour piloter en temps réel des politiques robotiques génératives sans les réentraîner. Le problème visé est le suivant : les politiques préentraînées de type diffusion ou flow matching génèrent des comportements variés et multimodaux, mais restent difficiles à adapter aux contraintes imposées au moment du déploiement, comme l'évitement de collision ou le maintien d'une orientation donnée, sans repasser par un guidage par gradient coûteux appliqué tout au long d'un processus itératif, trop lent pour du contrôle temps réel. INSPO reformule le problème comme une optimisation de trajectoire dans l'espace du bruit d'entrée de la politique : au lieu de modifier directement les actions générées, l'algorithme optimise le bruit injecté en évaluant les contraintes sur la trajectoire d'état qui en résulte, avec un terme de régularisation qui garde la solution proche de la distribution d'entrée native du modèle, le tout résolu en ligne par optimisation par essaim de particules. Les auteurs testent la méthode sur des politiques spécifiques à une tâche, à base d'état ou d'image, et sur des politiques généralistes vision-langage-action, avec trois bancs d'essai simulés : Push-T, la préhension-dépose de boîtes de conserve (Can pick-and-place) et LIBERO-Spatial. Pour l'industrie robotique, ce travail cible un verrou concret : les politiques génératives promettent plus de diversité comportementale que les politiques déterministes classiques, mais leur nature stochastique complique la garantie de contraintes de sécurité strictes une fois déployées sur un bras ou un robot mobile réel. Jusqu'ici, imposer ces contraintes passait soit par un rejet coûteux d'échantillons (best-of-N sampling), soit par une projection a posteriori des actions générées, soit par un guidage par gradient trop lent pour le temps réel. INSPO affiche de meilleurs taux de réussite et de respect des contraintes que les deux premières approches, tout en égalant le guidage par gradient avec un temps d'exécution plus faible, ce qui, si cela se confirme sur du matériel physique, réduirait un frein réel à l'usage industriel des politiques VLA génériques du type Pi-0 ou GR00T, où la sécurité à l'inférence limite encore la commercialisation au-delà des démonstrations. Ce travail s'inscrit dans la vague des politiques robotiques fondées sur la diffusion ou le flow matching, et plus particulièrement dans le virage récent vers des politiques génératives "en une étape", plus rapides à échantillonner que les processus itératifs classiques mais qui rendent obsolètes certaines méthodes de guidage par gradient conçues pour ces derniers. À ce stade, INSPO n'a été validé que sur des bancs d'essai simulés standards de la littérature, sans démonstration sur robot physique ni comparaison avec un système commercial : il s'agit d'une contribution méthodologique amont plutôt que d'un produit ou d'un déploiement annoncé. Aucun acteur français ou européen n'apparaît dans cette publication.

RecherchePaper
1 source