Aller au contenu principal
RecherchearXiv cs.RO 

Incertitude exploitable pour la commande dans les modèles de diffusion de trajectoires

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (2610.12431) SCOPE, pour Score-Curvature for Online Precision Estimation, un module léger qui ajoute une estimation d'incertitude exploitable en temps réel aux modèles de diffusion de trajectoires. Ces modèles représentent bien des distributions multimodales, mais en tirer une mesure d'incertitude exige aujourd'hui de nombreux échantillons Monte Carlo, trop coûteux pour une boucle de commande. SCOPE apprend, par distillation de l'information de courbure du score, une matrice de précision structurée autour de chaque trajectoire nominale. Il en sort des « tubes » gaussiens calibrés, avec une covariance par pas de temps, sans rééchantillonnage répété. Le système est testé avec des backbones de diffusion multimodaux conditionnés par mode sur quatre terrains : prévision de trajectoires de piétons, navigation en foule, contrôle Maze2D et manipulation réelle avec un bras Franka Panda. Le résumé annonce une estimation rapide et de meilleures performances en boucle fermée, mais ne donne aucun chiffre sur le surcoût ou le gain, ce qui empêche de juger l'ampleur de l'amélioration.

L'enjeu est pratique. Les politiques de diffusion se répandent en manipulation et en navigation, mais leur coût d'inférence et l'absence d'incertitude bon marché freinent leur usage là où la sécurité compte. Un tube de covariance par pas de temps peut servir de marge de sécurité pour un contrôleur ou de prédiction d'occupation pour des agents mobiles, comme les piétons autour d'un AMR. Il peut aussi guider l'exploration. Si le surcoût est réellement faible, cela supprimerait l'un des arguments contre le déploiement de ces modèles génératifs en boucle de commande rapide. La validation reste toutefois académique : un seul bras réel, des benchmarks standards, aucune charge de travail industrielle ni mesure de latence publiée dans le résumé.

Ce travail s'inscrit dans la recherche d'incertitude pour l'apprentissage robotique, qui passe d'ordinaire par des ensembles de modèles, le dropout Monte Carlo, des approximations de Laplace ou la prédiction conforme, toutes plus lourdes ou moins adaptées aux trajectoires multimodales. L'approche de SCOPE, qui exploite la géométrie du score appris plutôt que de multiplier les tirages, est une réponse directe à cette limite. Il s'agit d'un préprint en version 1, sans validation par les pairs ni code annoncé au-delà d'une page projet. La suite logique serait des tests sur des politiques VLA de plus grande taille et sur des tâches de manipulation plus variées, avec des comparaisons chiffrées de latence et de calibration face aux ensembles et aux méthodes conformes.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

3D-CovDiffusion : modèle de diffusion 3D pour la planification de trajectoires de couverture
1arXiv cs.RO 

3D-CovDiffusion : modèle de diffusion 3D pour la planification de trajectoires de couverture

Des chercheurs présentent 3D-CovDiffusion, un modèle de diffusion conditionné par la géométrie pour la planification de trajectoires de couverture en robotique industrielle, décrit dans une version révisée (v2) publiée sur arXiv (2510.03011). Contrairement aux approches qui assemblent après coup des segments de trajectoire non ordonnés via des heuristiques, la méthode reformule le problème comme une génération de séquence conditionnelle : elle synthétise directement, à partir d'un nuage de points 3D brut, des trajectoires continues et temporellement ordonnées, découpées en blocs simplement concaténés dans l'ordre. Une seule politique partagée traite des géométries variées sans architecture spécifique par catégorie d'objet. Sur des benchmarks étendus, les auteurs rapportent une distance de Chamfer point à point inférieure de 98,2 % par rapport aux meilleures méthodes d'apprentissage antérieures, un jerk (à-coup) réduit de 97,0 %, signe de trajectoires plus lisses, et une couverture de surface supérieure de 67,5 points de pourcentage en moyenne. La planification de trajectoires de couverture conditionne directement la qualité de finition et le temps de cycle en peinture, polissage et revêtement par pulvérisation industriels. Les méthodes existantes, géométriques ou fondées sur l'apprentissage par segments, nécessitent souvent un post-traitement pour reconstituer un ordre cohérent, ce qui introduit des artefacts et limite la généralisation entre formes d'objets. En montrant qu'une politique de diffusion unique peut générer directement des séquences ordonnées et se généraliser sans réglage par catégorie, ce travail renforce l'idée que les modèles de diffusion conditionnés peuvent remplacer des pipelines de planification fait main, argument déjà avancé pour la manipulation robotique mais encore peu exploré pour la couverture de surface. Les gains chiffrés restent toutefois issus de benchmarks internes aux auteurs, sans validation en environnement industriel réel mentionnée dans l'abstract. Ce travail prolonge les "diffusion policies" désormais courantes en apprentissage par imitation pour la manipulation, ici transposées à un problème historiquement traité par la planification classique (trajectoires en boustrophédon) ou par des méthodes d'apprentissage assemblant des segments locaux. Classée "replace" sur arXiv, la publication correspond à une mise à jour d'un article existant plutôt qu'à une annonce produit ; aucun industriel ni site de déploiement n'est cité, ce qui situe la contribution au stade académique plutôt qu'au transfert commercial. La suite logique attendue serait une validation sur cellule robotique réelle, comparée aux outils de programmation de trajectoire actuellement utilisés en production.

RecherchePaper
1 source
Apprendre sur le tas : exécution de tâches sans démonstration sous incertitude paramétrique par commande duale paramétrée par trajectoire
2arXiv cs.RO 

Apprendre sur le tas : exécution de tâches sans démonstration sous incertitude paramétrique par commande duale paramétrée par trajectoire

Des chercheurs proposent une méthode de commande duale qui permet à un robot d'exécuter une tâche du premier coup tout en identifiant en ligne les paramètres physiques qu'il ne connaissait pas. Publié sur arXiv (2510.20483, version 2), le travail part d'un constat : la commande basée sur modèle donne de bons résultats tant que le modèle est exact, mais un robot rencontre souvent des charges utiles, des objets ou des dynamiques d'interaction inédits. L'approche classique consiste à lancer d'abord une phase d'excitation dédiée, indépendante de la tâche et du contrôleur, pour estimer les paramètres. Les auteurs suppriment cette étape : l'apprentissage du modèle et la commande se déroulent simultanément pendant la tâche. Ils fixent à l'avance une politique de retour d'état avec une loi d'adaptation explicite des paramètres, puis optimisent la trajectoire de référence à travers la dynamique adaptative en boucle fermée. Deux formulations sont proposées : minimiser le coût attendu de la tâche sous incertitude paramétrique, ou minimiser la perte d'optimalité, c'est-à-dire la dégradation de performance causée par une planification fondée sur une estimation erronée. L'exploration est guidée par une mesure d'information de Fisher. L'enjeu est très concret pour les intégrateurs et les responsables de production. Aujourd'hui, un bras manipulant une charge inconnue perd du temps en calibration, ou exécute des mouvements d'identification qui n'ont aucun lien avec la tâche et produisent des données peu utiles. Selon les auteurs, leur méthode s'approche d'une borne inférieure de l'incertitude sur les paramètres pertinents pour la tâche, tout en réussissant celle-ci en une seule tentative. Cela réduit les temps morts et évite d'identifier des paramètres sans effet sur le résultat. Les résultats couvrent plusieurs tâches, contrôleurs et lois d'adaptation, ce qui suggère une méthode générique et non un réglage sur un seul cas. Il faut toutefois rester prudent : le résumé ne donne ni chiffres de performance, ni précision de l'identification, ni temps de calcul, ni preuve sur matériel réel. On ne sait donc pas si la méthode tient face aux bruits de capteurs, aux frottements non modélisés ou aux contraintes temps réel d'une cellule industrielle. Ce travail s'inscrit dans le débat entre approches basées sur modèle et approches apprises, comme les modèles vision-langage-action (VLA), qui généralisent par les données mais offrent moins de garanties. Ici, la commande adaptative et la théorie du contrôle dual, formulée depuis les années 1960, sont réactivées avec une optimisation de trajectoire moderne. Il s'agit d'une préimpression, sans validation par les pairs à ce stade, et la mention « remplacement » indique une révision d'une version antérieure. Les suites logiques seraient des essais sur manipulateurs réels avec charges variables, puis une comparaison directe avec l'identification préalable et les méthodes de méta-apprentissage.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Évaluation comparative de modèles génératifs de trajectoires pour le contrôle par inférence active
3arXiv cs.RO 

Évaluation comparative de modèles génératifs de trajectoires pour le contrôle par inférence active

Des chercheurs publient sur arXiv (2610.05692, deuxième version) GenAIF, un cadre de commande par inférence active générative. Un seul modèle génératif de trajectoires, entraîné sur des démonstrations et des interventions d'action mesurées, fournit deux éléments. Le premier est une politique conditionnée par un objectif. Le second est une correspondance probabiliste entre états et observations. Les auteurs en tirent trois exigences pour le modèle: des propositions d'actions utiles, une prédiction fidèle sous actions imposées, et une évidence d'observation probabiliste pour la mise à jour des croyances et le calcul du gain d'information attendu. Ils comparent quatre familles (diffusion, Transformers autorégressifs, autoencodeurs variationnels conditionnels ou CVAE, et flow matching) sur une tâche de manipulation MuJoCo avec plusieurs conditions physiques. La diffusion donne le meilleur contrôle sur toutes les dynamiques testées. Le CVAE offre une prédiction à court horizon comparable pour une inférence nettement plus rapide. Après un changement d'inclinaison non annoncé, la diffusion préentraînée met à jour sa croyance le plus vite parmi les modèles d'origine. Un fine-tuning sur des démonstrations de récupération accélère encore l'identification et maintient un suivi précis. Pour les équipes qui construisent des politiques apprises, le résultat chiffre un arbitrage concret entre qualité de contrôle et coût d'inférence. La diffusion est la plus performante mais la plus lourde, le CVAE est un compromis crédible quand la latence compte, et la réutilisation de trajectoires réduit le calcul. L'intérêt tient aussi à la capacité d'adaptation. Un modèle capable de dire quand ses observations contredisent ses prédictions peut détecter un changement physique, comme une charge ou une pente modifiée, sans modèle dynamique explicite. Les limites sont nettes: tout reste en simulation, sur une seule tâche, et le résumé ne donne aucun chiffre de taux de réussite ni de temps de calcul. L'écart simulation-réel n'est donc pas abordé, et il s'agit d'un travail académique, pas d'un produit. Le travail se situe au croisement de deux courants. Les politiques génératives dominent la manipulation apprise: Diffusion Policy, ACT (basé sur un CVAE) et Pi-0 (flow matching) en sont les références. L'inférence active, issue des neurosciences computationnelles, peine à s'imposer en robotique appliquée faute de modèles de dynamique exploitables. GenAIF propose de combler ce manque avec des modèles appris sur démonstrations. La suite logique passe par une validation sur robots physiques, davantage de tâches et des comparaisons directes avec les politiques de type VLA déjà déployées.

UEPas d\'impact direct sur la France/UE

RecherchePaper
1 source
Apprentissage de l'anticipation sans trajectoires explicites pour les politiques de diffusion 3D
4arXiv cs.RO 

Apprentissage de l'anticipation sans trajectoires explicites pour les politiques de diffusion 3D

Un preprint publié sur arXiv en septembre 2026 (2609.20669) présente Movement Trend Guidance (MTG), une méthode qui améliore les politiques de diffusion 3D en manipulation robotique. Construite au-dessus du modèle de référence DP3 (3D Diffusion Policy), elle n'ajoute que 3,52% de paramètres supplémentaires. À partir d'un court historique d'observations, le système apprend une représentation latente compacte de l'évolution de l'interaction, supervisée à l'entraînement par des états futurs épars du gripper; à l'inférence, seul ce latent sert de signal de conditionnement, injecté via une branche FiLM ajoutée au goulot d'étranglement du réseau UNet. Les gains face à DP3 sont nets sur trois bancs d'essai: 62,8% contre 56,1% en entraînement mixte sur 50 tâches de RoboTwin2.0, 71,93% contre 37,08% sur LIBERO-40, et 72,0% contre 49,0% sur cinq tâches évaluées en conditions réelles, sur le benchmark DexArt. L'enjeu dépasse le score brut. Les politiques de diffusion génèrent des mouvements géométriquement plausibles à partir de l'observation présente, mais laissaient jusqu'ici l'anticipation de la suite de l'interaction émerger implicitement de l'apprentissage de l'action seule. MTG rend cette anticipation explicite sans imposer de trajectoire planifiée, une alternative légère aux modèles du monde ou à la prédiction de trajectoire explicite, plus coûteux en calcul. Pour les intégrateurs et les équipes de recherche, le signal clé est que ce gain de robustesse, dont un quasi-doublement du taux de réussite sur LIBERO-40, s'obtient pour un surcoût d'architecture marginal, ce qui facilite une adoption dans des piles déjà basées sur DP3. Le travail reste toutefois un résultat de preprint non relu par les pairs, évalué selon le protocole propre des auteurs; l'écart entre benchmark et déploiement industriel réel reste à confirmer à plus grande échelle. DP3 combine diffusion générative et observations en nuages de points 3D pour l'apprentissage par imitation de tâches de manipulation. RoboTwin2.0, LIBERO-40 et DexArt sont des bancs d'essai standards du secteur pour comparer les politiques de manipulation, en simulation et, pour partie, en conditions réelles. MTG s'inscrit dans une recherche plus large, menée en parallèle des grands modèles vision-langage-action comme Pi-0, GR00T N2 ou Helix, qui cherchent tous à doter les politiques robotiques d'une meilleure anticipation à long horizon sans planification de trajectoire coûteuse. Aucun acteur commercial français ou européen n'est associé à ces travaux, qui restent une contribution académique; ni date de publication du code ni pilote industriel ne sont mentionnés, la suite logique étant une revue par les pairs puis une éventuelle intégration dans des piles VLA commerciales existantes.

RecherchePaper
1 source