Aller au contenu principal
RecherchearXiv cs.RO 

Diffusion ReRoll : débruitage révisable pour la prédiction séquentielle en robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (arXiv:2607.19919v1) Diffusion ReRoll, un nouveau framework de diffusion pour la prédiction séquentielle en robotique, conçu pour rendre le débruitage "révisable" sur un horizon temporel. Contrairement aux approches existantes qui appliquent un débruitage monotone en une seule passe, la méthode renoise sélectivement les segments devenus localement stables pendant que le reste de la séquence continue à se débruiter, permettant aux portions passées et futures de se réviser mutuellement tout en gardant leur cohérence locale. L'équipe compare Diffusion ReRoll à deux références du domaine, la diffusion pleine séquence et le débruitage causal de Diffusion Forcing, sur trois familles de tâches: planification à long horizon, apprentissage de politiques et modélisation vidéo-action unifiée. Sur les benchmarks OGBench PointMaze et AntMaze, la méthode obtient des gains relatifs de taux de réussite de 21% face à Diffusion Forcing en planification guidée et de 23% face à Diffuser en goal-inpainting. Sur LIBERO-10, un benchmark multi-tâches de prédiction d'actions, le gain relatif atteint 56,5% par rapport à Diffusion Policy, quel que soit l'horizon de prédiction ou la longueur d'historique utilisée.

Ce résultat cible un point de friction connu des architectures VLA et des politiques par diffusion: la difficulté à réviser une trajectoire déjà partiellement générée sans tout recalculer depuis le début. Un débruitage figé pénalise la robustesse quand le contexte évolue en cours d'exécution, un problème direct pour les intégrateurs qui déploient des politiques d'action sur bras manipulateurs ou robots mobiles en environnement changeant. Les gains observés en généralisation hors distribution, où Diffusion ReRoll conserve la meilleure cohérence action-vidéo, suggèrent un mécanisme plus robuste que le simple ajustement d'hyperparamètres, sans toutefois valider un déploiement en conditions réelles.

Il s'agit à ce stade d'un travail de recherche publié en preprint, sans laboratoire ni affiliation précisée dans le résumé, positionné comme amélioration directe de Diffusion Forcing et Diffusion Policy, deux méthodes de référence en génération de séquences robotiques par diffusion. Les auteurs n'annoncent pas de code ni de date de publication complète pour l'instant, la validation reposant uniquement sur des benchmarks simulés (OGBench, LIBERO-10).

Dans nos dossiers

À lire aussi

Planification séquentielle par points d'ancrage pour la robotique
1arXiv cs.RO 

Planification séquentielle par points d'ancrage pour la robotique

Des chercheurs de la Case Western Reserve University ont publié SPARK (Sequential Planning via Anchored Robotic Keypoints), un système neurosymbolique de manipulation robotique sans entraînement supplémentaire. Sur LIBERO-PRO, benchmark évaluant la robustesse face aux changements de position et de tâche, SPARK atteint 43,7 % sur six configurations, soit plus du double de CaP-Agent0 (18,2 %) et des baselines Vision-Language-Action. L'architecture repose sur deux appels Gemini : le premier génère un arbre de comportement (behavior tree) typé composé de primitives précodées intégrant le contrôle bas niveau (mouvement, préhension, géométrie de profondeur) ; le second propose trois formulations textuelles alternatives par objet, que SAM3 évalue pour retenir la détection la plus confiante. Un mécanisme de récupération relance toute primitive échouée sur des objets re-détectés, sans nouvel appel LLM. Le système a été validé sur trois familles de robots (UR10e, Franka FR3, Franka bimanuels) pour neuf tâches à vingt essais chacune, avec une moyenne de 68 %. Le résultat central est architectural : SPARK identifie la perception comme le principal point de rupture des pipelines de manipulation, non la planification. Les formulations alternatives par objet apportent +27,7 points sur les tâches spatiales et +10,0 sur la suite objet ; la boucle de récupération ajoute +5,0 points globalement. Là où CaP-Agent0 re-interroge un LLM en repartant de zéro à chaque échec, SPARK ne replanifie que la détection, réduisant significativement le coût computationnel. Point stratégique : chaque essai produit automatiquement une trajectoire vérifiée et étiquetée, permettant à un planificateur training-free de générer les données dont les VLAs ont besoin sans téleopération humaine. SPARK s'inscrit dans le débat entre architectures VLA end-to-end (pi-0 de Physical Intelligence, RT-2 de Google DeepMind, OpenVLA de Berkeley) et approches hybrides symboliques. Les VLAs misent sur la généralisation apprise de données massives mais restent fragiles aux distributions non vues à l'entraînement, précisément ce que LIBERO-PRO mesure. SPARK démontre qu'une conception neurosymbolique rigoureuse peut surpasser des modèles foundation sur des configurations difficiles. La validation reste limitée à neuf tâches sur trois plateformes, sans timeline de déploiement industriel annoncée. La modularité du système -- détecteur, planificateur et contrôleur remplaçables indépendamment -- ouvre la voie à des intégrations sur de nouvelles plateformes sans réentraînement.

RecherchePaper
1 source
Modèles de diffusion séquentiels pour l'apprentissage méta en contexte de la dynamique des robots
2arXiv cs.RO 

Modèles de diffusion séquentiels pour l'apprentissage méta en contexte de la dynamique des robots

Des chercheurs ont publié sur arXiv (réf. 2604.13366) une étude comparative portant sur l'identification de systèmes robotiques par méta-apprentissage en contexte, en opposant des modèles de séquences déterministes à des approches génératives basées sur la diffusion. L'équipe reformule le problème classique de l'identification de dynamiques robotiques comme une tâche de méta-apprentissage in-context : le modèle observe une séquence de paires (commande, observation) pour inférer les paramètres dynamiques d'un robot sans re-entraînement. Deux architectures de diffusion sont introduites et évaluées face à une baseline Transformer déterministe : une diffusion par inpainting (inspirée de Diffuser), qui apprend la distribution jointe entrée-observation, et des modèles de diffusion conditionnés sur les entrées de contrôle, déclinés en versions CNN et Transformer. Les expériences sont menées à grande échelle dans des simulations randomisées couvrant des régimes en distribution et hors distribution. Ces résultats sont significatifs pour la commande basée sur modèle (model-based control), qui exige des prédictions de dynamique précises et robustes. L'étude montre que les modèles de diffusion surpassent nettement la baseline déterministe lorsque les conditions d'exécution s'écartent de la distribution d'entraînement, un scénario courant dans les déploiements industriels réels où les robots rencontrent des charges utiles variables, des surfaces inattendues ou de l'usure mécanique. La diffusion par inpainting obtient les meilleures performances globales. Un résultat clé concerne la contrainte temps réel : grâce à un échantillonnage à démarrage chaud (warm-started sampling), les modèles de diffusion parviennent à opérer dans les fenêtres temporelles exigées par les boucles de contrôle, levant ainsi un obstacle majeur à leur adoption pratique. Ce travail s'inscrit dans un courant de recherche actif qui cherche à combiner les capacités génératives des modèles de diffusion avec les exigences de robustesse et de latence du contrôle robotique. La diffusion appliquée à la planification de trajectoires et à la prédiction de dynamiques a émergé avec des travaux comme Diffuser (Janner et al., 2022) et se confronte ici à un scénario de méta-apprentissage, plus réaliste pour des robots déployés dans des environnements variables. Les concurrents directs incluent les approches probabilistes bayésiennes et les réseaux neuronaux récurrents pour l'identification en ligne. La prochaine étape naturelle sera une validation sur hardware réel, notamment pour confirmer que les gains hors distribution observés en simulation résistent au sim-to-real gap.

RecherchePaper
1 source
Structure de prédiction latente 4D pour la planification robotique
3arXiv cs.RO 

Structure de prédiction latente 4D pour la planification robotique

Structured 4D Latent Predictive Model : un système de prédiction spatiale en 3D pour la planification robotique Une équipe de recherche publie sur arXiv (identifiant 2607.01166v1) un nouveau modèle baptisé « Structured 4D Latent Predictive Model », conçu pour la planification de tâches robotiques. Contrairement aux modèles prédictifs vidéo classiques, qui travaillent sur des séquences 2D, ce système prédit l'évolution de la structure 3D d'une scène dans un espace latent structuré, à partir d'observations visuelles et d'instructions textuelles. Cette représentation peut être décodée vers plusieurs formats 3D, offrant une compréhension plus complète et géométriquement cohérente de la scène. Le modèle sert de planificateur : il génère des scènes futures qui sont ensuite converties en actions exécutables par un module de dynamique inverse conditionné par l'objectif. Selon les auteurs, les expériences montrent une qualité visuelle élevée et une cohérence 3D et multi-vues nettement supérieure aux meilleurs planificateurs vidéo existants, avec de meilleures performances sur des tâches de manipulation complexes, une bonne généralisation à des conditions visuelles inédites, et une validation sur plateformes robotiques réelles. Un site dédié (structured-4d-model.github.io) présente le projet. L'enjeu dépasse la seule prouesse technique. Les modèles vidéo 2D dominent actuellement l'approche « world model » en robotique, notamment dans les architectures VLA (vision-language-action) qui inspirent des systèmes comme Pi-0 ou GR00T N2. Or ces approches peinent souvent à garantir une cohérence physique et spatiale suffisante pour une manipulation fine. En injectant explicitement une structure 3D dans l'espace latent, ce travail répond directement à une limite identifiée du secteur : le fossé entre démonstrations vidéo impressionnantes et exécution fiable sur du matériel réel, un problème central pour les intégrateurs industriels qui cherchent des systèmes robustes plutôt que des démonstrations sélectionnées. Il s'agit toutefois d'une publication académique à ce stade, sans laboratoire ni entreprise identifiés dans le résumé, et sans date de déploiement annoncée. Elle s'inscrit dans une compétition de recherche intense autour des modèles prédictifs pour la robotique, où plusieurs équipes explorent en parallèle des représentations 3D ou 4D pour dépasser les limites du tout-vidéo. Les prochaines étapes dépendront de la publication du code et de tests indépendants sur des plateformes tierces.

RecherchePaper
1 source
ParkourFormer : supervision prédictive et modélisation séquentielle pour la locomotion parkour
4arXiv cs.RO 

ParkourFormer : supervision prédictive et modélisation séquentielle pour la locomotion parkour

Des chercheurs ont publié le 27 mai 2026 un preprint arXiv (2605.25782) présentant ParkourFormer, un système de locomotion pour humanoïdes capable de traverser des terrains variés, escaliers, fossés, pentes, surfaces irrégulières et obstacles -- sans changer de politique de contrôle. Le coeur de l'approche repose sur un Transformer qui reformule la locomotion comme un problème de décision conditionné par le futur : l'état courant du robot interroge via un mécanisme de cross-attention un historique de trajectoires sensorimotrices, tandis qu'une tête de prédiction légère anticipe les états proprioceptifs à court horizon. Ces états futurs prédits, supervisés par un signal d'apprentissage dédié, sont fusionnés avec les caractéristiques temporelles pour générer les commandes motrices. Les expériences en simulation et sur un robot humanoïde réel donnent un taux de succès moyen de 93,85 % sur l'ensemble des terrains testés, avec des gains allant jusqu'à 42,73 % par rapport aux baselines MLP, MLP à mélange d'experts (MoE) et Transformer standard. Ce résultat est notable parce qu'il cible précisément le talon d'Achille des politiques de locomotion agile actuelles : leur caractère purement réactif. La plupart des systèmes RL existants mappent directement observations vers actions, sans modéliser l'évolution du corps dans le temps. Or pour des transitions de contact rapides -- typiques du parkour ou d'un environnement industriel encombré -- anticiper la dynamique corporelle quelques centièmes de seconde à l'avance change fondamentalement la robustesse. Le fait qu'une politique unique couvre cinq classes de terrain sans spécialisation par environnement est également un signal fort pour les intégrateurs : réduire la fragmentation des politiques simplifie le déploiement sur robots physiques. ParkourFormer s'inscrit dans une vague de travaux qui cherchent à dépasser le gap simulation-réalité pour la locomotion agile humanoïde, aux côtés de systèmes comme PKU-DynaGait, Agility Robotics Digit ou les travaux open-source de Berkeley Humanoid. L'article reste un preprint non encore évalué par les pairs, et les vidéos de démonstration n'ont pas encore été rendues publiques à la date de soumission -- ce qui invite à réserver son jugement sur les performances réelles. Les auteurs n'annoncent pas de déploiement industriel ni de partenariat commercial ; les prochaines étapes naturelles seraient une évaluation sur des plateformes humanoïdes commerciales (Unitree H1/G1, Fourier GR-1) et une confrontation à des conditions extérieures non contrôlées.

RecherchePaper
1 source