Aller au contenu principal
RecherchearXiv cs.RO 

Koopman DCM : les fonctions propres instables comme représentations pour l'équilibre des robots à pattes

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Les chercheurs à l'origine de cette étude, publiée sur arXiv fin juillet 2026, proposent une nouvelle formulation des composantes divergentes du mouvement (DCM), un concept clé pour l'équilibre des robots à pattes. Historiquement, le DCM isole le mode instable de la dynamique d'un robot bipède, mais les formulations existantes se limitent à des modèles réduits comme le pendule inversé linéaire. L'équipe montre que ces DCM peuvent être reformulés de façon plus générale comme des fonctions propres de Koopman, une approche mathématique qui permet de représenter une dynamique non linéaire par un système linéaire de dimension plus grande. Fait notable, alors que l'analyse de Koopman cible habituellement des valeurs propres proches de zéro, correspondant à des grandeurs conservées ou lentement variables, les auteurs recherchent volontairement des paires propres instables à grande valeur propre. Ces "DCM de Koopman" sont des observables entièrement pilotées par les données, entraînées uniquement à partir de données réelles issues d'un robot bipède, sans modèle physique préalable. Avec seulement une heure de données collectées sur le robot réel, le système améliore le suivi des trajectoires de marche de référence.

Pour le secteur robotique, ce résultat pèse dans le débat entre approches basées modèle et approches data-driven pour le contrôle d'équilibre, un enjeu central pour les humanoïdes et bipèdes destinés à des environnements non structurés. Une méthode capable d'apprendre des représentations d'instabilité directement depuis des données réelles, avec un volume d'entraînement aussi limité, réduit la dépendance à des modèles dynamiques complexes et coûteux à calibrer, un frein connu au déploiement en usine ou en extérieur pour les intégrateurs.

Le concept de DCM, aussi appelé "capture point" dans la littérature sur la locomotion bipède, structure le contrôle d'équilibre depuis plus d'une décennie, notamment dans les approches à pendule inversé linéaire utilisées par de nombreux bipèdes de recherche. En combinant leurs DCM appris avec un contrôle prédictif par modèle (MPC), les auteurs introduisent aussi des contraintes de viabilité fondées sur l'état, une piste qui pourrait s'étendre à d'autres classes de robots à pattes au-delà du cas bipède testé ici.

Dans nos dossiers

À lire aussi

PointAction : les points 3D comme représentation universelle des actions pour le contrôle robotique
1arXiv cs.RO 

PointAction : les points 3D comme représentation universelle des actions pour le contrôle robotique

Des chercheurs ont publié le 3 juin 2026 PointAction (arXiv:2506.03943), un cadre de contrôle robotique qui fait le pont entre les Video-Action Models (VAMs) et les commandes exécutables sur bras physique. Le constat de départ est précis : les modèles vidéo entraînés uniquement sur du RGB ne permettent pas de contraindre la géométrie de contact 3D ni les marges spatiales métriques nécessaires à la manipulation, rendant le grounding des actions ambigu. PointAction répond à ce problème en affinant un modèle de génération vidéo de fondation pour prédire simultanément des frames RGB futurs et des pointmaps 3D dynamiques, produisant une représentation 4D (3D + temps) cohérente de la scène. Ces cartes de points servent d'interface structurée et embodiment-agnostic entre prédiction vidéo et contrôle moteur, qu'un décodeur d'actions basé sur la diffusion traduit ensuite en commandes exécutables. Les résultats publiés indiquent une qualité de génération 4D état de l'art sur scènes robotiques, une supériorité sur les baselines existantes en simulation, et une généralisation à deux bras robotiques absents du préentraînement. L'enjeu pour les intégrateurs est concret. Les VAMs peinent depuis plusieurs années à franchir le fossé entre rollout vidéo convaincant et action physique fiable : le RGB seul ne transmet ni la profondeur métrique, ni l'orientation des surfaces de contact, ni les tolérances de précision requises. En intercalant une couche intermédiaire explicite, les pointmaps 3D dynamiques, PointAction décompose le problème et réduit structurellement l'ambiguïté d'ancrage. L'interface embodiment-agnostic réduit aussi le coût de supervision nécessaire pour adapter un modèle à une nouvelle plateforme, argument concret pour les intégrateurs multi-robots. La généralisation à des bras non vus en préentraînement contredit partiellement l'hypothèse dominante selon laquelle les architectures VLA (Vision-Language-Action) exigent des volumes massifs de données spécifiques par embodiment, bien qu'aucun chiffre de transfert à l'échelle industrielle ne soit publié. PointAction s'inscrit dans une vague de recherche exploitant les modèles de diffusion vidéo pour la robotique, dans le sillage de pi-0 de Physical Intelligence, de GR00T N2 de NVIDIA et d'OpenVLA. La représentation en points 3D fait écho à des travaux antérieurs comme Tracking Any Point (TAP) ou 3D-DiffuserActor, mais PointAction les intègre dans la boucle de génération plutôt qu'en post-traitement. Le papier reste à l'étape pré-print arXiv, sans validation indépendante ni déploiement industriel annoncé ; les prochaines étapes probables incluent une extension à des manipulateurs à plus haut degré de liberté et à des configurations mobiles, ainsi qu'une intégration avec des pipelines VLA existants.

RechercheOpinion
1 source
Anticipation sémantique pour les représentations d'actions robotiques
2arXiv cs.RO 

Anticipation sémantique pour les représentations d'actions robotiques

Traduction et synthèse en cours. Une équipe de recherche vient de publier sur arXiv (2607.13597, soumission de juillet 2026) une étude sur la dégradation des représentations sémantiques dans les modèles Vision-Language-Action (VLA), ces architectures qui pilotent aujourd'hui la plupart des robots humanoïdes commerciaux comme Figure 03, Optimus Gen 3 ou les modèles Pi-0 et GR00T N2. Le constat de départ est simple : ces modèles héritent d'une structure sémantique riche de leurs encodeurs vision-langage préentraînés, mais le finetuning sur un nombre limité de démonstrations robotiques érode cette structure, un phénomène que les chercheurs ont confirmé par un sondage systématique des représentations internes. Ils montrent aussi que la qualité de cette structure sémantique conditionne directement le taux de réussite des tâches et la capacité de généralisation hors distribution (out-of-distribution, OOD). Leur solution, baptisée ancrage sémantique, consiste à contraindre les représentations d'action à rester proches d'une variété sémantique de référence tout en séparant un canal partagé et un canal privé, les deux étant supprimés à l'inférence, sans changer le modèle déployé. Testée sur plusieurs backbones VLA en simulation et en conditions réelles, la méthode apporte jusqu'à +18,7% de réussite sur des tâches en distribution et +21,5% en généralisation OOD. L'enjeu dépasse la seule performance sur benchmark : la dérive sémantique pendant le finetuning est un problème connu mais peu quantifié dans l'industrie humanoïde, où les intégrateurs adaptent en permanence des modèles préentraînés à des tâches spécifiques d'usine ou d'entrepôt avec très peu de données. Une méthode plug-and-play, sans coût à l'inférence, qui améliore la robustesse hors distribution touche directement au fameux écart entre démonstration scénarisée et déploiement réel, un des points faibles récurrents des annonces du secteur ces deux dernières années. L'approche s'inspire de la théorie des neurones miroirs, selon laquelle observation et exécution d'une action partagent un même encodage au niveau de l'intention, et s'inscrit dans la lignée des travaux sur les VLA préentraînés type RT-2 ou OpenVLA, où la question du transfert des capacités du modèle vision-langage vers l'action reste un chantier ouvert. Les auteurs positionnent leur contribution comme complémentaire aux architectures existantes plutôt que comme un nouveau backbone, ce qui laisse présager une adoption potentielle par différents laboratoires sans remise en cause de leurs modèles de base.

RecherchePaper
1 source
SKooP : prédictions Koopman symétriques pour une locomotion plus rapide et généralisable des robots à pattes, via apprentissage par renforcement
3arXiv cs.RO 

SKooP : prédictions Koopman symétriques pour une locomotion plus rapide et généralisable des robots à pattes, via apprentissage par renforcement

Des chercheurs présentent SKooP (Symmetric Koopman Predictions), une méthode d'apprentissage par renforcement (RL) pour la locomotion de robots à pattes, détaillée dans un article récemment mis en ligne sur arXiv (2607.11624v1). L'approche combine deux leviers : les symétries morphologiques du robot et un modèle de Koopman appris via un autoencodeur, qui capture la dynamique du système sous une forme linéarisée. Ce modèle de Koopman génère des prédictions utilisées comme observations privilégiées pour le critique de l'algorithme acteur-critique, ce qui lui permet d'apprendre à partir de représentations plus lisses et informatives que les observations brutes. Les auteurs intègrent aussi des symétries de groupe dans les quatre réseaux du système (acteur, critique, encodeur, décodeur), produisant une politique fortement équivariante. Testée sur un robot quadrupède confronté à plusieurs tâches de locomotion bipède complexes, SKooP réduit systématiquement le temps de convergence et améliore la récompense obtenue par rapport aux approches de référence. Les politiques apprises se transfèrent en outre à différents environnements de simulation sans réentraînement complet. Ce résultat s'attaque à un point de friction connu du RL appliqué à la robotique : les méthodes qui encodent des a priori physiques dans l'apprentissage sont généralement validées sur des systèmes de faible dimension, bien définis, rarement sur des robots réels à dynamique non linéaire complexe comme les quadrupèdes ou de futurs humanoïdes. En démontrant un gain d'efficacité d'échantillonnage sur un système à haute dimension, SKooP apporte une preuve que ces techniques passent à l'échelle, un enjeu direct pour réduire le coût de calcul et le temps d'entraînement avant transfert sim-to-real, un goulot d'étranglement critique pour les intégrateurs qui doivent adapter des politiques à de nouvelles morphologies ou tâches sans repartir de zéro. La méthode s'inscrit dans une lignée de travaux récents cherchant à injecter des a priori physiques dans le RL pour compenser sa faible efficacité d'échantillonnage, en s'appuyant sur la théorie de l'opérateur de Koopman, déjà explorée en robotique pour linéariser des dynamiques non linéaires, ainsi que sur les travaux existants sur les symétries morphologiques en apprentissage de politiques. Les auteurs fournissent une analyse détaillée des modèles de Koopman appris et des politiques symétriques pour isoler la contribution de chaque composant. Le code et les résultats complémentaires sont accessibles via la page de projet dédiée.

RecherchePaper
1 source
Filtre de Kalman neuronal à mécanisme d'attention pour l'estimation d'état des robots à pattes
4arXiv cs.RO 

Filtre de Kalman neuronal à mécanisme d'attention pour l'estimation d'état des robots à pattes

Une équipe de chercheurs a publié sur arXiv (2601.18569v2) un filtre hybride baptisé AttenNKF (Attention-Based Neural-Augmented Kalman Filter), conçu pour améliorer l'estimation d'état sur les robots à pattes. Le glissement de pied constitue la principale source d'erreur dans ces systèmes : lorsqu'un pied glisse sur une surface, la mesure cinématique viole l'hypothèse de non-glissement et injecte un biais dans l'étape de mise à jour du filtre, dégradant l'estimation de position, vitesse et orientation. La solution augmente un InEKF (Invariant Extended Kalman Filter) avec un compensateur neuronal à mécanisme d'attention, qui infère l'erreur induite par le glissement en fonction de sa sévérité et l'applique en correction post-mise-à-jour sur l'état du filtre. Ce compensateur est entraîné dans un espace latent pour réduire la sensibilité aux échelles brutes des entrées et encourager des corrections structurées, tout en préservant la récursion mathématique de l'InEKF. L'enjeu est concret pour les équipes de locomotion et les intégrateurs industriels : l'estimation d'état est la brique fondamentale du contrôle d'un robot à pattes, et une erreur non corrigée se propage dans la boucle de contrôle jusqu'à provoquer des chutes ou des trajectoires aberrantes, notamment sur sols glissants, rampes ou surfaces variables en environnement d'usine. L'approche hybride filtres classiques plus réseau de neurones léger préserve les garanties mathématiques de l'InEKF tout en ajoutant une adaptabilité aux conditions non modélisées, sans reformuler entièrement le pipeline d'estimation. Les expériences montrent des performances supérieures aux estimateurs existants sous conditions de glissement, bien que les plateformes hardware testées ne soient pas précisées dans la version publiée, ce qui limite l'évaluation comparative. L'InEKF s'est imposé comme référence pour les robots à pattes grâce à des travaux de l'Université du Michigan vers 2019-2020 sur le bipède Cassie d'Agility Robotics, exploitant son invariance aux symétries de groupe de Lie. L'augmentation par réseaux neuronaux pour corriger les non-linéarités résiduelles est une direction active chez plusieurs groupes de recherche, dont ETH Zurich sur ANYmal, MIT et Carnegie Mellon. Les déploiements réels de Spot (Boston Dynamics), Digit (Agility Robotics) et Figure 02 font tous face au problème d'estimation sous glissement en conditions industrielles, ce qui donne à cette approche une pertinence directe pour le transfert sim-to-real vers des systèmes commerciaux. La prochaine étape naturelle sera une validation embarquée sous contraintes temps-réel sur des plateformes standardisées avec benchmarks publics.

RecherchePaper
1 source