Aller au contenu principal
RecherchearXiv cs.RO 

ULOHA : un système robotique bimanuel sous-marin pour l'apprentissage robotique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une équipe de recherche présente ULOHA, une plateforme robotique bimanuelle sous-marine dédiée à l'apprentissage de politiques par imitation, décrite dans un article publié sur arXiv (référence 2609.19200, septembre 2026). Le système associe du matériel maison en configuration leader-suiveur pour la téléopération à des extensions logicielles du framework open source LeRobot, couvrant toute la chaîne : téléopération, capture vidéo multi-angles, collecte de démonstrations, entraînement de politiques et déploiement autonome. Les expériences sur robot réel montrent des comportements bimanuels coordonnés sous l'eau, dont le transfert d'objet entre les deux bras, la manipulation partagée d'un même objet et l'interception d'objets mis en mouvement par la flottabilité. Trois méthodes d'apprentissage ont été testées sur la plateforme : ACT, Diffusion Policy et le modèle vision-langage-action SmolVLA. Une étude complémentaire à un seul bras a par ailleurs examiné le transfert de politiques entre l'air et l'eau, montrant que des démonstrations mélangeant les deux milieux permettent l'exécution dans les deux, dans les conditions testées.

Pour le secteur, ULOHA comble un angle mort : la quasi-totalité des travaux sur l'apprentissage visuomoteur par imitation et sur les modèles VLA a été développée et validée en air, pour la manipulation domestique comme industrielle, alors que la robotique bimanuelle sous-marine restait peu étudiée. Le papier documente les perturbations propres au milieu aquatique, comme les bulles, les mouvements d'objets induits par la flottabilité, les horizons d'exécution d'action et le chunking temps réel, qui dégradent les politiques conçues pour l'air. C'est un test de robustesse notable pour des architectures qui, jusqu'ici, avaient surtout prouvé leur généralisation en environnement sec et contrôlé. Pour les intégrateurs concernés par l'inspection sous-marine, la maintenance offshore, l'aquaculture ou la robotique marine scientifique, cela suggère qu'un apprentissage par démonstration déjà mature en air pourrait être transposé sous l'eau moyennant des adaptations ciblées, plutôt qu'un retour au contrôle classique.

ULOHA s'appuie sur LeRobot, le framework open source de robotique publié par Hugging Face, que les auteurs étendent à un scénario bimanuel immergé non couvert nativement. Le projet se présente comme un outil expérimental partagé avec la communauté de recherche plutôt que comme un produit commercial : l'article ne mentionne ni volume de déploiement, ni prix, ni partenaire industriel. Le matériel, le code et les données de démonstration sont annoncés comme disponibles via une page dédiée, ce qui laisse présager une adoption par d'autres laboratoires travaillant sur la manipulation sous-marine ou le transfert de politiques entre domaines physiques distincts. Les suites logiques, non détaillées dans l'article, porteraient vraisemblablement sur l'élargissement du jeu de démonstrations et le passage à des tâches plus complexes.

À lire aussi

Factorisation tâche-monde pour l'apprentissage robotique
1arXiv cs.RO 

Factorisation tâche-monde pour l'apprentissage robotique

Une équipe de chercheurs a publié le 2 juin 2026 sur arXiv (arXiv:2606.02027) un framework d'apprentissage robotique baptisé "World-Task Factorization", dont le principe central est de séparer structurellement ce qui relève du monde physique de ce qui relève de la tâche à accomplir. Les facteurs "monde" regroupent les propriétés du corps du robot et de son environnement, indépendamment de toute intention ; les facteurs "tâche" encodent la logique de ce que le monde autorise à faire. Pour instancier cette séparation, les auteurs couplent un module analytique nommé AICON, un graphe différentiable d'estimateurs récursifs compositionnels opérant sans données spécifiques à la tâche, à une politique apprise compacte qui module les chemins de gradient. Ce mécanisme est testé sur trois familles de problèmes impliquant des robots hétérogènes, des modalités sensorimotrices variées et des logiques de tâche distinctes ; le framework surpasse les baselines bout-en-bout et les heuristiques analytiques dans tous les scénarios, et les auteurs rapportent un transfert vers du matériel réel sans réentraînement. L'intérêt industriel de cette approche tient à ce qu'elle adresse directement le problème de généralisation, obstacle majeur à la commercialisation des robots polyvalents. En factorisant explicitement monde et tâche, le framework promet de réduire le volume de données nécessaire au réentraînement lors d'un changement de contexte, de coéquipier ou de contrainte, là où les architectures bout-en-bout actuelles exigent de recollecterdes données à chaque variation. La capacité annoncée de généralisation zero-shot à des configurations hors distribution reste toutefois à valider à plus grande échelle : les expériences rapportées, bien que convaincantes sur trois domaines, demeurent de portée laboratoire, sans chiffres de volume de déploiement ni métriques de cycle time dans des contextes industriels réels. Sur le plan académique, ce travail s'inscrit dans un débat structurant du domaine : faut-il laisser la structure émerger du passage à l'échelle des données (approche des VLA de type Pi-0, GR00T N2 ou OpenVLA), ou l'encoder explicitement via des hiérarchies ou des bibliothèques de compétences ? Le framework proposé prend une troisième voie, fondée sur la théorie bayésienne (evidence du modèle, rasoir d'Occam) pour justifier la factorisation. Il se positionne ainsi face aux travaux de Physical Intelligence (Pi-0), de Boston Dynamics, et des laboratoires académiques comme Berkeley (RT-2, RoboAgent) ou Stanford (Mobile ALOHA). Les auteurs n'annoncent pas de partenariat industriel ni de calendrier de commercialisation ; l'étape suivante naturelle serait une validation sur des manipulateurs ou des humanoïdes dans des environnements semi-structurés, avec des métriques de robustesse publiées.

RecherchePaper
1 source
EquiBim : apprentissage d'une politique équivariante par symétrie pour la manipulation bimanuelle
2arXiv cs.RO 

EquiBim : apprentissage d'une politique équivariante par symétrie pour la manipulation bimanuelle

Des chercheurs présentent EquiBim, un cadre d'apprentissage par imitation qui impose une contrainte de symétrie bilatérale aux politiques de manipulation bimanuelle. Publié sur arXiv (2603.08541, version 3, une révision d'un article déjà soumis), le travail part d'un constat simple: les bras robotiques à deux membres partagent souvent une symétrie morphologique gauche-droite, tout comme de nombreuses tâches qu'ils exécutent, mais les politiques entraînées par imitation classique ne l'exploitent pas et produisent des comportements incohérents face à des observations pourtant symétriques. EquiBim formalise cette symétrie physique comme une action de groupe sur les espaces d'observation et d'action, puis impose une contrainte d'équivariance aux prédictions du modèle pendant l'entraînement. Le framework se veut agnostique au modèle sous-jacent: il s'intègre à des pipelines variés, qu'ils reposent sur des nuages de points ou des images, et que les actions soient paramétrées dans l'espace cartésien de l'effecteur ou dans l'espace articulaire. Les auteurs valident l'approche sur RoboTwin, une plateforme de simulation à cinématique bimanuelle symétrique, avant de la tester sur un système bras double réel. L'intérêt pour l'industrie tient à la nature du gain rapporté: une amélioration constante des performances et de la robustesse face aux changements de distribution, en simulation comme en conditions réelles. C'est un signal utile dans un secteur où l'écart entre démonstrations impressionnantes et fiabilité en déploiement reste un point de friction majeur pour les intégrateurs de robots bimanuels et humanoïdes. Injecter un biais inductif structurel, plutôt que de compter uniquement sur le volume de données de démonstration, est une piste que plusieurs laboratoires explorent pour réduire le besoin en données coûteuses tout en stabilisant le comportement des politiques VLA. Le contexte est celui d'une littérature déjà riche sur l'équivariance en apprentissage robotique, jusqu'ici surtout appliquée aux bras uniques. EquiBim l'étend au cas bimanuel, dans un paysage où des architectures comme GR00T N2, Pi-0 ou Helix cherchent aussi à généraliser au-delà des données d'entraînement. À ce stade, il s'agit d'un résultat académique reproductible sur banc d'essai et sur un prototype réel, pas d'un produit commercial: la suite logique serait son adoption ou son adaptation par des équipes développant des piles de contrôle bimanuelles en conditions industrielles.

RecherchePaper
1 source
Mask World Model : prédire l'essentiel pour un apprentissage robuste des politiques robotiques
3arXiv cs.RO 

Mask World Model : prédire l'essentiel pour un apprentissage robuste des politiques robotiques

Des chercheurs ont publié sur arXiv (réf. 2604.19683) le Mask World Model (MWM), une architecture de world model pour l'apprentissage de politiques robotiques robustes. Contrairement aux approches dominantes qui entraînent des modèles génératifs sur de la vidéo RGB, MWM prédit l'évolution de masques sémantiques, des représentations géométriques des objets en scène, à l'aide d'une architecture de diffusion vidéo. Une tête de politique basée sur la diffusion est intégrée en aval pour un contrôle bout-en-bout. Évalué sur les benchmarks de simulation LIBERO et RLBench, MWM surpasse significativement les world models RGB de l'état de l'art. Un protocole de robustesse par élagage aléatoire de tokens et des expériences en conditions réelles confirment la résilience du modèle face à la perte partielle d'information visuelle. Le problème ciblé est structurel : les world models entraînés à prédire des pixels RGB mémorisent des corrélations parasites liées aux arrière-plans dynamiques, aux variations d'éclairage ou aux textures changeantes. Ces distracteurs produisent des politiques fragiles qui échouent hors distribution, phénomène central du "demo-to-real gap" qui freine le déploiement industriel des robots apprenants. En contraignant le modèle à opérer sur des masques géométriques plutôt que sur des pixels bruts, MWM impose un goulot d'information qui force la représentation interne à capturer ce qui importe réellement pour la manipulation : dynamiques physiques, relations de contact, géométrie des objets. C'est une contribution méthodologique notable dans le débat sur ce que les world models doivent apprendre pour être fiables à l'échelle opérationnelle. Les world models pour la robotique ont émergé comme paradigme dominant ces deux dernières années, portés par des architectures comme UniSim, Dreamer, ou les VLA récents de Physical Intelligence (pi-0), Google DeepMind (GR00T N2) et Figure Robotics, qui misent presque tous sur la fidélité de reconstruction RGB. MWM propose une alternative centrée sur l'abstraction géométrique, un positionnement distinct dans cet écosystème en pleine consolidation. Il convient de noter qu'il s'agit d'une prépublication non encore relue par des pairs, et que les expériences en conditions réelles restent limitées en échelle et en diversité de tâches. Les suites naturelles incluent une validation sur des manipulateurs industriels en environnement non contrôlé, étape que les auteurs n'ont pas encore franchie.

RechercheOpinion
1 source
Ce qui compte pour les actions latentes dans l'apprentissage robotique
4arXiv cs.RO 

Ce qui compte pour les actions latentes dans l'apprentissage robotique

Des chercheurs publient sur arXiv (2608.19613v1, article inédit non encore évalué par les pairs) la première étude empirique systématique consacrée aux Latent Action Models (LAM), une famille de modèles qui permet à l'apprentissage robotique d'exploiter de grands volumes de vidéos non étiquetées en les traduisant en actions latentes, des substituts compacts aux commandes physiques réelles. Les auteurs unifient les méthodes LAM existantes dans un cadre autoencodeur commun, puis testent systématiquement 41 choix de conception répartis en trois axes : les paradigmes de modélisation des actions latentes, les objectifs d'apprentissage et méthodes de régularisation associées, et les stratégies d'intégration de ces actions latentes dans les politiques de contrôle robotique. Ils évaluent également quatre métriques proxy censées juger la qualité des actions latentes, en vérifiant si elles prédisent effectivement la performance en manipulation. Les expériences couvrent trois benchmarks standards du domaine, avec une validation complémentaire sur des tâches de manipulation exécutées par un robot réel. Le résultat principal, le fine-tuning du backbone d'un modèle vision-langage (VLM) avec des actions latentes offre une meilleure initialisation pour l'apprentissage de politiques robotiques en aval qu'une simple utilisation figée du VLM, apporte une base empirique à un pan de recherche jusqu'ici dispersé. Pour les équipes qui développent des modèles VLA (vision-langage-action), ce travail répond à un problème concret : la rareté et le coût des données d'action étiquetées poussent le secteur à préentraîner sur des vidéos non annotées, mais chaque laboratoire testait ses propres choix d'architecture dans des conditions expérimentales différentes, rendant les comparaisons peu fiables. Cette étude fournit des repères de conception réels plutôt que des affirmations marketing sur le préentraînement vidéo. Le contexte est celui d'un champ de recherche fragmenté : les méthodes LAM se sont multipliées ces dernières années sans cadre d'évaluation commun, chaque publication isolant une variable différente. En proposant un cadre unifié et une comparaison à grande échelle de 41 configurations, les auteurs cherchent à combler ce vide méthodologique. Il s'agit d'un travail académique de type ablation étude, pas d'un produit ni d'un déploiement commercial : les suites attendues concernent l'adoption de ces recommandations de conception par les équipes développant des modèles VLA préentraînés sur vidéo à plus grande échelle.

RecherchePaper
1 source