Aller au contenu principal
RecherchearXiv cs.RO 

M3GD : une diffusion géométrique multimodale et multi-vue pour la synthèse de nouvelles vues caméra-LiDAR

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

M3GD (Multi-Modal Multi-View Geometric Diffusion), publié sur arXiv le 25 septembre 2026, est une méthode de synthèse de nouvelles vues combinant caméra et LiDAR, là où la plupart des approches génératives existantes reposent uniquement sur l'image. Le système assemble des modèles de fondation 2D et 3D pré-entraînés séparément, sans traducteur cross-modal dédié : après projection caméra, les features LiDAR et image figées partagent déjà une structure spatiale commune exploitable. Des statistiques géométriques et des descripteurs de nuages de points, regroupés en paquets alignés sur la vue, sont injectés via un adaptateur résiduel léger dans un générateur multi-vues par flow-matching, sans modifier son espace latent, ses décodeurs ni son objectif d'entraînement. Sur le jeu de données GrandTour, M3GD améliore la synthèse RGB et de profondeur par rapport à une version image seule du même modèle, et a été déployé sur un robot terrestre, avec un compromis qualité/coût réglable via le nombre d'étapes d'intégration d'Euler.

L'enjeu dépasse la curiosité académique : les rendus génératifs de synthèse de vues purement image peuvent paraître réalistes tout en étant géométriquement faux, un défaut rédhibitoire quand ces vues nourrissent l'entraînement, la simulation ou la navigation d'un robot. En démontrant que des features LiDAR et image pré-entraînées séparément partagent déjà une structure spatiale exploitable sans réentraînement lourd, M3GD ouvre une voie économique pour fusionner des capteurs hétérogènes dans des pipelines génératifs existants plutôt que de reconstruire des architectures dédiées, un argument qui parle directement aux équipes de perception multi-capteurs en robotique industrielle.

Le travail s'inscrit dans la lignée des générateurs multi-vues par flow-matching, famille de modèles de diffusion déjà utilisée pour la synthèse de vues en robotique, jusque-là cantonnée aux données caméra. Le papier ne cite aucun concurrent commercial et reste une contribution de recherche académique, sans produit ni pilote industriel annoncé. Sa validation se limite au jeu de données GrandTour et à un unique déploiement sur robot terrestre, sans calendrier d'intégration commerciale communiqué, ce qui situe M3GD au stade de preuve de concept plutôt que de solution prête à l'industrialisation.

Dans nos dossiers

À lire aussi

MoDex : une politique de diffusion pour la saisie dextérique séquentielle multi-objet
1arXiv cs.RO 

MoDex : une politique de diffusion pour la saisie dextérique séquentielle multi-objet

Des chercheurs ont publié MoDex, une politique de diffusion conçue pour saisir séquentiellement plusieurs objets avec une seule main robotique dextère, sans relâcher ceux déjà tenus. Le système, présenté dans un preprint arXiv (2606.05407), a été évalué sur un bras Franka Emika Panda équipé d'une main Allegro à 16 degrés de liberté, en simulation MuJoCo et sur plateforme physique réelle. MoDex prédit la prochaine pose du préhenseur directement depuis les observations, conditionnée sur un nuage de points 3D et un espace dit "d'opposition" qui détermine quels doigts participent à la saisie courante. Ce mécanisme permet de n'utiliser qu'un sous-ensemble des DOF disponibles pour l'objet en cours, en réservant le reste pour les saisies suivantes. L'entraînement se déroule en deux phases : d'abord par imitation learning sur des démonstrations expertes, puis par fine-tuning par renforcement (RL), qui améliore systématiquement les taux de succès. En simulation, MoDex surpasse les baselines d'apprentissage évalués de 2,92 à 17,92 % ; en conditions réelles, le gain s'établit entre 6,67 et 17,78 %. L'enjeu technique est significatif : la quasi-totalité des méthodes de saisie dextère existantes mobilisent l'intégralité des DOF de la main pour chaque objet, la rendant inutilisable pour une prise successive sans reposer les objets intermédiaires. MoDex démontre qu'une politique de diffusion conditionnée sur l'espace d'opposition permet de résoudre ce problème de coordination des doigts avec des gains mesurables, y compris en transfert sim-to-réel. Le fait que le fine-tuning RL améliore systématiquement la politique pré-entraînée confirme l'intérêt de l'approche hybride imitation plus renforcement pour des tâches de manipulation complexe. Pour les intégrateurs industriels et les équipes de robotique, ce résultat suggère que des préhenseurs dextères multi-doigts peuvent être exploités de manière nettement plus efficace qu'aujourd'hui, notamment pour des tâches d'assemblage ou de tri où l'agent doit accumuler plusieurs pièces sans cycle de dépôt intermédiaire. Ce travail s'inscrit dans un champ de recherche actif autour de la manipulation dextère, où la main Allegro, commercialisée par Wonik Robotics, sert de plateforme de référence dans de nombreux laboratoires. Les approches concurrentes incluent des méthodes d'imitation pure comme DexGraspNet ou des politiques RL entraînées sur des saisies à un seul objet. Il s'agit d'un preprint académique sans partenaire industriel annoncé ni calendrier de déploiement. La page projet (modex2026.github.io) et le code sont disponibles, ce qui facilite la reproductibilité. La suite logique serait d'étendre l'évaluation à un plus grand nombre d'objets simultanés et à des géométries plus complexes, et de tester sur des plates-formes alternatives comme la Shadow Hand de Shadow Robot Company.

UELa plateforme Franka Emika Panda, d'origine allemande, est utilisée comme banc de test de référence, ce qui donne aux laboratoires européens un accès direct pour reproduire ces résultats, mais le travail reste académique sans partenariat industriel ou déploiement EU annoncé.

RecherchePaper
1 source
InterMASH : une représentation géométrique unifiée pour la synthèse de préhension
2arXiv cs.RO 

InterMASH : une représentation géométrique unifiée pour la synthèse de préhension

La synthèse de préhension (grasp synthesis), qui vise à générer des interactions main-objet stables et physiquement plausibles, reste freinée par l'absence de représentation commune entre mains humaines et mains robotiques, en raison de leurs différences de morphologie et de modélisation de surface. Un nouveau papier de recherche, publié sur arXiv sous la référence 2609.18504, propose InterMASH, une représentation géométrique unifiée fondée sur des ancres fixées à la surface de sphères qui établissent une correspondance entre différentes morphologies de main. À chaque ancre, des harmoniques sphériques de faible degré encodent de façon compacte la géométrie locale de la main, celle de l'objet et le contact entre les deux, formant une séquence de tokens explicite et interprétable. Sur cette base, les auteurs entraînent un Diffusion Transformer conditionnel qui opère directement dans cet espace pour générer conjointement la géométrie de la main et les points de contact. Le système atteint des performances comparables à l'état de l'art sur les métriques de faisabilité physique d'un benchmark à grande échelle basé sur la main robotique ShadowHand, permet un entraînement conjoint sur plusieurs types de mains, et montre qu'un fine-tuning cross-embodiment avec des données de préhension humaine améliore le taux de succès et la diversité des préhensions générées pour des mains robotiques. L'intérêt pour l'industrie tient au format de représentation lui-même: les approches précédentes reposaient soit sur des cartes de contact, soit sur des descripteurs implicites denses, jugés incomplets ou coûteux en calcul et redondants. En rendant la représentation nativement tokenisée et compatible avec les architectures de diffusion transformer désormais standard en robotique générative, InterMASH facilite l'entraînement de modèles de manipulation sur des données hétérogènes, humaines et robotiques combinées. Pour les chercheurs en manipulation dextre et les concepteurs de politiques type VLA, le résultat le plus concret est la preuve que des données de préhension humaine, généralement plus abondantes et moins coûteuses à collecter que des données robotiques réelles, peuvent effectivement transférer vers de meilleures performances robotiques, une piste régulièrement évoquée pour réduire la dépendance à la téléopération ou à la simulation coûteuse. Il s'agit d'une publication de recherche fraîchement mise en ligne, sans annonce de produit, de partenaire industriel ni de calendrier de déploiement: l'abstract ne mentionne aucune date de disponibilité de code au-delà de la page projet dédiée, inter-mash.github.io. Le travail s'inscrit dans la lignée des efforts combinant modélisation de la main humaine et manipulation robotique dextre, avec pour référence de comparaison le benchmark ShadowHand, largement utilisé dans la recherche académique sur la préhension. Aucun acteur français ou européen n'apparaît dans cette publication.

RecherchePaper
1 source
AnyviewMeter : adapter les modèles de récompense robotiques via la géométrie caméra et l'attention multi-vue
3arXiv cs.RO 

AnyviewMeter : adapter les modèles de récompense robotiques via la géométrie caméra et l'attention multi-vue

Des chercheurs présentent AnyviewMeter, un framework d'adaptation pour les modèles de récompense robotiques utilisés pour évaluer visuellement la progression d'une tâche. Le problème identifié : ces modèles, une fois entraînés, voient leurs prédictions varier selon le point de vue de la caméra ou les occlusions, même quand l'état réel de la tâche n'a pas changé. AnyviewMeter combine un fine-tuning à faible rang avec des rayons de Plücker alignés sur les tokens, qui encodent la géométrie de la caméra directement dans les caractéristiques visuelles et dans les mécanismes d'attention, ainsi qu'une attention par blocs synchronisée qui fusionne plusieurs vues à l'intérieur du décodeur préentraîné. Le système s'appuie sur le modèle Robometer et fonctionne en configuration mono-vue comme en évaluation conjointe multi-vues. Sur la tâche simulée PickCube, l'adaptation mono-vue améliore la prédiction de progression pour chaque groupe de caméras et réduit l'erreur absolue moyenne d'environ 21% par rapport à un simple fine-tuning RGB lorsque le champ de vision change. Sur un ensemble plus large de tâches de manipulation simulées, la prédiction conjointe multi-vues réduit l'erreur de progression de 41 à 69% par rapport à une moyenne de prédictions mono-vues RGB, et améliore l'ordonnancement temporel dans environ 88% des combinaisons tâche-caméra. Sur des tâches réelles utilisant des caméras fixes et montées sur poignet, l'erreur absolue moyenne baisse d'environ 21%. Ces résultats visent un angle mort concret de la robotique par apprentissage : les modèles de récompense entraînés en simulation ou sur un jeu de caméras donné généralisent mal dès que la configuration physique change, un frein direct au déploiement chez des intégrateurs qui n'utilisent jamais exactement le même rig caméra que le laboratoire d'origine. En conditionnant explicitement le modèle sur la géométrie de la caméra plutôt qu'en espérant une généralisation implicite, AnyviewMeter propose une voie d'adaptation paramétrique légère, sans réentraînement complet, ce qui compte pour des équipes cherchant à réutiliser des modèles de récompense préentraînés sur des cellules robotiques hétérogènes. Cela nuance aussi l'idée que les VLA et modèles de supervision associés soient déjà robustes au changement de viewpoint dès la sortie du laboratoire. Le travail s'inscrit dans la lignée des modèles de récompense visuels type Robometer, dont il constitue une extension géométrique plutôt qu'une refonte, et se positionne dans le champ plus large des méthodes de supervision pour l'apprentissage par renforcement en robotique, aux côtés des approches VLA génériques (Pi-0, GR00T N2). Les auteurs ne mentionnent pas de déploiement industriel ni de partenaire commercial: il s'agit d'un résultat de recherche évalué en simulation et sur un nombre limité de tâches réelles, sans indication de calendrier vers une intégration produit.

RecherchePaper
1 source
Diffusion de politique multimodale asynchrone via fusion de guidage sensible à la latence
4arXiv cs.RO 

Diffusion de politique multimodale asynchrone via fusion de guidage sensible à la latence

Des chercheurs ont publié le 24 juillet un article arXiv (2607.17257v1) présentant LAG-Fusion, un framework de fusion multimodale pour les politiques de diffusion utilisées en apprentissage par imitation robotique. Le problème visé : les architectures multimodales actuelles combinent vision, force et autres capteurs via une fusion synchrone ou des architectures multi-fréquences conçues manuellement, ce qui ralentit le retour haute fréquence ou limite l'ajout de nouvelles modalités. LAG-Fusion permet à chaque politique spécifique à une modalité de tourner à sa propre cadence d'inférence et d'injecter sa guidance de débruitage dès qu'elle est disponible, sans attendre les autres flux. L'innovation technique centrale est une règle de recalage du référentiel pour les variables de diffusion exprimées en représentations d'action relatives, ce qui permet d'aligner une guidance arrivée en retard avant de la fusionner avec le reste. Les chercheurs ont testé l'approche sur une tâche de manipulation à contact riche, en combinant une politique vision basse fréquence avec une politique force haute fréquence. Sous des latences hétérogènes entre modalités, LAG-Fusion améliore la réactivité de la politique et la performance de la tâche par rapport à une fusion synchrone classique et à des bases de référence spécifiquement conçues pour intégrer la force. Pour l'industrie robotique, ce travail touche un point de friction bien réel dans le déploiement de politiques génératives type diffusion ou VLA sur des bras manipulateurs : dès qu'on ajoute un capteur de force ou tactile pour des tâches d'assemblage ou d'insertion, la cadence de la caméra (souvent 10 à 30 Hz) et celle du capteur de force (potentiellement 100 Hz et plus) imposent des compromis douloureux, soit en bridant le capteur rapide au rythme du plus lent, soit en construisant une architecture ad hoc peu réutilisable. Une méthode générique qui laisse chaque modalité tourner à sa vitesse native, sans repenser l'architecture à chaque nouvelle combinaison de capteurs, s'attaque directement à un frein à l'extensibilité que rencontrent les intégrateurs travaillant sur la manipulation fine (assemblage électronique, insertion de connecteurs, tri fragile). Cela reste toutefois un résultat validé sur une seule paire de modalités et une tâche contrôlée en laboratoire, loin d'une brique prête à industrialiser. Les politiques de diffusion se sont imposées ces deux dernières années comme l'une des approches dominantes de l'apprentissage par imitation en robotique, aux côtés de modèles vision-langage-action comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure AI, qui fusionnent eux aussi plusieurs signaux capteurs mais généralement à une cadence unique et synchronisée. La fusion asynchrone multi-fréquence reste peu explorée dans la littérature, la plupart des travaux traitant chaque capteur additionnel comme un module séparé nécessitant un réglage manuel. Le résumé ne précise ni publication de code ou de poids, ni application industrielle prévue à court terme ; l'article, encore non révisé par les pairs, ouvre surtout une piste pour de futurs travaux combinant tactile, force et vision sur des tâches à contact riche, un axe stratégique pour les humanoïdes et bras collaboratifs visant l'assemblage fin.

RecherchePaper
1 source