Aller au contenu principal
RecherchearXiv cs.RO 

HiWE : modèle hiérarchique de connaissances du monde avec amélioration par points clés visuels pour la planification de trajectoire 3D en zéro-shot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

HiWE, publié sur arXiv (2609.39323v1), est un cadre de génération de démonstrations robotiques qui relie trois décisions habituellement traitées séparément : où l'interaction doit avoir lieu, quel mouvement planifier, et comment exécuter le contact. Le lien est assuré par une interface fondée sur des points. PointVLM, un modèle vision-langage ajusté par instructions, associe les objets pertinents pour la tâche à des coordonnées d'image. Son entraînement mélange annotations de points, échantillons dérivés de segmentation, observations de robots et données de questions-réponses visuelles. Les mesures de profondeur projettent ensuite ces prédictions dans une représentation 3D sémantique. Un planificateur linguistique, 3DLLM, s'appuie sur cette représentation pour produire les waypoints de l'effecteur et les commandes de pince, tandis qu'un module de préhension hybride détermine les poses de saisie locales. L'évaluation porte sur 14 tâches de manipulation simulées et quatre tâches sur robot physique, avec des ablations sur les données visuelles d'entraînement, les entrées spatiales et la sélection de saisie. Aucun chiffre de taux de réussite n'figure dans le résumé.

L'intérêt tient à la décomposition. Plutôt qu'une politique VLA de bout en bout qui régresse directement des actions, HiWE isole la perception, la planification et la saisie en modules inspectables, reliés par des points 3D lisibles. Pour un intégrateur, c'est plus facile à déboguer et à adapter qu'un modèle monolithique. La notion de « zéro-shot » demande toutefois de la prudence : elle signifie ici l'absence d'entraînement par démonstrations propres à chaque tâche, mais le modèle visuel est affiné sur des données robotiques existantes. Le volume restreint de tâches réelles, quatre seulement, laisse entière la question du passage de la simulation au monde physique et de la robustesse en environnement industriel non contrôlé. Il s'agit d'un résultat de recherche, sans produit livré ni déploiement.

Le travail s'inscrit dans la tendance à combiner grands modèles de langage et ancrage visuel pour la manipulation, en concurrence avec les VLA de bout en bout comme Pi-0, GR00T N2 ou Helix de Figure, qui misent sur l'apprentissage direct des actions à grande échelle. Les auteurs précisent que cet article décrit la formulation initiale, fondée sur les points, et que son lien avec l'extension ultérieure GeneralVLA est détaillé dans l'introduction. La suite logique sera de mesurer cette approche modulaire sur davantage de tâches réelles, avec des temps de cycle et des taux de réussite publiés, avant de pouvoir la comparer honnêtement aux VLA entraînés sur de grands volumes de téléopération.

Impact France/UE

Pas d\'impact direct sur la France/UE

Dans nos dossiers

À lire aussi

DAG-STL : un cadre hiérarchique pour la planification de trajectoires zéro-shot sous contraintes de logique temporelle signalée
1arXiv cs.RO 

DAG-STL : un cadre hiérarchique pour la planification de trajectoires zéro-shot sous contraintes de logique temporelle signalée

Des chercheurs ont publié DAG-STL, un cadre hiérarchique de planification de trajectoires pour robots opérant sous contraintes de Signal Temporal Logic (STL), une logique formelle permettant de spécifier des tâches robotiques structurées dans le temps. Le pipeline decompose-allocate-generate fonctionne en trois étapes : il décompose d'abord une formule STL en conditions de progression d'accessibilité et d'invariance, liées par des contraintes de synchronisation partagées ; il alloue ensuite des waypoints temporels via des estimations d'accessibilité apprises ; enfin, il synthétise les trajectoires entre ces waypoints à l'aide d'un générateur basé sur la diffusion. Les expériences ont été conduites sur trois benchmarks standards : Maze2D, OGBench AntMaze, et le domaine Cube, avec un environnement personnalisé incluant une référence par optimisation. DAG-STL surpasse significativement l'approche concurrente de diffusion guidée par robustesse directe sur des tâches STL à long horizon, et récupère la majorité des tâches solubles par optimisation classique tout en conservant un avantage computationnel notable. L'apport principal de ce travail est de résoudre la planification STL en contexte zero-shot, c'est-à-dire sans avoir jamais vu la tâche cible lors de l'entraînement, et sans modèle analytique de la dynamique du système. Pour les intégrateurs et décideurs en robotique, cela signifie qu'un robot équipé de DAG-STL pourrait recevoir une spécification temporelle formelle inédite et en dériver un plan exécutable uniquement depuis des données de trajectoires génériques préenregistrées. La séparation explicite entre raisonnement logique et réalisation physique de la trajectoire est une décision architecturale structurante : elle réduit les problèmes de planification globale long-horizon à une série de sous-problèmes plus courts et mieux couverts par les données. Le cadre introduit également une métrique de cohérence dynamique sans rollout et un mécanisme de replanification hiérarchique en ligne, deux mécanismes qui adressent directement le gap simulation-réel, sujet central des débats sur le sim-to-real dans les VLA (Vision-Language-Action models). DAG-STL s'inscrit dans un courant de recherche actif qui cherche à doter les robots d'une capacité de généralisation formellement vérifiable, à la croisée de la planification sous contraintes logiques temporelles et des modèles génératifs de trajectoires. La STL est un langage étudié depuis les années 2000 en vérification formelle, mais son application à la planification robotique offline reste difficile faute de modèles dynamiques disponibles dans des environnements réels. Les approches concurrentes incluent les méthodes d'imitation learning task-spécifiques et les planificateurs à base de modèle explicite, que DAG-STL vise à dépasser sur le critère de généralisation. Le preprint est disponible sur arXiv (2604.18343) et les prochaines étapes naturelles seraient une validation sur des plateformes physiques, notamment en manipulation et navigation réelle, pour confirmer les gains observés en simulation.

RecherchePaper
1 source
Modèle du monde visuo-tactile FeelWorld pour la prédiction et la planification hiérarchiques du contact
2arXiv cs.RO 

Modèle du monde visuo-tactile FeelWorld pour la prédiction et la planification hiérarchiques du contact

FeelWorld est un nouveau modèle du monde visuo-tactile hiérarchique présenté dans un article arXiv (2607.24267v1) qui prédit conjointement les futurs visuels latents et trois états tactiles : l'état de contact, un latent tactile 3D encodant les informations de force, et l'état de glissement. Ces trois signaux sont produits par un modèle de dynamique latente partagé, entraîné avec une supervision explicite et un mécanisme d'attention asymétrique à porte de contact, qui maintient un chemin de prédiction purement visuel avant tout contact puis active la prédiction conjointe visuo-tactile une fois le contact établi. L'entraînement s'appuie sur des rollouts autorégressifs et une injection de bruit contextuel pour limiter l'accumulation d'erreurs. Sur trois tâches de manipulation, saisie de puces électroniques, saisie de fruits et insertion de connecteurs USB, FeelWorld réduit le LPIPS à 10 pas de 0,084 à 0,058 et reste 61% inférieur au LPIPS d'un modèle purement visuel après un rollout autorégressif de 80 pas. Couplé à un planificateur CEM sensible au contact, il atteint un taux de réussite moyen de 81,7% en planification zero-shot. L'apport principal tient au constat que les modèles du monde utilisés en robotique se limitent en général à la dynamique visuelle, ce qui peut générer des futurs imaginés plausibles à l'œil mais physiquement incohérents dès qu'il y a contact réel avec l'objet. Pour des tâches d'assemblage précis, de préhension d'objets fragiles ou d'insertion, cette lacune pèse directement sur la fiabilité du planning robotique. En intégrant le retour tactile directement dans la boucle de prédiction plutôt qu'en aval, FeelWorld cible un des points faibles connus des architectures VLA et des pipelines de planification par imagination, où l'écart entre démonstration visuelle et physique réelle reste un obstacle à la mise à l'échelle. Le travail s'inscrit dans la lignée des modèles du monde issus du RL basé sur modèle et des architectures récentes de prédiction visuelle, jusqu'ici quasi exclusivement centrées sur l'image. La détection tactile constituait jusque-là un axe de recherche largement séparé. Il s'agit ici d'une contribution académique, sans déploiement industriel annoncé ni acteur commercial identifié ; les suites naturelles concernent des tests sur du matériel physique équipé de capteurs tactiles et une intégration dans des piles de planification robotique plus larges.

RecherchePaper
1 source
3D HAMSTER : relier planification et contrôle dans les modèles VLA hiérarchiques grâce au guidage par trajectoire 3D
3arXiv cs.RO 

3D HAMSTER : relier planification et contrôle dans les modèles VLA hiérarchiques grâce au guidage par trajectoire 3D

Papier académique en robotique (VLA hiérarchique), pas de named companies commerciales ni d'acteur FR/EU à mettre en avant ici. Je rédige directement l'article. Des chercheurs du laboratoire DAVIAN Robotics présentent 3D HAMSTER, un nouveau framework pour les modèles Vision-Langage-Action (VLA) hiérarchiques utilisés en manipulation robotique, détaillé dans un preprint arXiv (2606.31329v1). Ces architectures séparent la planification de haut niveau, confiée à un modèle vision-langage (VLM), du contrôle bas niveau exécuté par une politique dédiée. Les approches récentes font produire au VLM des trajectoires 2D de l'effecteur terminal pour guider cette politique, mais les politiques de pointe travaillent en réalité dans un espace métrique 3D à partir de nuages de points. Faute de profondeur, chaque point de la trajectoire 2D doit hériter de la profondeur de la surface visible sous lui dans la scène, ce qui déforme géométriquement le chemin prédit. 3D HAMSTER corrige ce défaut en dotant le VLM d'un encodeur de profondeur dédié et d'un objectif de reconstruction dense de la profondeur, afin qu'il prédise directement des séquences de points de passage en 3D, ensuite injectées dans une politique bas niveau opérant sur nuages de points. Cette correction cible un goulot d'étranglement précis de la génération actuelle de VLA hiérarchiques: la conversion 2D vers 3D introduisait un bruit géométrique qui limitait la fiabilité des gestes de manipulation, en particulier lors de changements d'apparence de la scène ou de conditions inédites (langage, position spatiale, visuel). Sur les trois bancs d'essai testés (prédiction de trajectoire 3D, simulation, manipulation réelle), 3D HAMSTER dépasse à la fois des VLM propriétaires état de l'art et les méthodes concurrentes guidées en 2D, avec les écarts les plus marqués justement sur ces conditions de généralisation difficile. Ce résultat va dans le sens d'une hypothèse clé du secteur: une bonne partie de l'écart entre démonstrations en laboratoire et déploiement réel des robots manipulateurs tient moins à la politique de contrôle elle-même qu'à la qualité du signal de planification qui la guide. Le travail s'inscrit dans la lignée des architectures VLA hiérarchiques qui ont émergé ces deux dernières années pour améliorer la généralisation des robots manipulateurs, en s'appuyant sur des politiques bas niveau désormais matures en perception 3D par nuages de points. En comparant directement sa méthode à des VLM propriétaires non nommés publiquement dans le résumé, l'équipe positionne 3D HAMSTER comme une alternative open, avec une page projet dédiée (davian-robotics.github.io/3D_HAMSTER) où code et données devraient être publiés pour permettre une reproduction indépendante des résultats.

RechercheActu
1 source
Algorithme de planification hiérarchique de trajectoire de couverture pour environnements inconnus
4arXiv cs.RO 

Algorithme de planification hiérarchique de trajectoire de couverture pour environnements inconnus

Des chercheurs présentent dans un preprint publié sur arXiv (arXiv:2609.12595v1) un algorithme de planification de trajectoire de couverture en ligne, conçu pour des robots évoluant dans des environnements totalement inconnus au départ. Le principe repose sur une décomposition progressive : à mesure que le robot avance et découvre des obstacles, la zone à couvrir est découpée en sous-zones disjointes, organisées dans un arbre de décomposition construit de façon incrémentale qui conserve les relations hiérarchiques parent-enfant entre ces sous-zones. Un planificateur global maintient et met à jour en continu un itinéraire de couverture, en priorisant les nouvelles sous-zones enfants selon leur état d'exploration et leur distance au robot, tandis qu'un planificateur local génère les mouvements de couverture à l'intérieur de chaque sous-zone sélectionnée, ce qui permet à la trajectoire de s'adapter au fur et à mesure que l'environnement se révèle. La méthode a été évaluée uniquement en simulation haute-fidélité, sur des scénarios complexes, et comparée à trois algorithmes de référence existants. Les auteurs rapportent une meilleure efficacité de couverture, mesurée par la longueur du trajet parcouru et le taux de recouvrement (overlap ratio) des zones déjà balayées. Pour l'industrie robotique, ce type d'algorithme cible un problème très concret : les robots de nettoyage industriel, de tonte, d'inspection ou agricoles doivent balayer l'intégralité d'une surface plutôt que simplement relier un point A à un point B, et la carte des lieux n'est souvent pas connue à l'avance ou évolue (mobilier déplacé, obstacles temporaires, chantiers). Les approches classiques de coverage path planning supposent généralement une carte déjà connue et calculent un plan hors ligne ; ce travail s'inscrit dans la lignée plus exigeante des méthodes en ligne, qui composent avec une incertitude croissante sur la géométrie de l'espace. Réduire le recouvrement et la longueur de trajet a un impact direct sur l'autonomie énergétique et le temps de cycle des AMR déployés en usine, en entrepôt ou en extérieur. Ceci dit, il s'agit à ce stade d'un résultat purement académique, validé en simulation face à des baselines choisies par les auteurs, et non d'un système testé sur robot physique ni déployé en conditions réelles : l'écart classique entre démonstration simulée et robustesse terrain reste entier. Le papier ne mentionne aucune affiliation industrielle, aucun partenaire de déploiement ni aucun robot commercial précis, ce qui en fait une contribution méthodologique plutôt qu'une annonce produit. Le champ de la planification de couverture en environnement inconnu reste actif depuis plusieurs années, avec des approches concurrentes basées sur la décomposition cellulaire, les grilles d'occupation ou des heuristiques gloutonnes, que les auteurs utilisent justement comme points de comparaison. Publié comme preprint de type "new" sur arXiv, donc non encore revu par les pairs, ce travail ouvre la voie à des tests sur robot physique et dans des environnements réels plus variés, étape nécessaire avant toute adoption par des intégrateurs ou fournisseurs de robots mobiles autonomes.

RecherchePaper
1 source