Aller au contenu principal
RoboSeg : reconstruction sémantique en ligne au niveau des pièces pour la manipulation robotique via une seule caméra montée sur pince
RecherchearXiv cs.RO 

RoboSeg : reconstruction sémantique en ligne au niveau des pièces pour la manipulation robotique via une seule caméra montée sur pince

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

RoboSeg est un système de perception robotique présenté dans un article déposé sur arXiv (arXiv:2608.09778v1) qui vise à reconnaître non pas des objets entiers mais leurs parties actionnables : poignées, bords, gâchettes, embouts d'outils. Le système interroge un modèle vision-langage (VLM) sur une première image RGB pour identifier des invites de parties fonctionnelles, puis combine deux flux asynchrones : un thread géométrique haute fréquence pour l'odométrie RGB-D et la fusion TSDF, et un thread sémantique déclenché par images clés utilisant SAM3 pour segmenter les parties. Les masques projetés sont fusionnés par vote temporel au niveau voxel pour construire une carte de points étiquetée, persistante, sans nécessiter de modèle CAD ni de maillage pré-scanné. Cette carte sert ensuite à assigner les candidats de prise à 6 degrés de liberté générés par AnyGrasp à la partie sémantique pertinente pour la tâche demandée. Les résultats rapportés atteignent 83,4% de mIoU (intersection sur union moyenne) sur des objets annotés manuellement, et lors d'un pilote physique de 24 essais couvrant quatre objets et huit tâches, la prise sélectionnée a touché la partie demandée dans tous les essais, pour 21 réussites sur 24 au total.

L'intérêt de ce travail pour les intégrateurs et chercheurs en robotique tient au fait qu'il traite un angle mort classique des pipelines de manipulation : la plupart des systèmes de préhension raisonnent au niveau de l'objet entier, sans distinguer la partie fonctionnellement pertinente pour une tâche donnée. En s'appuyant uniquement sur une caméra montée sur l'effecteur (eye-in-hand) et sur des modèles de fondation existants plutôt que sur des CAO préalables, RoboSeg propose une couche d'indexation sémantique généralisable à des environnements non structurés. Le papier reste toutefois prudent sur la portée de la validation : le pilote physique ne couvre que quatre objets et 24 essais, un échantillon restreint qui limite la généralisation des taux de réussite annoncés.

Ce travail s'inscrit dans la tendance actuelle combinant modèles vision-langage et générateurs de prises pré-entraînés plutôt que de réentraîner des systèmes de bout en bout. Les auteurs positionnent explicitement RoboSeg comme une couche complémentaire à AnyGrasp, conservé comme générateur de propositions de préhension, et non comme un remplacement. Il s'agit d'un article de recherche académique récemment publié, sans mention d'un déploiement industriel ni d'un partenaire commercial ; les prochaines étapes concernant une éventuelle extension à davantage d'objets, de tâches ou de plateformes robotiques ne sont pas précisées dans le résumé.

À lire aussi

Relier sémantique et physique : des LLM contraints pour une manipulation robotique sûre et fiable
1arXiv cs.RO 

Relier sémantique et physique : des LLM contraints pour une manipulation robotique sûre et fiable

Des chercheurs présentent un système qui relie raisonnement en langage naturel et exécution physique sûre pour la manipulation robotique, décrit dans un article publié le 29 août 2026 sur arXiv (2608.29379v1). Le pipeline part d'observations RGB-D pour construire un modèle de scène explicite tenant compte des collisions, puis contraint les décisions d'un grand modèle de langage via des appels d'outils validés par schéma selon le Model Context Protocol (MCP), rejetant les commandes mal formées avant qu'elles n'atteignent le robot. Chaque appel validé est ensuite traduit de façon déterministe dans un pipeline MoveIt Task Constructor, où les mouvements candidats sont vérifiés contre la scène reconstruite avant exécution, une étape de type "vérifier puis agir". Testé sur un bras robotique physique UFactory 850, le système atteint jusqu'à 80% de réussite sur dix essais par tâche pour des opérations de versement impliquant liquides, matières granulaires et solides discrets, et 90% de réussite sur une tâche de saisie-et-dépose avec la même architecture. L'intérêt de ces travaux tient à la démonstration chiffrée d'un problème bien identifié dans la robotique pilotée par LLM: un plan verbalement cohérent peut être physiquement infaisable si la cinématique et les collisions ne sont pas vérifiées avant exécution. Les auteurs montrent qu'une politique scriptée classique surpasse légèrement leur méthode sur la tâche la plus simple, mais chute à seulement 10% de réussite sur la tâche la plus difficile, contre 60% pour leur approche contrainte. Pour les intégrateurs industriels et les équipes robotique, ce résultat suggère qu'ajouter une couche de validation formelle entre le langage et l'action améliore surtout la robustesse sur les cas complexes, plutôt que la performance brute sur les cas faciles où des solutions scriptées suffisent déjà. Ce travail s'inscrit dans la lignée des recherches sur le "language-action gap", l'écart entre la capacité des LLM à décomposer des instructions en séquences d'actions et leur incapacité native à garantir la faisabilité physique de ces actions dans un environnement encombré et perçu de façon imparfaite. La solution proposée combine plusieurs briques existantes, le MCP pour la validation structurée des appels d'outils côté langage, et MoveIt Task Constructor pour la planification de mouvement sous contraintes cinématiques et de collision côté robot, plutôt que d'introduire une nouvelle architecture de bout en bout. Les tests restent limités à un seul bras robotique et un nombre réduit d'essais par tâche, ce qui invite à la prudence avant toute extrapolation vers des déploiements industriels à plus grande échelle.

RecherchePaper
1 source
Reconstruction ou sémantique ? Ce qui rend un espace latent utile pour les modèles du monde en robotique
2arXiv cs.RO 

Reconstruction ou sémantique ? Ce qui rend un espace latent utile pour les modèles du monde en robotique

Une étude soumise sur arXiv le 8 mai 2025 (arXiv:2605.06388) remet en question le choix dominant des espaces latents dans les modèles de monde pour la robotique. Les auteurs comparent six encodeurs, répartis en deux familles, selon un protocole d'évaluation commun sur le dataset BridgeV2, référence de manipulation robotique généraliste. Les encodeurs de reconstruction testés sont VAE (standard actuel) et Cosmos (NVIDIA) ; les encodeurs sémantiques incluent V-JEPA 2.1 (Meta), Web-DINO et SigLIP 2 (Google). Le cadre évalué est celui des modèles de diffusion latente conditionnés par l'action (LDM), utilisés comme proxy de simulation pour tester des politiques de contrôle robot sans déploiement physique. L'évaluation repose sur trois axes : fidélité visuelle pixel-level, performance en planification et évaluation de politiques en aval, et qualité intrinsèque des représentations latentes. Les résultats invalident une hypothèse implicite courante dans le domaine : une bonne reconstruction pixel ne suffit pas à produire un bon modèle de monde opérationnel. VAE et Cosmos atteignent les meilleurs scores de fidélité visuelle, mais V-JEPA 2.1 domine sur l'axe le plus critique, la performance des politiques, tandis que Web-DINO et SigLIP 2 excellent sur les deux axes restants, et ce à toutes les échelles de modèles testées. Pour un intégrateur ou un labo qui construit des pipelines sim-to-real, cela implique que le choix de l'encodeur dans la stack LDM n'est pas un détail d'implémentation : il conditionne directement la qualité des politiques apprises. La fidélité visuelle, souvent retenue comme métrique de validation principale, s'avère un indicateur trompeur du potentiel d'un modèle de monde pour le contrôle robotique. Ce travail s'inscrit dans une course de fond autour des modèles de monde pour la robotique, impliquant des acteurs comme Physical Intelligence (pi-0), Figure AI et des équipes académiques autour des RoboVLMs. L'adoption des LDMs comme infrastructure d'évaluation de politiques s'est accélérée depuis 2023 avec l'essor des VLAs (Vision-Language-Action models). Le VAE reste l'encodeur par défaut dans la majorité des implémentations ouvertes, héritage direct des pipelines de diffusion image (Stable Diffusion, LDM de Rombach et al., 2022). Ce preprint, non encore évalué par des pairs, plaide pour un pivot vers les encodeurs à représentations sémantiques, une direction qui converge avec les travaux de Meta sur V-JEPA 2 et de Google sur SigLIP. Les étapes suivantes naturelles incluraient une validation sur des datasets robotiques plus diversifiés et des expériences en déploiement physique réel pour confirmer le transfert sim-to-real.

RechercheOpinion
1 source
Robo3R : amélioration de la manipulation robotique par reconstruction 3D précise en avance de phase
3arXiv cs.RO 

Robo3R : amélioration de la manipulation robotique par reconstruction 3D précise en avance de phase

Robo3R est un modèle de reconstruction 3D présenté dans un preprint arXiv (2502.10101) qui vise à remplacer les capteurs de profondeur classiques dans les pipelines de manipulation robotique. Le système prend en entrée des images RGB et les états du robot, et prédit en temps réel la géométrie de la scène à l'échelle métrique, sans recours à un capteur ToF, LiDAR ou stéréo. Robo3R combine une tête de points masquée (masked point head) pour des nuages de points précis, et une formulation Perspective-n-Point (PnP) basée sur des keypoints pour aligner les poses de caméra dans un référentiel canonique robot. Le modèle a été entraîné sur Robo3R-4M, un dataset synthétique de 4 millions de frames annotées haute fidélité. Les auteurs rapportent des gains constants sur plusieurs tâches aval : imitation learning, transfert sim-to-real, synthèse de saisies (grasp synthesis) et planification de trajectoire sans collision. L'intérêt pratique est direct pour les intégrateurs : les capteurs de profondeur actuels (caméras stéréo, ToF, LiDAR structuré) présentent des limites bien documentées sur les surfaces réfléchissantes, transparentes ou sombres, et leur calibration reste coûteuse. Un module RGB-only à l'échelle métrique et en temps réel réduirait la dépendance au hardware de sensing. Les gains sur le transfert sim-to-real sont particulièrement significatifs : c'est précisément là que les politiques de manipulation, qu'il s'agisse d'ACT, de Diffusion Policy ou des VLA récents, perdent en robustesse lors du déploiement. Que Robo3R améliore cette étape charnière suggère qu'un meilleur module perceptif en entrée peut compenser une partie du reality gap sans toucher à l'architecture de la politique. Ce travail s'inscrit dans une dynamique de recherche active autour de la reconstruction 3D dense depuis le RGB, dominée ces deux dernières années par DUSt3R et MASt3R, développés par Naver Labs Europe à Grenoble, ainsi que par UniDepth et Depth Pro. Robo3R se différencie en ciblant explicitement les contraintes de la manipulation : précision métrique, cohérence du référentiel robot et latence compatible avec le contrôle en boucle fermée. Le dataset synthétique Robo3R-4M, bien que large, soulève la question classique du domaine gap entre simulation et réel, même si les résultats rapportés sur des tâches physiques restent positifs. Il s'agit pour l'instant d'un preprint non encore évalué par les pairs; une soumission à ICRA, CVPR ou RSS, couplée à une validation sur des plateformes robotiques variées au-delà des benchmarks internes, constituerait la prochaine étape naturelle.

UELes modèles DUSt3R et MASt3R développés par Naver Labs Europe à Grenoble constituent la référence comparative directe de Robo3R, signalant que la recherche européenne reste en pointe sur la reconstruction 3D dense appliquée à la manipulation robotique.

RecherchePaper
1 source
FLARE : un cadre conscient des échecs pour la correction et la récupération autonomes en manipulation robotique vision-langage
4arXiv cs.RO 

FLARE : un cadre conscient des échecs pour la correction et la récupération autonomes en manipulation robotique vision-langage

Des chercheurs proposent FLARE (Failure-Aware framework for Autonomous Correction and Recovery), publié sur arXiv sous la référence 2608.26645v1, une méthode destinée aux modèles vision-langage-action (VLA) utilisés pour la manipulation robotique. Le système repose sur deux mécanismes complémentaires baptisés « Retry » et « Reset ». Le mécanisme Retry injecte des perturbations et des segments de transition dans les démonstrations d'entraînement, en dissociant la pose du robot de l'état de l'environnement, afin que la politique apprenne à gérer seule les écarts d'exécution mineurs comme une prise ratée ou un objet qui glisse. Le pipeline Reset s'attaque aux échecs plus graves, dits hors distribution (OOD), qui rompent l'état de la tâche : un grand modèle multimodal (MLLM) analyse hors ligne des vidéos d'exécution pour repérer automatiquement ces états OOD, ce qui permet de constituer une petite bibliothèque ciblée de compétences de récupération centrées sur les objets. En inférence, un moniteur MLLM en ligne arbitre en temps réel entre poursuite de la tâche et déclenchement d'une compétence Reset. Les auteurs annoncent des gains de taux de réussite et de robustesse sur des tâches de manipulation complexes et riches en contacts, sans toutefois détailler dans le résumé les chiffres précis ni la plateforme robotique testée. L'enjeu touche un point faible connu des VLA : entraînés sur des démonstrations « parfaites », sans échec, ils peinent souvent à se rattraper en conditions réelles, un écart classique entre démonstration et déploiement. Pour les intégrateurs et les équipes robotique industrielles, la capacité à détecter et corriger automatiquement une erreur d'exécution, sans intervention humaine ni réinitialisation manuelle du poste de travail, conditionne directement la viabilité de cellules de manipulation autonomes en production. FLARE s'inscrit dans une tendance de recherche qui cherche à combler l'écart entre les démonstrations vidéo souvent présentées par les laboratoires et la réalité d'une ligne de production où objets glissent, collisions surviennent et préhenseurs ratent leur prise. Le travail s'inscrit dans la lignée des modèles VLA génériques récemment mis en avant dans le secteur, comme Pi-0, GR00T N2 ou Helix, qui visent à généraliser la manipulation à partir d'un apprentissage à grande échelle mais partagent la même limite de données d'entraînement sans échec. FLARE reste à ce stade une contribution de recherche publiée sur arXiv, sans annonce de déploiement industriel ni de partenariat commercial associé ; sa validation repose sur des expériences en laboratoire, et son adoption dépendra de tests indépendants et d'une éventuelle intégration dans des piles logicielles de manipulation existantes.

RechercheActu
1 source