Aller au contenu principal
RecherchearXiv cs.RO 

Au-delà de la scène actuelle : préhension référencée par événements avec sélection active de la vue

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent BeyondSCe, un système de préhension robotique « zero-shot » conçu pour un cas inédit : exécuter une demande qui désigne un objet, ou une partie d'objet, par le rôle qu'il a joué dans un événement passé plutôt que par son nom ou son apparence. Le robot observe d'abord des personnes manipuler des objets, puis reçoit plus tard une consigne qui renvoie à cet historique. Il doit alors identifier la cible à partir de l'historique des événements et de la scène courante, puis la localiser pour la saisir. Si la cible est masquée, le système combine un a priori d'événement, reconstitué à partir de l'historique, avec la géométrie de la scène actuelle afin de choisir des points de vue de caméra susceptibles de la révéler. L'ensemble repose uniquement sur des modèles pré-entraînés, sans entraînement spécifique à la tâche. Les tests sur robot réel utilisent une seule caméra RGB-D montée au poignet. Le taux de réussite atteint 76 % pour les cibles initialement visibles et 77 % pour les cibles occultées, contre 40 % et 55 % pour la meilleure référence de chaque condition. Sur quatre scènes supplémentaires fortement encombrées, il passe de 75 % à 95 % de réussite et réduit le nombre moyen de vues de 3,35 à 2,20.

Le résultat touche à une limite concrète des robots de service et d'assistance : la plupart des systèmes de saisie pilotés par le langage supposent que l'objet est visible et nommable. Une consigne du type « rapporte la tasse que Paul a utilisée tout à l'heure » suppose au contraire une mémoire des interactions et la capacité d'aller chercher l'objet hors du champ de vue. Le gain sur les cibles occultées est le point le plus parlant : l'a priori d'événement améliore à la fois la réussite et l'efficacité de la perception active, y compris face à une référence qui disposait de la boîte englobante 3D réelle de la cible. Pour un intégrateur, l'intérêt est qu'une chaîne de modèles de fondation, sans réentraînement, suffit à franchir ce palier avec un capteur bon marché. Il faut toutefois relativiser : il s'agit d'un résultat académique en laboratoire, publié sur arXiv (pré-publication non évaluée par des pairs). Le nombre d'essais et la diversité des scènes ne sont pas précisés, et 76 % de réussite reste loin des seuils exigés en production.

Ce travail s'inscrit dans la montée des systèmes de manipulation zero-shot qui assemblent des modèles de vision-langage, de segmentation et de planification de grasp, et dans l'essor de la perception active, où le robot déplace sa caméra pour réduire l'incertitude. Les approches de type VLA (vision-langage-action) se concentrent surtout sur la scène présente, sans mémoire explicite d'événements passés. L'article ne cite ni déploiement industriel ni calendrier de transfert. Les suites logiques seraient des historiques plus longs et bruités, des environnements dynamiques et une validation sur d'autres robots que le dispositif de test.

Impact France/UE

Pas d\'impact direct sur la France/UE

À lire aussi

Au-delà de la saisie visuelle : évaluer la préhension complexe, de la détection à l'exécution
1arXiv cs.RO 

Au-delà de la saisie visuelle : évaluer la préhension complexe, de la détection à l'exécution

Une équipe de chercheurs publie sur arXiv (référence 2607.14341) GCA-Bench, un nouveau benchmark destiné à évaluer les systèmes de préhension robotique sur des tâches complexes, au-delà de la simple détection visuelle de pose de saisie. Contrairement aux benchmarks existants, centrés sur la détection isolée d'un point de préhension à partir d'une image, GCA-Bench introduit des scénarios de "grasping with complex action" qui exigent un raisonnement au niveau de la scène et la prise en compte de contraintes sémantiques, c'est à dire comprendre non seulement où saisir un objet mais pourquoi et comment, selon le contexte. Les auteurs ont testé une gamme de méthodes de référence, des pipelines classiques de détection de préhension jusqu'aux approches d'apprentissage de bout en bout intégrant de grands modèles de fondation. Résultat marquant: les taux de réussite chutent sous les 70% dès que les scénarios de préhension deviennent complexes. Ce chiffre est significatif pour l'industrie robotique car il vient contredire le récit dominant selon lequel les modèles de fondation à grande échelle (type VLA) auraient déjà résolu la préhension robotique en conditions réelles. La plupart des démonstrations commerciales actuelles portent sur des objets isolés dans des environnements contrôlés; GCA-Bench montre que dès qu'un raisonnement multi-étapes ou une contrainte sémantique s'ajoute (choisir le bon objet selon une instruction, adapter la prise selon l'usage prévu), la fiabilité des systèmes s'effondre. C'est un signal utile pour les intégrateurs et décideurs B2B qui évaluent la maturité réelle de ces technologies avant déploiement industriel ou logistique. Le papier s'inscrit dans une lignée de benchmarks robotiques (type GraspNet ou YCB) qui se limitaient jusqu'ici à l'évaluation visuelle pure de la pose de préhension. En proposant de nouvelles métriques d'évaluation et une analyse des modes d'échec critiques, les auteurs cherchent à orienter la recherche vers des stratégies de préhension plus robustes et généralisables. Il s'agit pour l'instant d'une prépublication arXiv non revue par les pairs, sans indication de déploiement industriel ni de partenaire commercial associé.

RecherchePaper
1 source
E-VLA : modèle vision-langage-action augmenté par événements pour scènes sombres et floues
2arXiv cs.RO 

E-VLA : modèle vision-langage-action augmenté par événements pour scènes sombres et floues

Des chercheurs présentent E-VLA, un modèle vision-langage-action (VLA) augmenté par caméra événementielle, conçu pour maintenir la fiabilité des robots manipulateurs dans des conditions de perception dégradées : lumière très faible, flou de mouvement, écrêtage des noirs. Contrairement aux approches classiques qui tentent de reconstruire une image à partir des flux d'événements, E-VLA exploite directement les indices de mouvement et de structure captés par la caméra événementielle pour préserver la cohérence perception-action. L'équipe a construit une plateforme de téléopération open source équipée d'une caméra événementielle DAVIS346 et collecté un jeu de données synchronisé RGB-événements-actions sur des tâches de manipulation variées et sous différents niveaux d'éclairage. Les résultats sont marqués : sur une tâche de type pick-and-place à 20 lux, le taux de réussite passe de 0% avec la seule image RGB à 60% avec une simple superposition des cartes d'événements accumulées, puis à 90% avec l'adaptateur événementiel dédié conçu par les auteurs. Sous flou de mouvement sévère (simulation d'un temps d'exposition de 1000 ms), le pick-and-place progresse de 0% à 20-25% de réussite, et une tâche de tri passe de 5% à 32,5%. Ces résultats apportent une preuve concrète que la fusion événementielle, même dans sa version la plus simple et sans paramètres, comble un angle mort critique des modèles VLA actuels : leur dépendance à une caméra RGB classique les rend inutilisables dès que l'éclairage ou la stabilité de la scène se dégradent, un scénario fréquent en environnement industriel réel (entrepôts peu éclairés, bras robotiques en mouvement rapide). Pour les intégrateurs et les équipes robotique visant un déploiement en conditions réelles plutôt qu'en démonstration contrôlée, ce travail suggère qu'ajouter un capteur événementiel low-cost peut être plus efficace qu'un réentraînement massif du modèle de perception. E-VLA s'inscrit dans la lignée des modèles VLA généralistes comme GR00T N2, Pi-0 ou Helix, qui ont démontré une bonne généralisation en manipulation mais restent peu testés hors des conditions de laboratoire. Les auteurs annoncent la publication du code et du jeu de données sur GitHub, ce qui devrait permettre à la communauté d'évaluer la robustesse de la méthode sur d'autres plateformes robotiques et d'autres capteurs événementiels.

RecherchePaper
1 source
FlipToSee : un a priori probabiliste de placement stable pour l'exploration visuelle active par re-préhension
3arXiv cs.RO 

FlipToSee : un a priori probabiliste de placement stable pour l'exploration visuelle active par re-préhension

Publié le 18 septembre 2026 sur arXiv (référence 2609.20078), un article décrit FlipToSee, un système probabiliste qui apprend, à partir d'un simple nuage de points en vue unique, à réorienter un objet posé sur une table afin d'exposer ses faces cachées, sans recherche physique exhaustive. Plutôt qu'une régression classique en 6 degrés de liberté, source d'ambiguïté, la méthode représente les placements stables comme des vecteurs normaux sur la sphère S^2 via un réseau de mélange von Mises-Fisher, puis reclasse un ensemble compact de candidats selon leur robustesse physique grâce à une tête auxiliaire dédiée. En simulation, le taux de succès de la première proposition atteint 98,4% sur des objets proches de l'entraînement, 95,3% sur des formes hors distribution et 90,0% en transfert zéro-shot vers les objets ménagers du jeu YCB. La méthode a aussi été validée sur un robot physique, intégrée à des modules de planification de prise et de mouvement pour du regrasping exploratoire. Ce travail répond à un problème concret de perception active en manipulation : décider, sans multiplier les essais physiques coûteux, comment réorienter un objet inconnu pour en inspecter les faces cachées. En traitant le placement stable comme une distribution sur une sphère plutôt qu'une pose complète en 6-DoF, les auteurs évitent une ambiguïté représentationnelle qui pénalise les régressions directes classiques. Le transfert zéro-shot vers YCB, benchmark de référence en manipulation robotique, est le résultat le plus parlant pour des intégrateurs, car il suggère une généralisation au-delà des objets d'entraînement ; l'écart entre le succès simulé et la validation réelle, décrite sans métrique chiffrée dans l'abstract, appelle cependant à la prudence. FlipToSee s'inscrit dans la recherche sur le regrasping exploratoire et la planification de prise sous incertitude visuelle, où le jeu d'objets YCB sert de référence commune pour comparer les méthodes. L'abstract ne précise ni le laboratoire à l'origine des travaux ni la plateforme robotique utilisée pour la démonstration, ce qui limite le positionnement concurrentiel. Aucun partenariat industriel, date de publication de code ou pilote de déploiement n'est annoncé : il s'agit à ce stade d'un résultat académique validé en simulation et par une démonstration ponctuelle sur banc, non d'un produit déployé en environnement industriel.

RecherchePaper
1 source
CoRef-GS : Splatting gaussien de référence coopératif pour la compréhension multi-agents de scènes
4arXiv cs.RO 

CoRef-GS : Splatting gaussien de référence coopératif pour la compréhension multi-agents de scènes

CoRef-GS, un framework de cartographie Gaussienne coopérative pour robots, a été décrit dans un article publié sur arXiv en septembre 2026 (référence 2609.20586). Le système répond à un cas concret : plusieurs robots construisent chacun une carte Gaussienne sémantique locale de leur environnement, et une fois ces cartes fusionnées, il faut pouvoir localiser un objet désigné en langage naturel même s'il n'a été observé que par un autre agent, tout en gardant les relations spatiales interprétées depuis le point de vue du robot qui pose la question. CoRef-GS construit d'abord des cartes Gaussiennes locales à vocabulaire ouvert et conscientes des instances, les aligne via un module d'alignement inter-agents combinant cohérence géométrique et sémantique, puis effectue le grounding grâce à un graphe de relations conditionné par la vue. Les auteurs introduisent aussi CoQuad-Ref, un benchmark reposant sur deux robots quadrupèdes et couvrant des scènes d'intérieur réelles et simulées : en simulation, l'erreur de rotation passe de 2,58 degrés après initialisation grossière à 0,15 degré après raffinement, et en conditions réelles le mIoU de référencement grimpe de 52,6% avec la méthode existante ReferSplat à 68,8% avec CoRef-GS. Code et benchmark doivent être publiés sur GitHub. Ce travail cible un verrou peu traité mais central pour les flottes de robots mobiles : faire coopérer plusieurs agents sur une carte sémantique commune sans perdre la capacité à traiter des instructions en langage naturel relatives et ambiguës. Les méthodes existantes de cartographie Gaussienne consciente du langage se limitent à l'interrogation d'une carte unique, tandis que les techniques de recalage Gaussien optimisent l'alignement géométrique ou photométrique sans préserver la compatibilité sémantique nécessaire au grounding, ce que CoRef-GS cherche justement à combiner. Les gains rapportés, une erreur de pose divisée par plus de quinze en simulation et un mIoU en hausse de seize points sur données réelles, restent issus d'un seul benchmark défini par les auteurs et demandent confirmation sur d'autres plateformes avant généralisation. Pour les intégrateurs qui déploient des flottes de robots mobiles ou quadrupèdes en entrepôt ou en bâtiment, l'enjeu démontré est réel : plusieurs unités doivent partager une compréhension cohérente de l'espace pour exécuter des instructions humaines sans recartographier chaque zone individuellement. CoRef-GS s'inscrit dans la lignée des cartes Gaussiennes sémantiques, ces représentations 3D Gaussian Splatting enrichies de features de langage développées pour le grounding dans des scènes reconstruites par un seul agent, limite que les auteurs identifient explicitement chez des approches comme ReferSplat, utilisée ici comme référence de comparaison. L'apport revendiqué est de déplacer ce paradigme vers un cadre multi-agent, testé sur des robots quadrupèdes plutôt que sur des humanoïdes ou des AMR à roues. Les auteurs annoncent la publication prochaine, en open source, du code et du benchmark CoQuad-Ref sur GitHub, ce qui permettra à la communauté de reproduire les résultats et de comparer d'autres méthodes de fusion de cartes sur le même protocole. Aucun calendrier de déploiement industriel n'est mentionné : le travail reste à ce stade une contribution de recherche académique, sans lien annoncé avec un acteur commercial.

RecherchePaper
1 source