Aller au contenu principal
RecherchearXiv cs.RO 

GeminiPainter : pipeline séquentiel en quatre étapes, perception, cognition, planification et action

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

GeminiPainter est un système robotique autonome capable de dessiner un portrait en direct, présenté dans un article publié sur arXiv début août 2026 (identifiant 2608.00829). Le pipeline suit quatre étapes classiques en robotique cognitive : perception, cognition, planification et action. Une caméra capture le visage de l'utilisateur en temps réel, la région faciale est extraite, puis envoyée à l'API Gemini Vision de Google qui génère un croquis minimaliste en une seule ligne continue. Un algorithme de planification de trajectoire basé sur la théorie des graphes optimise ensuite l'ordre des traits avant qu'un bras manipulateur collaboratif à 6 degrés de liberté n'exécute le dessin. Les auteurs rapportent des scores utilisateurs élevés sur une échelle de 5 : 4,33 pour la qualité du croquis, 4,53 pour la perception de l'exécution et 4,65 pour l'expérience globale.

L'intérêt principal tient à la démonstration qu'un modèle vision-langage commercial grand public, ici Gemini, peut servir de brique génératrice dans une chaîne robotique complète sans entraînement spécifique lourd, en s'appuyant sur une planification de trajectoire classique pour le contrôle du bras. Cela illustre une tendance plus large : l'intégration de modèles de fondation dans des pipelines robotiques hybrides, au-delà des seuls usages industriels. Il faut toutefois nuancer les résultats : ce sont des évaluations subjectives auto-déclarées, sans précision sur le nombre de participants, le temps de cycle par portrait, ni les conditions d'éclairage ou de pose testées, ce qui limite la portée de la validation.

Le champ des robots artistes ou "portrait robots" existe depuis plusieurs années dans la recherche académique, souvent utilisés comme vitrines de démonstration en événementiel ou en médiation scientifique plutôt que comme produits commerciaux. GeminiPainter s'inscrit dans cette lignée tout en profitant de la montée en puissance récente des API vision multimodales. L'article ne mentionne ni partenaire industriel, ni feuille de route de déploiement, ni code source ouvert : il s'agit à ce stade d'un prototype de recherche, pas d'un produit prêt à être industrialisé.

Dans nos dossiers

À lire aussi

Planification robotique et gestion de situations par perception active
1arXiv cs.RO 

Planification robotique et gestion de situations par perception active

Des chercheurs présentent dans un preprint arXiv (réf. 2604.26988, mai 2026) un cadre logiciel baptisé VAP-TAMP, pour Vision-language model-based Active Perception for Task And Motion Planning, conçu pour doter les robots d'une capacité de détection et de gestion des situations imprévues en cours d'exécution de tâches. Le système cible des perturbations concrètes : une porte coincée, un objet tombé au sol, une modification de l'environnement due à une activité humaine. VAP-TAMP exploite une base de connaissances sur les actions du robot pour formuler dynamiquement des requêtes vers des modèles vision-langage (VLA/VLM), sélectionner activement des points de vue pertinents, puis évaluer la situation. En parallèle, il construit et interroge des graphes de scène pour assurer la planification intégrée des tâches et des mouvements. Le framework a été évalué sur des tâches de service en simulation et sur une plateforme réelle de manipulation mobile. L'enjeu est structurant pour toute démarche d'autonomie longue durée en robotique de service ou industrielle. L'un des verrous majeurs identifiés par les intégrateurs et les équipes R&D n'est pas la planification initiale, les planificateurs TAMP existants s'en sortent bien, mais la résilience à l'exécution : un robot qui échoue silencieusement ou se bloque face à un impondérable n'est pas déployable en production. VAP-TAMP propose une réponse architecturale à ce point de friction en couplant perception active (choix du meilleur angle de vue pour comprendre la situation) et raisonnement symbolique via graphes de scène, deux approches généralement traitées séparément. Si les résultats se confirment sur des scénarios plus variés, cela allège significativement la charge d'ingénierie pour les équipes qui construisent des pipelines de manipulation autonome. Le travail s'inscrit dans une dynamique de recherche intense autour de l'intégration VLM-TAMP, un champ qui a explosé depuis 2023 avec les travaux de Google DeepMind sur SayCan, de Physical Intelligence (Pi-0) et des équipes de Carnegie Mellon sur la planification par LLM. VAP-TAMP se positionne sur le maillon "récupération d'erreur" plutôt que sur la génération de plan initiale, ce qui le différencie d'approches comme Code-as-Policies ou Inner Monologue. Le preprint ne mentionne pas de partenariat industriel ni de calendrier de transfert technologique : il s'agit à ce stade d'une contribution académique, sans déploiement annoncé. Les prochaines étapes naturelles seraient une validation sur un spectre plus large de perturbations et une comparaison quantitative avec des baselines de récupération existantes.

RecherchePaper
1 source
COMPASS : planification de la manipulation en espace confiné par perception active
2arXiv cs.RO 

COMPASS : planification de la manipulation en espace confiné par perception active

Des chercheurs ont publié COMPASS (Confined-space Manipulation Planning with Active Sensing Strategy), un framework multi-étapes destiné à résoudre la manipulation robotique en environnements confinés et encombrés. La méthode repose sur trois composants enchaînés : un scan de proximité dit "near-field awareness" qui construit une carte locale de collision avant tout mouvement, une fonction d'utilité multi-objectifs qui sélectionne des points de vue à la fois informatifs et compatibles avec les poses de saisie ultérieures, et un optimiseur de manipulation contraint qui génère des configurations de préhension respectant les obstacles détectés. Les auteurs proposent également un benchmark structuré en quatre niveaux de difficulté croissante pour évaluer les méthodes d'exploration et de manipulation en espace restreint. En simulation, COMPASS affiche un gain de 24,25 points de pourcentage sur le taux de succès de manipulation par rapport aux méthodes d'exploration conçues pour d'autres types de robots ou n'optimisant que le gain d'information. Des expériences en conditions réelles confirment la faisabilité de l'approche. Ce résultat est significatif parce qu'il adresse directement l'un des angles morts du champ NBV (Next Best View) : les stratégies d'exploration existantes maximisent la couverture informationnelle sans tenir compte de la faisabilité de la manipulation qui suit. En couplant explicitement exploration et planification de saisie dans une même fonction d'utilité, COMPASS réduit l'écart entre "voir la scène" et "agir dessus". Pour un intégrateur industriel, cela signifie une réduction du nombre de cycles d'observation improductifs avant une prise, ce qui devient critique dans des applications comme la désassembly, le picking en bacs profonds, ou la maintenance en espaces contraints. La validation sim-to-real, même partielle, réduit le scepticisme habituel sur le transfert des méthodes d'exploration en laboratoire vers des contextes terrain. Le problème de la manipulation en espace confiné est étudié depuis plusieurs années dans la communauté planification-perception, mais reste ouvert faute de benchmarks standardisés et de méthodes intégrant les deux dimensions simultanément. COMPASS s'inscrit dans un mouvement plus large qui voit des frameworks comme Active Neural Mapping ou des planificateurs basés sur l'échantillonnage (RRT, STOMP) être revisités pour intégrer des contraintes de manipulation dès la phase d'exploration. Aucune entreprise n'est associée à cette publication académique (arXiv:2509.14787), et aucune timeline de commercialisation n'est mentionnée. Les prochaines étapes naturelles seraient d'étendre le benchmark à des objets déformables ou à des scènes dynamiques, et de tester la robustesse face à des capteurs de profondeur bruités, condition sine qua non pour un déploiement industriel.

RecherchePaper
1 source
Planifier puis évaluer : la planification multi-cibles améliore les pipelines de préhension par apprentissage
3arXiv cs.RO 

Planifier puis évaluer : la planification multi-cibles améliore les pipelines de préhension par apprentissage

La préhension multi-doigts autonome reste un défi central en manipulation robotique. Les approches par optimisation directe donnent de bons résultats mais sont sensibles à l'initialisation et coûteuses en temps de calcul. Le cadre alternatif dit "generator-evaluator-planner" fonctionne en trois étapes : un générateur propose des candidats de prise, un évaluateur les classe par probabilité de succès, puis un planificateur de trajectoire tente d'atteindre la prise la mieux classée. En cas d'échec, le processus recommence avec la prise suivante, multipliant les calculs. Une équipe de recherche propose désormais d'inverser la logique dans un article publié sur arXiv (2509.07162v2, version révisée) : plutôt que d'évaluer les prises avant de planifier, le système planifie d'abord des trajectoires vers plusieurs cibles de préhension générées, puis l'évaluateur estime la probabilité de succès directement à la configuration terminale réellement atteinte par chaque trajectoire. Le robot exécute ensuite celle jugée la plus prometteuse. Les tests montrent une amélioration par rapport au cadre traditionnel, sur différents objets, générateurs et planificateurs de mouvement, avec une généralisation validée en conditions réelles, notamment sur des étagères et hauteurs de table variées. Ce changement d'ordre entre planification et évaluation s'attaque à un compromis structurel qui pénalise les pipelines de préhension actuels : évaluer une prise dans sa configuration idéale, non garantie atteignable, oblige soit à relancer coûteusement l'optimisation de trajectoire sur des candidats moins bons avec une probabilité de succès plus faible, soit à assouplir les seuils de précision du planificateur, ce qui dégrade la fiabilité de l'estimation. Pour les intégrateurs et les équipes travaillant sur le bin-picking, l'automatisation d'entrepôt ou la manipulation industrielle, ce goulot d'étranglement se traduit concrètement par des cycles plus lents ou des taux d'échec plus élevés. En évaluant la prise réellement atteignable plutôt qu'une cible théorique, l'approche vise à rapprocher les métriques de succès en simulation de la performance effective sur le terrain, un enjeu classique de l'écart entre démonstration et réalité en robotique apprenante. Le travail s'inscrit dans la lignée des recherches sur la préhension dextre par apprentissage, où les cadres générateur-évaluateur-planificateur se sont généralisés ces dernières années comme alternative aux méthodes d'optimisation pure. Les auteurs mettent à disposition un site dédié au projet (martinmatak.github.io/fpte) présentant leurs résultats expérimentaux. La validation en environnements réels et non simulés, sur du matériel varié, distingue cette contribution des nombreux travaux restant cantonnés à la simulation, même si l'ampleur du déploiement industriel de cette méthode reste à démontrer au-delà du cadre académique.

RecherchePaper
1 source
Planification de mouvement en corps entier et contrôle à sécurité critique pour la manipulation aérienne
4arXiv cs.RO 

Planification de mouvement en corps entier et contrôle à sécurité critique pour la manipulation aérienne

Une équipe de chercheurs propose sur arXiv (2511.02342v3) un cadre de planification de mouvement corps entier pour manipulateurs aériens : des drones multirotors équipés de bras robotiques conçus pour opérer dans des espaces encombrés. Le système repose sur une représentation par superquadriques (SQ), surfaces paramétriques différentiables qui modélisent avec précision la géométrie du véhicule, du bras embarqué et des obstacles environnants. Un planificateur à clairance maximale fusionne diagrammes de Voronoï et formulation de variété d'équilibre pour générer des trajectoires lisses, tandis qu'un contrôleur de sécurité applique simultanément les limites de poussée et l'évitement de collision via des fonctions de barrière d'ordre supérieur (high-order CBFs). En simulation, l'approche surpasse les planificateurs par échantillonnage en vitesse, sécurité et fluidité ; des expériences sur une plateforme physique réelle confirment la cohérence des performances sim-to-real. La manipulation aérienne bute depuis longtemps sur le conservatisme des abstractions géométriques classiques : boîtes englobantes et ellipsoïdes surestiment l'encombrement du système, imposent des déviations inutiles et ferment des passages pourtant praticables. Les superquadriques résolvent ce problème en modélisant les surfaces réelles avec une fidélité géométrique fine, sans le coût computationnel des maillages. Pour les intégrateurs et équipes R&D, cela se traduit par des cycles plus courts et la capacité d'opérer dans des espaces confinés, directement pertinents pour l'inspection de structures, la maintenance en hauteur ou l'intervention en zone difficile d'accès. La validation hardware distingue ce travail de nombreuses publications restées cantonnées à la simulation, et les garanties formelles des CBF d'ordre supérieur constituent un argument de poids pour des déploiements en environnements réels. La manipulation aérienne est un champ de recherche actif depuis une décennie, motivé par l'inspection d'éoliennes, de pylônes et d'infrastructures inaccessibles aux robots terrestres. La représentation par superquadriques, issue des travaux de Barr dans les années 1980 et revisitée par la robotique de manipulation terrestre, gagne en traction pour les contextes où la précision géométrique est critique. Parmi les équipes actives sur des problèmes voisins figurent l'ETH Zurich (ASL), le LAAS-CNRS côté français, ainsi que plusieurs groupes nord-américains et asiatiques. Ce preprint ne mentionne aucun partenaire industriel ni horizon de déploiement commercial, ce qui le positionne comme une contribution académique fondamentale avec validation expérimentale.

UELe LAAS-CNRS est explicitement cité parmi les équipes actives sur des problèmes voisins ; cette contribution pourrait alimenter les travaux européens sur la manipulation aérienne pour l'inspection d'infrastructures.

RecherchePaper
1 source