Aller au contenu principal
FR/EU ecosystemearXiv cs.RO 

Le Fil selon un robot social : enrichir le dialogue humain-robot avec des modèles vision-langage

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Selon un article publié sur arXiv (2607.16318v1, juillet 2026), une équipe de recherche a testé l'intégration d'un modèle de langage visuel (VLM) sur un robot social Pepper, produit historiquement développé par Aldebaran puis SoftBank Robotics. Le système combine un modèle de langage de Mistral AI avec des capacités de perception visuelle, permettant au robot d'observer non seulement les paroles de son interlocuteur mais aussi son comportement et le contexte de la scène pendant un dialogue humain-robot. Les chercheurs ont mesuré l'impact de cet ajout d'information visuelle sur le temps de réponse du robot, en comparant plusieurs configurations de modèles. Résultat principal: l'ajout du contexte visuel n'augmente que modérément la latence de réponse, tout en enrichissant significativement la compréhension de la situation par le robot, notamment sur les éléments non verbaux de l'échange.

Cette expérimentation touche à un problème central pour les robots sociaux déployés en environnement réel, à l'accueil, en médiation ou en assistance: comprendre les codes sociaux implicites sans que l'utilisateur ait à tout formuler explicitement. C'est aussi un signal pour les intégrateurs et décideurs européens: le choix d'un modèle Mistral AI, hébergé en Europe, permet de respecter le RGPD sans dépendre de fournisseurs américains ou chinois, un argument de poids pour des déploiements dans des administrations, hôpitaux ou établissements publics soumis à des contraintes réglementaires strictes. L'étude reste toutefois à un stade préliminaire, avec un nombre limité d'interactions testées, loin d'une validation à grande échelle.

Le choix de Pepper, robot social lancé il y a plus d'une décennie et longtemps utilisé dans la recherche en interaction humain-robot, s'inscrit dans la continuité des travaux sur l'intelligence conversationnelle embarquée. Face à des architectures VLA plus orientées manipulation physique comme GR00T N2 ou Helix, cette approche cible spécifiquement le dialogue social et la compréhension contextuelle plutôt que l'action motrice. Le recours à Mistral AI illustre aussi la montée en puissance d'une offre souveraine européenne en IA, alternative crédible à OpenAI ou Google dans des cas d'usage sensibles aux données. Les auteurs annoncent vouloir approfondir ces travaux avec des scénarios d'interaction plus complexes.

Impact France/UE

L'utilisation d'un modele Mistral AI heberge en Europe pour ce robot social illustre une alternative souveraine conforme au RGPD, pertinente pour des deploiements dans les administrations et hopitaux francais et europeens.

À lire aussi

AR-VLA : un expert d'action autorégressif pour les modèles vision-langage-action
1arXiv cs.RO 

AR-VLA : un expert d'action autorégressif pour les modèles vision-langage-action

Des chercheurs de l'INSAIT (Institute for Computer Science, Artificial Intelligence and Technology, Sofia, Bulgarie) ont publié début 2026 AR-VLA, une architecture de politique robotique qui remplace les têtes d'action à base de blocs (chunk-based) par un expert d'action autorégressif autonome. Contrairement aux modèles VLA existants, qu'ils soient réactifs ou basés sur la diffusion, qui réinitialisent leur contexte temporel à chaque nouvelle observation, AR-VLA maintient une mémoire longue durée et génère les actions comme une séquence causale continue. Le système intègre un mécanisme de re-ancrage (re-anchoring) pour synchroniser les modalités asynchrones vision-langage-action, compensant mathématiquement le délai entre une perception lente (quelques Hz) et un contrôle moteur rapide (centaines de Hz). Les expériences couvrent des tâches de manipulation en simulation et sur robots réels, où AR-VLA atteint ou dépasse les taux de succès des VLA réactifs de l'état de l'art tout en produisant des trajectoires sensiblement plus lisses. L'enjeu central est le découplage entre raisonnement perceptif lent et contrôle moteur rapide, un problème structurel des architectures VLA actuelles. En traitant les actions comme une séquence autorégressive avec historique persistant plutôt que comme un bloc prédit à chaque nouvelle trame, AR-VLA rend la politique intrinsèquement consciente du contexte : elle sait ce qu'elle vient d'exécuter, pas seulement ce qu'elle observe à l'instant T. Pour les équipes robotiques et les intégrateurs, cette architecture autorise un préentraînement modulaire de la syntaxe cinématique indépendamment du backbone de perception, réduisant potentiellement les coûts de développement de politiques spécialistes ou généralistes. La cohérence spatio-temporelle accrue réduit également les oscillations et les reprises de mouvement, deux facteurs critiques en déploiement industriel. L'INSAIT, fondé en 2022 à Sofia avec le soutien de Google, Microsoft et de l'EPFL, s'est imposé rapidement comme un pôle de recherche en IA en Europe centrale. AR-VLA s'inscrit dans une compétition ouverte sur l'architecture des politiques robot-généralistes, où Physical Intelligence (pi-0, pi-0.5), NVIDIA (GR00T N2), Google DeepMind et des startups comme Figure (Helix) ou 1X défendent des approches concurrentes. L'approche par diffusion, popularisée notamment par pi-0 et Diffusion Policy, constitue l'alternative dominante aux VLA réactifs ; AR-VLA la défie directement en montrant qu'un modèle autorégressif pur peut produire des trajectoires plus cohérentes sans recourir à des processus de débruitage itératifs. AR-VLA demeure pour l'instant un preprint arXiv (2603.10126v2), sans annonce de déploiement industriel ni de commercialisation. Le code et les vidéos de démonstration sont disponibles sur arvla.insait.ai.

UEL'INSAIT (Sofia, Bulgarie), soutenu par Google, Microsoft et l'EPFL, positionne l'UE comme acteur de recherche crédible dans la course aux architectures VLA généralistes ; le code est disponible et testable par les équipes robotiques européennes.

FR/EU ecosystemeOpinion
1 source
Évaluation des modèles vision-langage-action (VLA) sur SO-101 : analyse des échecs et de la récupération
2arXiv cs.RO 

Évaluation des modèles vision-langage-action (VLA) sur SO-101 : analyse des échecs et de la récupération

Une équipe de chercheurs a publié le 10 juin 2026 (arXiv:2606.08881) un benchmark standardisé pour évaluer des modèles Vision-Language-Action (VLA) sur le robot SO-101, une plateforme manipulatrice à faible coût issue de la communauté open-source. Quatre politiques ont été comparées sur quatre tâches de manipulation représentatives avec des protocoles d'évaluation unifiés : Pi-0.5 (Physical Intelligence), SmolVLA (HuggingFace), Wall-X et ACT (Action Chunking with Transformers, référence en imitation learning). Toutes ont été fine-tunées directement sur le matériel physique à partir de démonstrations télé-opérées en conditions réelles, sans passer par la simulation. Au-delà du simple taux de succès binaire, l'étude introduit une taxonomie structurée des échecs, une décomposition sémantique et d'exécution, ainsi que des métriques de récupération (recovery-aware metrics) pour qualifier la robustesse de chaque architecture. Les résultats confirment que les VLA pré-entraînés sur de larges corpus surpassent globalement la baseline en imitation learning pure, mais cette supériorité reste fortement dépendante de la tâche. Ce point est crucial pour les intégrateurs : l'instabilité d'exécution, et non les erreurs de compréhension sémantique, constitue la source d'échec dominante. La capacité de récupération varie significativement selon les architectures, ce qui suggère que les benchmarks centrés uniquement sur le taux de succès final masquent des différences opérationnelles importantes. Pour un COO industriel, cela signifie que le choix d'un modèle VLA ne peut pas se faire sur des métriques agrégées sans analyser le comportement en cas d'échec partiel. Le SO-101 s'est imposé comme plateforme de référence communautaire grâce à son coût accessible, là où la plupart des évaluations VLA existantes reposent sur des robots industriels onéreux (Franka, UR, Boston Dynamics Spot) ou restent cantonnées à la simulation. Ce travail s'inscrit dans un effort plus large de démocratisation des benchmarks robotiques, face à des acteurs comme Figure AI, Agility Robotics ou 1X Technologies qui évaluent leurs systèmes en environnements propriétaires non reproductibles. Les auteurs positionnent explicitement le SO-101 comme socle pratique pour l'évaluation de l'IA incarnée dans des conditions de déploiement réalistes à faible coût. La prochaine étape naturelle serait d'étendre ce protocole à des scénarios de manipulation plus complexes et à davantage d'architectures VLA émergentes, notamment celles intégrant des retours haptiques.

UESmolVLA de HuggingFace (entreprise française) est directement comparé à Pi-0.5, Wall-X et ACT dans ce benchmark standardisé, offrant une visibilité internationale sur les forces et faiblesses du modèle français face aux architectures VLA concurrentes.

FR/EU ecosystemeActu
1 source
Contrôle des robots humanoïdes avec conscience de la force pour les mains multidoigts
3arXiv cs.RO 

Contrôle des robots humanoïdes avec conscience de la force pour les mains multidoigts

Des chercheurs de l'Istituto Italiano di Tecnologia (IIT, Gênes) ont publié sur arXiv (2603.08142v2) un framework de contrôle force-aware pour mains multi-doigts sur robots humanoïdes. Le système exploite cinq capteurs magnétiques Xela pour estimer les forces de contact en temps réel, sans recourir aux signaux tactiles bruts. Un dataset de signaux tactiles couplés à des mesures de force ground-truth a été constitué via des interactions avec des indenters calibrés, puis utilisé pour entraîner des estimateurs de force. Le contrôleur résultant coordonne simultanément le torse, le bras, le poignet et les doigts pour redistribuer les forces de contact et maintenir une prise stable sur des objets à distribution de masse variable. Sur une tâche d'équilibrage impliquant cinq objets distincts, le framework atteint 82,7 % de taux de succès, et 80 % de précision dans des scénarios multi-objets. L'approche est notable car elle s'appuie sur des forces estimées plutôt que sur des signaux capteurs spécifiques, ce qui la rend théoriquement transférable à tout capteur capable de produire une estimation de force, sans recalibration du contrôleur. Le noeud technique central est la minimisation de la distance entre le Centre de Pression (CoP) et le centroïde du polygone de contact des doigts, un critère classique de stabilité de prise en mécanique du contact. Ce choix de critère explicite, couplé à un schéma de contrôle model-based, contraste avec les approches purement apprentissage (VLA, imitation learning) dominantes dans les humanoïdes commerciaux actuels, où l'interprétabilité de la commande reste limitée. Pour les intégrateurs industriels, c'est un signal que le sim-to-real pour la manipulation dextre peut passer par des architectures hybrides capteur-modèle plutôt que par du bout-en-bout. L'IIT est l'un des laboratoires européens les plus actifs en robotique humanoïde, connu notamment pour le robot iCub et ses travaux fondateurs sur la manipulation dextre et la peau artificielle. Ce travail s'inscrit dans la lignée de recherches sur le contrôle de contact multi-doigts, un domaine où des acteurs comme Shadow Robot (UK), Sanctuary AI (Canada) ou Agility Robotics (USA) progressent également, mais via des stacks propriétaires moins publiés. Le code et les données sont disponibles en open source sur GitHub (hsp-iit/multifingered-force-aware-control), ce qui facilite la reproduction et l'adaptation. Les prochaines étapes naturelles seraient une validation sur des scénarios d'assemblage réels et une intégration avec des politiques de plus haut niveau pour la planification de saisie.

UEL'IIT (Gênes) publie en open source un framework de contrôle dextre pour humanoïdes avec métriques concrètes, offrant aux laboratoires et industriels européens un outil directement reproductible pour la manipulation multi-doigts sans dépendance à des capteurs propriétaires.

FR/EU ecosystemePaper
1 source
VivaTech 2026 : l’année où les robots humanoïdes sont devenus une réalité industrielle
4Robot Magazine FR 

VivaTech 2026 : l’année où les robots humanoïdes sont devenus une réalité industrielle

Les 17 et 18 juin 2026, la dixième édition de VivaTech à Paris Porte de Versailles a réuni des dizaines de démonstrations de robots humanoïdes capables de marcher, manipuler des objets et interagir avec des opérateurs humains. L'événement s'est distingué des éditions précédentes par la présence notable d'acteurs chinois en nombre, venus exposer leurs avancées en « Embodied AI », la convergence entre modèles de raisonnement LLM et corps robotiques physiques. Parmi les machines les plus remarquées figurait KANGAROO, développé par PAL Robotics (Barcelone) en partenariat avec plusieurs centres de recherche européens : un humanoïde à mobilité avancée, entraîné par renforcement, positionné comme plateforme industrielle et logistique polyvalente. L'article ne fournit pas de spécifications techniques précises (charge utile, degrés de liberté, temps de cycle) ni de confirmation de déploiement commerciaux signés, les présentations restaient majoritairement au stade de démonstrations salon. Ce moment marque une inflexion rhétorique autant que technique : depuis ChatGPT en 2022, l'IA était associée aux assistants logiciels ; VivaTech 2026 a déplacé le centre de gravité vers l'IA physique. Pour les intégrateurs et décideurs industriels, le signal le plus structurant est la montée en puissance de la Chine sur le segment humanoïde, un marché qu'elle dominait déjà en volumes sur les bras industriels classiques. Pékin traite désormais la robotique humanoïde comme secteur stratégique au même titre que les semi-conducteurs, avec une logique de mise à l'échelle rapide et de compression des coûts qui change la donne compétitive. Pour les acheteurs B2B européens, la question n'est plus seulement « quelle plateforme est la plus capable » mais « laquelle peut être produite en volumes suffisants à un prix d'entrée industriel ». La trajectoire rappelle celle des véhicules électriques : l'Europe dispose de l'ingénierie, la Chine de la capacité de production. PAL Robotics, fondée en 2004 à Barcelone et pionnière de l'humanoïde de recherche avec REEM puis TALOS, représente l'une des rares maisons européennes avec une expérience longue sur les plateformes bipèdes. KANGAROO s'inscrit dans une stratégie de positionnement pragmatique face aux offres américaines (Figure, Apptronik, Tesla Optimus) et chinoises (Unitree, Fourier, UBTECH), en visant des environnements industriels structurés plutôt que des cas d'usage grand public. Les suites annoncées restent vagues : aucun calendrier de commercialisation ni volume de déploiement n'est mentionné dans l'article source. L'édition 2026 confirme que la course à l'humanoïde industriel est désormais ouverte et multipolaire, mais la majorité des acteurs en sont encore à la phase démonstration-salon, pas à la livraison cliente à l'échelle.

UEPAL Robotics (Barcelone) positionne KANGAROO comme plateforme humanoïde industrielle européenne lors de VivaTech Paris, mais l'Europe reste structurellement exposée à la montée en puissance chinoise sur les volumes et la compression des coûts, un risque compétitif direct pour les intégrateurs industriels français et européens.

FR/EU ecosystemeOpinion
1 source