Aller au contenu principal
Diminution des retours de l'intelligence : la relation non linéaire entre l'échelle des LLM et la perception utilisateur dans les interactions sociales humain-robot ouvertes de courte durée
RecherchearXiv cs.RO 

Diminution des retours de l'intelligence : la relation non linéaire entre l'échelle des LLM et la perception utilisateur dans les interactions sociales humain-robot ouvertes de courte durée

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Une étude publiée sur arXiv début août 2026 interroge une hypothèse répandue dans la robotique sociale : plus un grand modèle de langage compte de paramètres, meilleure serait l'expérience utilisateur. Dix-neuf participants ont testé, dans un protocole intra-sujets, un visage robotique piloté par trois variantes du modèle vision-langage Qwen3-VL d'Alibaba, comptant respectivement 4, 8 et 30 milliards de paramètres. Chaque interaction, courte et sans script, a été notée sur quatre critères : intelligence perçue, naturel, plaisir ressenti et humour. Résultat principal : aucune préférence significative ne ressort pour le modèle à 30 milliards de paramètres, y compris face à la version 4B, sur les dimensions du naturel et de l'intelligence perçue.

Ce résultat va à l'encontre d'une hypothèse implicite du secteur, selon laquelle la course à l'échelle des modèles se traduirait mécaniquement par une meilleure interaction homme robot. Pour les intégrateurs et concepteurs d'interfaces sociales robotiques, la conclusion est concrète : un modèle 4B ou 8B, moins coûteux à faire tourner, plus rapide en latence et plus facile à déployer en local ou en périphérie, peut suffire pour des échanges brefs et ouverts, où la fluidité conversationnelle et la réactivité comptent autant que le nombre brut de paramètres. Fait notable, les utilisateurs les plus familiers de l'IA conversationnelle se montrent plus sensibles aux écarts de capacité du modèle 30B, ce qui suggère que les gains de l'échelle ne se révèlent qu'à des utilisateurs expérimentés, pas au grand public.

Ce travail s'inscrit dans un champ distinct de la course aux robots humanoïdes commerciaux type Figure ou Optimus : il porte sur les agents conversationnels incarnés, ces interfaces à visage robotique utilisées pour l'accueil, l'assistance ou la démonstration, où le rendu social prime sur la manipulation physique. Le choix de Qwen3-VL, famille de modèles multimodaux ouverts d'Alibaba, illustre une tendance à tester des LLM open source plutôt que des API propriétaires pour ce type d'usage. Les auteurs reconnaissent eux-mêmes les limites de l'étude, à commencer par un échantillon réduit à 19 participants et des interactions brèves, et précisent qu'il s'agit d'une prépublication arXiv non encore relue par les pairs. Le signal rejoint néanmoins d'autres travaux sur l'écart entre démonstration et usage réel, invitant la recherche en interaction homme-robot à prioriser la latence et le comportement social plutôt que la seule taille du modèle.

Dans nos dossiers

À lire aussi

Robots humanoïdes : une étude utilisateur compare perception et métriques techniques en interaction homme-robot multimodale
1arXiv cs.RO 

Robots humanoïdes : une étude utilisateur compare perception et métriques techniques en interaction homme-robot multimodale

Une étude universitaire portant sur 24 participants montre qu'un gain de 15 points de pourcentage en taux de réussite d'une tâche de préhension d'objets, de 75% à 90%, est perceptible par les utilisateurs lors d'une interaction directe avec un robot. Le système de référence combine Whisper pour la reconnaissance vocale, Florence-2 pour la détection d'objets en vocabulaire ouvert, LLaMA 3.1 pour l'extraction d'actions, et un contrôleur logique flou de type 2 intervalle pour l'exécution des mouvements. La configuration améliorée conserve le même contrôleur mais remplace les modules de perception et de langage par Grounding DINO couplé à SAM et par Qwen 3.5 9B. Dans une étude en sujets répétés, où chaque participant a testé les deux configurations sur la même tâche de saisie d'objets sur table, 17 personnes sur 24 (70,83%) ont préféré le système amélioré, un résultat statistiquement significatif (test binomial exact, p = 0,043). Les trois critères perceptuels évalués sur une échelle de Likert à 7 points, la vitesse ressentie, la fiabilité et la compétence globale, ont tous été notés significativement plus haut pour la version améliorée, avec des tailles d'effet allant de grandes à très grandes après correction de Holm (p < 0,001). L'intérêt de ces travaux dépasse le simple constat qu'un meilleur système est mieux perçu. Ils répondent à une question moins triviale qu'il n'y paraît pour l'industrie robotique: un gain mesuré sur des benchmarks techniques se traduit-il réellement en une différence que l'utilisateur final ressent au contact du robot? Pour les intégrateurs et décideurs qui arbitrent entre plusieurs piles perception-langage-contrôle, souvent sur la seule foi de métriques de laboratoire, cette étude fournit une preuve empirique que l'amélioration des modules de vision et de compréhension du langage a un effet direct sur la confiance et l'acceptabilité perçues, indépendamment du contrôleur moteur qui reste inchangé. Le travail s'inscrit dans une lignée de recherches en interaction homme-robot qui cherche à combler l'écart entre évaluation par benchmark et évaluation centrée utilisateur, un point de friction classique entre recherche en robotique et déploiement réel. L'architecture testée illustre aussi l'évolution rapide des briques génériques mobilisées dans les pipelines de manipulation, passant de Florence-2 et LLaMA 3.1 à des modules plus récents comme Grounding DINO, SAM et Qwen 3.5 9B, sans toucher à la couche de contrôle bas niveau. Les auteurs appellent à systématiser ce type d'évaluation utilisateur en complément des ablations techniques classiques pour tout futur pipeline de manipulation robotique.

RecherchePaper
1 source
IA incarnée guidée par les exigences : conception d'une détection tactile sociale du corps entier via interaction humain-robot virtuelle
2arXiv cs.RO 

IA incarnée guidée par les exigences : conception d'une détection tactile sociale du corps entier via interaction humain-robot virtuelle

Article traduit et résumé en français, prêt à publier : Une équipe de recherche propose une méthodologie inédite pour concevoir la peau tactile des robots humanoïdes destinés à l'interaction physique et sociale avec l'humain (spHRI), en partant des données d'usage plutôt que des contraintes matérielles. Publiée sur arXiv (2607.11690v1), l'étude s'appuie sur une plateforme de réalité virtuelle à retour haptique pour collecter des cartes de contact haute résolution sur l'ensemble du corps d'un robot, à travers plusieurs scénarios sociaux (accolade, tape sur l'épaule, poignée de main, etc.). Neuf gestes tactiles sociaux récurrents ont été identifiés, dont huit ont ensuite fait l'objet d'une collecte contrôlée avec 18 participants, produisant un jeu de données ouvert de 5 520 essais. L'analyse des distributions de contact et de simulations d'encodage tactile fournit des repères quantitatifs sur la couverture cutanée nécessaire et la densité de capteurs à installer sur une plateforme humanoïde donnée. L'enjeu dépasse la simple curiosité académique : jusqu'ici, la conception des capteurs tactiles pour l'interaction sociale suivait une logique matérielle d'abord, où l'emplacement et la résolution des capteurs étaient fixés en amont, limitant de fait la palette de gestes reconnaissables. Cette approche inverse la démarche en dérivant les exigences de capteurs directement des données d'interaction réelles, ce qui pourrait éviter aux fabricants de robots sociaux ou compagnons un surdimensionnement coûteux de la peau tactile, ou au contraire une couverture insuffisante qui dégraderait la reconnaissance des gestes. Pour les intégrateurs et décideurs qui évaluent des robots destinés au contact physique humain (assistance, santé, accueil), disposer de seuils quantitatifs de densité et de placement avant la fabrication du hardware représente un gain de temps et de coûts d'ingénierie concret, plutôt qu'une promesse marketing. Le travail s'inscrit dans une limite bien identifiée de la recherche en robotique tactile : la plupart des peaux artificielles actuelles sont conçues sans données préalables sur la façon dont les humains touchent réellement un robot dans un contexte social, ce qui explique des écarts entre capacités annoncées et usage terrain. Bien que la démonstration ait été menée sur une seule plateforme robotique, les auteurs présentent la méthode comme transférable à d'autres morphologies de robots, ouvrant la voie à des exigences de capteurs spécifiques à chaque design avant même le prototypage physique. Les prochaines étapes attendues concernent la validation de cette méthodologie sur d'autres architectures de robots et son intégration dans des cycles de conception industriels, mais aucun calendrier ni partenariat industriel n'est mentionné à ce stade.

RecherchePaper
1 source
Adaptation de la personnalité par élicitation conversationnelle dans l'interaction humain-robot (PACE)
3arXiv cs.RO 

Adaptation de la personnalité par élicitation conversationnelle dans l'interaction humain-robot (PACE)

PACE (Persona Adaptation through Conversational Elicitation) est un framework présenté par des chercheurs pour équiper le robot humanoïde Ameca, du fabricant britannique Engineered Arts, d'une identité conversationnelle adaptable plutôt que figée. Le système repose sur un pipeline d'élicitation interactive de persona : via une session de questions-réponses avec l'utilisateur, le robot construit dynamiquement un profil psychologique structuré, ensuite compilé en un prompt multi-dimensionnel qui pilote son comportement. Les auteurs détaillent aussi l'intégration embarquée nécessaire pour traduire cette spécification textuelle en comportements multimodaux expressifs (voix, gestuelle, expressions faciales) sur la plateforme Ameca. Le système a été évalué lors d'une étude d'interaction homme-robot comparant les personas générées dynamiquement à une persona générique de référence, sur cinq axes : confiance de l'utilisateur, anthropomorphisme perçu, cohérence de la persona dans le temps, pertinence personnelle et qualité globale de l'interaction. Une démonstration vidéo est disponible en ligne, mais l'article ne publie pas de métriques chiffrées détaillées ni la taille de l'échantillon testé. Cette approche s'attaque à un problème concret du secteur des robots humanoïdes et compagnons conversationnels : la plupart des identités robotiques restent codées en dur par les concepteurs, identiques pour chaque utilisateur, ce qui limite l'engagement et la confiance sur la durée. En générant la persona à la volée à partir d'un échange conversationnel, PACE ouvre une voie vers des assistants humanoïdes personnalisables à l'échelle, un enjeu direct pour les intégrateurs qui déploient des robots d'accueil, d'assistance ou de représentation dans des contextes variés (retail, événementiel, santé). Si les gains mesurés sur la confiance et l'anthropomorphisme perçu se confirment au-delà de cette étude pilote, cela renforcerait l'idée que la personnalisation conversationnelle, plus que le seul réalisme physique, constitue un levier clé de l'acceptabilité des robots sociaux. Le travail s'inscrit dans la lignée des recherches en interaction homme-robot cherchant à dépasser les personas scriptées, une limite documentée depuis plusieurs années sur des plateformes conversationnelles comme Pepper ou Sophia. Ameca, connue pour l'expressivité de son visage animé, sert ici de banc d'essai plutôt que de produit commercial déployé en volume : l'étude reste au stade académique, publiée sur arXiv sans partenaire industriel annoncé. Les auteurs présentent PACE comme une voie scalable vers des identités fiables pour les assistants humanoïdes incarnés, sans préciser de calendrier de transfert vers des déploiements réels ni de suite de publication prévue.

RecherchePaper
1 source
Perception multimodale, ancrage linguistique, contrôle et saisie d'objets en interaction humain-robot : étude d'ablation
4arXiv cs.RO 

Perception multimodale, ancrage linguistique, contrôle et saisie d'objets en interaction humain-robot : étude d'ablation

Une étude soumise en mai 2025 sur arXiv (référence 2605.00963) présente une analyse par ablation d'un système de manipulation robotique piloté par interaction homme-robot multimodale, appliqué à une tâche de détection et saisie d'objets. Les chercheurs ont ciblé trois modules du pipeline : le modèle de langage chargé d'extraire les actions à partir d'instructions verbales, le système de perception assurant l'ancrage visuel des objets cibles, et le contrôleur gérant l'exécution du mouvement. L'étude compare trois LLM distincts, cinq configurations de perception, et trois contrôleurs, avant de soumettre les meilleures combinaisons à une analyse factorielle croisée en seconde phase. L'objectif déclaré n'est pas de redessiner le pipeline, mais d'isoler la contribution de chaque composant sous un protocole expérimental commun. Cette approche répond à une question directement actionnable pour les intégrateurs et ingénieurs robotiques : quel module optimiser en priorité pour améliorer le taux de succès, et lequel pour réduire le temps d'exécution ? Dans un contexte industriel, ces deux métriques obéissent à des contraintes distinctes selon les postes de travail, et les confondre dans une évaluation globale masque les vrais leviers d'amélioration. La méthodologie par ablation reste encore rare dans les publications de manipulation robotique, où la tendance est d'évaluer un seul composant à la fois, ce qui rend les résultats difficiles à reproduire ou à transposer d'un système à l'autre. Les auteurs précisent que l'analyse vise aussi à orienter les choix d'ingénierie dans les prochaines versions du système. Ce travail s'inscrit dans un effort plus large de la communauté pour rendre opérationnels les pipelines de manipulation guidés par langage hors des environnements contrôlés de laboratoire. Sur le plan concurrentiel, deux écoles s'affrontent actuellement : les modèles unifiés de type VLA (Vision-Language-Action) entraînés à grande échelle, comme Pi-0 de Physical Intelligence ou GR00T N2 de NVIDIA, et les pipelines modulaires qui préservent la séparabilité des composants pour faciliter le débogage et l'adaptation sectorielle. L'étude n'annonce pas de déploiement industriel et reste pour l'instant au stade de la validation expérimentale. La prochaine étape logique serait de tester si les gains mesurés en laboratoire résistent au sim-to-real gap, qui demeure le principal obstacle à la mise en production des systèmes de manipulation guidés par instructions en langage naturel.

RecherchePaper
1 source