
Diminution des retours de l'intelligence : la relation non linéaire entre l'échelle des LLM et la perception utilisateur dans les interactions sociales humain-robot ouvertes de courte durée
Une étude publiée sur arXiv début août 2026 interroge une hypothèse répandue dans la robotique sociale : plus un grand modèle de langage compte de paramètres, meilleure serait l'expérience utilisateur. Dix-neuf participants ont testé, dans un protocole intra-sujets, un visage robotique piloté par trois variantes du modèle vision-langage Qwen3-VL d'Alibaba, comptant respectivement 4, 8 et 30 milliards de paramètres. Chaque interaction, courte et sans script, a été notée sur quatre critères : intelligence perçue, naturel, plaisir ressenti et humour. Résultat principal : aucune préférence significative ne ressort pour le modèle à 30 milliards de paramètres, y compris face à la version 4B, sur les dimensions du naturel et de l'intelligence perçue.
Ce résultat va à l'encontre d'une hypothèse implicite du secteur, selon laquelle la course à l'échelle des modèles se traduirait mécaniquement par une meilleure interaction homme robot. Pour les intégrateurs et concepteurs d'interfaces sociales robotiques, la conclusion est concrète : un modèle 4B ou 8B, moins coûteux à faire tourner, plus rapide en latence et plus facile à déployer en local ou en périphérie, peut suffire pour des échanges brefs et ouverts, où la fluidité conversationnelle et la réactivité comptent autant que le nombre brut de paramètres. Fait notable, les utilisateurs les plus familiers de l'IA conversationnelle se montrent plus sensibles aux écarts de capacité du modèle 30B, ce qui suggère que les gains de l'échelle ne se révèlent qu'à des utilisateurs expérimentés, pas au grand public.
Ce travail s'inscrit dans un champ distinct de la course aux robots humanoïdes commerciaux type Figure ou Optimus : il porte sur les agents conversationnels incarnés, ces interfaces à visage robotique utilisées pour l'accueil, l'assistance ou la démonstration, où le rendu social prime sur la manipulation physique. Le choix de Qwen3-VL, famille de modèles multimodaux ouverts d'Alibaba, illustre une tendance à tester des LLM open source plutôt que des API propriétaires pour ce type d'usage. Les auteurs reconnaissent eux-mêmes les limites de l'étude, à commencer par un échantillon réduit à 19 participants et des interactions brèves, et précisent qu'il s'agit d'une prépublication arXiv non encore relue par les pairs. Le signal rejoint néanmoins d'autres travaux sur l'écart entre démonstration et usage réel, invitant la recherche en interaction homme-robot à prioriser la latence et le comportement social plutôt que la seule taille du modèle.
Dans nos dossiers




