Aller au contenu principal
R2RI : un jeu de données multi-vues d'événements et RGB pour l'interaction robot-robot
RecherchearXiv cs.RO 

R2RI : un jeu de données multi-vues d'événements et RGB pour l'interaction robot-robot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient R2RI (Robot-to-Robot Interaction), un jeu de données présenté comme le premier conçu spécifiquement pour la tâche d'interaction robot-robot (RRI). Il réunit plusieurs robots humanoïdes de modèles différents, mis en scène dans des interactions calquées sur des comportements sociaux humains réels. Chaque scène est filmée selon deux points de vue complémentaires : une vue égocentrique, issue des capteurs embarqués de chaque robot, et une vue exocentrique, captée par des caméras fixes extérieures. Le corpus compte plus de 6,5 millions d'images et environ 5 000 vidéos à 120 images par seconde, dans deux domaines : RGB classique et caméra événementielle, qui ne transmet que les changements de luminosité pixel par pixel, avec une latence très faible et une bonne tenue aux mouvements rapides. Les auteurs comparent les avantages et limites de chaque domaine en confrontant des approches de l'état de l'art sur plusieurs tâches clés de perception et d'interaction. Données et annotations sont publiées sur GitHub (MagriniGabriele/R2RI), pour toutes les tâches et toutes les modalités.

L'enjeu est d'abord méthodologique. La modélisation des interactions entre agents autonomes pèse sur les systèmes collaboratifs, la robotique sociale et la coexistence homme-robot. Elle manquait pourtant de référence à grande échelle, ce qui empêchait de comparer les méthodes entre elles. Pour un intégrateur ou un responsable d'exploitation, l'intérêt est concret : à mesure que des flottes de robots hétérogènes partagent un même espace (entrepôt, usine, site logistique), la capacité d'un robot à interpréter les gestes et intentions d'un autre devient un sujet d'ingénierie, au-delà de la simple détection d'obstacles. L'ajout du flux événementiel est notable, car ce type de capteur est précisément pertinent pour des mouvements rapides ou des éclairages difficiles, où le RGB souffre de flou et de latence. Une réserve s'impose toutefois : il s'agit d'un jeu de données, sans démonstration de déploiement. Les interactions sont scénarisées et enregistrées en environnement contrôlé, et le résumé ne précise ni les modèles de robots utilisés, ni les tâches évaluées, ni les scores obtenus. L'écart entre benchmark et comportement autonome en conditions réelles reste donc entier.

Ce travail s'inscrit dans une tendance visible de la vision et de la robotique : les jeux de données d'interaction se sont d'abord concentrés sur l'humain, avec des corpus d'interactions homme-homme ou homme-robot, alors que l'interaction entre machines restait quasi absente. Avec la multiplication des humanoïdes en phase pilote chez plusieurs acteurs américains et chinois, la question de la coordination entre robots de marques différentes va gagner en importance. Les suites probables sont l'adoption du jeu de données comme banc d'essai par d'autres laboratoires, puis l'entraînement de modèles de perception sociale ou de politiques multi-agents. Aucun calendrier industriel n'est annoncé et aucun acteur européen n'est cité dans le résumé. La valeur réelle de R2RI se jugera à son adoption par la communauté et à la diversité des plateformes qu'il couvre effectivement.

À lire aussi

DARP : un jeu de données bimanuel calibré RGB-D-IR pour la perception robotique multi-vues
1arXiv cs.RO 

DARP : un jeu de données bimanuel calibré RGB-D-IR pour la perception robotique multi-vues

Le dataset publié sur arXiv (2608.31002v1) présente DARP (Dual-Arm Robotic Perception), un jeu de données calibré RGB-D-infrarouge issu de deux bras manipulateurs indépendants, chacun équipé d'une caméra Intel RealSense en configuration eye-in-hand, placés de part et d'autre d'un même plan de travail. Dix objets de table, sans pose fixe ni marqueur, ont été capturés via un protocole entièrement automatisé : localisation automatique, confirmation croisée entre les deux bras, génération adaptative de points de vue et enregistrement continu RGB, profondeur et infrarouge stéréo synchronisé avec les états articulaires des robots. Un pipeline de fusion multi-vues déterministe, sans complétion apprise ni générative, convertit ces observations calibrées en nuages de points et maillages de surface mesurés ; sur 224 images-clés de test et 1,56 million de points 3D, la distance médiane point-maillage atteint 2,13 mm (RMSE de 4,04 mm), avec 96,56% des points situés à moins de 10 mm de la surface mesurée. Le jeu de données est publié en libre accès sur IEEE DataPort, sous le DOI 10.21227/rmv3-be47. La perception à partir d'un point de vue unique souffre d'auto-occlusions et d'une visibilité incomplète des surfaces, un frein connu pour la manipulation fine, le bin-picking ou l'assemblage collaboratif. En combinant deux bras mobiles plutôt qu'un rig de caméras fixes, DARP fournit un cadre calibré permettant d'évaluer objectivement des algorithmes de fusion multi-vues, de perception active et de raisonnement sur des observations partielles, sans recourir à des vidéos sélectionnées ou des métriques qualitatives. Les résultats millimétriques annoncés valident surtout la précision du pipeline de calibration et de reconstruction géométrique lui-même, et non une capacité de manipulation en conditions réelles : il s'agit d'une brique d'infrastructure de recherche reproductible, utile aux laboratoires travaillant sur la perception bi-manuelle ou collaborative, un terrain encore dominé par des configurations mono-bras. Les caméras montées au poignet sont courantes en robotique manipulatrice, mais la plupart des jeux de données existants, qu'il s'agisse de rigs fixes ou de capteurs mono-bras, ne capturent pas la complémentarité géométrique d'une observation bi-manuelle synchronisée et libre de toute contrainte de pose. DARP se positionne comme une alternative en ciblant spécifiquement la reconstruction collaborative par deux agents mobiles indépendants, sans marqueurs ni positions imposées aux objets. Aucun acteur industriel n'est associé à cette publication, de nature purement académique ; les auteurs présentent DARP comme une ressource réutilisable pour de futurs travaux de reconstruction multi-vues, de fusion multimodale et d'apprentissage sur des observations partielles d'objets, sans calendrier de suivi ni déploiement industriel annoncé à ce stade.

RecherchePaper
1 source
Suivi du visage ou du corps pour l'interaction humain-robot : un jeu de données égocentrique
2arXiv cs.RO 

Suivi du visage ou du corps pour l'interaction humain-robot : un jeu de données égocentrique

Des chercheurs ont publié en juin 2026 sur arXiv (arXiv:2606.03694) une évaluation systématique des méthodes de suivi visuel pour la robotique sociale, en s'appuyant sur un jeu de données original capturé via le robot social Furhat. L'enjeu central est la continuité d'identification des utilisateurs pendant une interaction : lorsqu'un robot perd de vue son interlocuteur, même brièvement, il peut confondre deux personnes distinctes, phénomène désigné sous le terme "identity switch" (IDSW). L'étude compare deux approches (suivi par le visage versus suivi par le corps entier) et évalue l'effet de deux mécanismes complémentaires : la mémoire spatiale étendue et la réidentification par apparence (ReID). Le pipeline optimisé qui en résulte réduit les IDSW de 49 %, limitant ainsi les ruptures de dialogue entre humains et robots. Les résultats mettent en lumière une tension technique inattendue : la ReID améliore substantiellement la stabilité du suivi corporel, mais dégrade celui du visage en raison d'une sensibilité aux angles de profil. Ce comportement antagoniste n'est pas anodin pour les intégrateurs de systèmes HRI, qui ne peuvent pas transposer mécaniquement les mêmes optimisations à toutes les modalités de tracking. Plus fondamentalement, l'étude confirme que les modèles de vision par ordinateur les plus performants, conçus pour la vidéosurveillance ou la conduite autonome, ne couvrent pas les contraintes propres à la robotique sociale : occlusions mutuelles entre interlocuteurs, mouvements brusques, sorties et rentrées dans le champ de vision à courte distance. Le fossé entre démo contrôlée et déploiement réel reste ouvert pour les systèmes HRI en environnements denses. Furhat Robotics, entreprise suédoise spécialisée dans les robots conversationnels à tête projetée, fournit ici la plateforme matérielle, ce qui oriente naturellement l'évaluation vers les contextes face-à-face rapprochés. Dans le secteur plus large de la perception pour l'interaction humain-robot, des laboratoires académiques européens comme l'INRIA ou TU Delft, ainsi que des acteurs industriels tels SoftBank Robotics, travaillent sur des problématiques proches. Le point de friction central souligné par les auteurs reste l'absence de benchmarks publics capturant des occlusions denses à courte distance : sans jeux de données nativement sociaux, la validation des modèles de perception HRI demeure partielle. Les prochaines étapes naturelles consisteraient à tester ce pipeline sur d'autres plateformes et en conditions multi-utilisateurs réelles.

UEFurhat Robotics (Suède, UE) fournit la plateforme matérielle de l'étude, et l'INRIA est cité parmi les laboratoires européens travaillant sur des problématiques similaires, ce qui ancre ces avancées en perception HRI dans l'écosystème de recherche européen.

RecherchePaper
1 source
Simulateur de monde interactif pour l'entraînement et l'évaluation des politiques de robots
3Robohub 

Simulateur de monde interactif pour l'entraînement et l'évaluation des politiques de robots

Une équipe de recherche présente un simulateur de monde interactif destiné à l'entraînement et à l'évaluation de politiques robotiques, conçu pour remplacer une partie du travail réalisé aujourd'hui sur robot réel. Il s'agit d'un modèle de prédiction vidéo conditionné par l'action, entraîné sans aucun moteur physique intégré : à partir d'une image et d'une séquence d'actions robotiques, le système prédit les frames suivantes directement en pixels. Concrètement, un opérateur peut brancher un dispositif de téléopération et piloter un bras robotique à travers ce modèle appris pendant plus de dix minutes, à 15 images par seconde, sur une seule carte graphique RTX 4090, tout en conservant une vidéo stable et physiquement plausible. Le modèle a été entraîné sur quatre tâches de manipulation aux régimes physiques très différents : le poussage d'un objet en T (contact rigide), le routage d'une corde dans un clip (interaction déformable-rigide), la préhension d'une tasse (dynamique fine de la pince) et le balayage de tas d'objets. L'architecture repose sur deux étapes : un autoencodeur compresse d'abord les images RGB en représentations latentes compactes, puis un modèle de dynamique conditionné par l'action, entraîné dans cet espace latent gelé, prédit les états latents futurs qui sont ensuite décodés en images, de manière autorégressive. L'enjeu dépasse la simple démonstration technique. La collecte de démonstrations et l'évaluation de politiques sur robot réel restent les deux goulots d'étranglement classiques de l'apprentissage robotique : matériel qui casse, éclairage qui varie, objets qui dérivent, chaque nouvelle tâche exigeant des heures de manipulation en laboratoire. Si un simulateur appris atteint un niveau de fidélité suffisant, il devient possible de générer des données d'entraînement à moindre coût directement dans le simulateur, et surtout d'évaluer plusieurs politiques dans des conditions rigoureusement identiques et reproductibles, ce qu'un banc de test physique ne permet pas. Les exemples montrés, comme la distinction correcte entre une corde effectivement insérée dans un clip et une corde qui le frôle sans contact, ou la simulation d'une tasse qui glisse hors de la pince, suggèrent que le modèle capture des dynamiques fines sans recourir à des a priori physiques codés en dur, un point que le secteur observe de près depuis l'essor des modèles VLA (vision-language-action). Cette approche s'inscrit dans une lignée de travaux sur les "world models" appliqués à la robotique, où l'ambition est de remplacer les simulateurs physiques classiques, coûteux à construire et souvent imparfaitement fidèles à la réalité, par des modèles vidéo appris directement à partir de données d'interaction. Le projet met à disposition une démonstration interactive en ligne, jouable au clavier depuis un navigateur, ce qui permet une vérification indépendante des affirmations avancées. Les prochaines étapes attendues par le secteur portent sur le passage à l'échelle vers davantage de tâches et de configurations matérielles, ainsi que sur la démonstration effective que des politiques entraînées dans ce simulateur transfèrent avec succès vers des robots réels, condition encore non confirmée à ce stade par l'article.

RecherchePaper
1 source
Développement d'un prototype de robot humanoïde pour l'interaction homme-robot multimodale
4arXiv cs.RO 

Développement d'un prototype de robot humanoïde pour l'interaction homme-robot multimodale

Des chercheurs présentent un prototype de robot humanoïde conçu comme plateforme de test pour l'interaction homme-robot multimodale, détaillé dans un article publié sur arXiv le 5 septembre 2026. Le système repose sur un mécanisme bimanuel à 12 degrés de liberté et une tête à 2 DOF équipée d'un écran LCD expressif capable de simuler des émotions faciales. L'ensemble du matériel est piloté par une carte contrôleur conçue sur mesure, avec traitement IA embarqué en temps réel via un module Jetson. Trois modules d'intelligence artificielle sont intégrés : reconnaissance gestuelle (MediaPipe Pose combiné à un classifieur LSTM), détection d'objets avec localisation 3D (YOLO), et traitement de commandes vocales par reconnaissance de la parole couplée à un modèle de langage (LLM) pour l'analyse sémantique. Les tests de validation rapportent une erreur moyenne de manipulation d'environ 1,83 cm en précision de positionnement, une précision de tâche globale supérieure à 90%, avec 96% pour la reconnaissance gestuelle et 92% pour la reconnaissance vocale. Ce prototype illustre une tendance de fond dans la recherche robotique : plutôt que de viser des démonstrations spectaculaires, l'accent est mis sur la reproductibilité et l'accessibilité d'une plateforme complète pour l'intégration de modules IA hétérogènes. Pour les laboratoires académiques et les équipes d'intégration disposant de budgets limités, disposer d'une architecture bimanuelle documentée, avec carte de contrôle personnalisée et pipeline multimodal (vision, geste, voix) déjà assemblé, réduit la barrière d'entrée pour prototyper des interactions homme-robot sans dépendre des plateformes commerciales fermées. Les chiffres de précision restent toutefois issus d'un cadre expérimental contrôlé et ne permettent pas de conclure directement sur une robustesse en environnement industriel réel, un point que l'article ne détaille pas davantage. Le projet s'inscrit dans la lignée des travaux académiques sur les robots compagnons et assistants, où l'expressivité faciale et la fusion de plusieurs canaux de perception (vision, geste, parole) sont recherchées pour rendre l'interaction plus naturelle. Contrairement aux humanoïdes commerciaux orientés manipulation industrielle comme Figure 03 ou Optimus, ce prototype cible explicitement la recherche en HRI et le prototypage reproductible plutôt qu'un déploiement en usine. L'article ne précise ni le nom de l'institution porteuse, ni de calendrier de diffusion ou de partenariat industriel, ce qui situe cette publication au stade de la recherche académique plutôt que d'une annonce produit.

RecherchePaper
1 source