Aller au contenu principal
RGB-D pour l'amélioration de la prédiction dans la transmission d'objets humain-robot
RecherchearXiv cs.RO 

RGB-D pour l'amélioration de la prédiction dans la transmission d'objets humain-robot

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

L'équipe à l'origine de l'article publié sur arXiv le 13 août 2026 (arXiv:2608.13028v1) présente Hand2Bot, un jeu de données vidéo RGB-D dédié aux transferts d'objets humain-robot, ainsi que PassGen, un pipeline génératif associé. Hand2Bot capture des scénarios de passation d'objets avec des informations contextuelles riches, posture corporelle et expressions faciales incluses, dans des conditions de bruit capteur réalistes. PassGen s'appuie sur la diffusion vidéo stable (stable vidéo diffusion) combinée à un module appelé Intention-Aware Temporal Face Encoder pour générer des séquences de passation synthétiques cohérentes entre la main et l'objet manipulé. Pour réduire l'écart entre simulation et réel, les chercheurs ont développé une stratégie d'édition de profondeur basée sur la morphologie, qui reproduit le bruit typique des capteurs de profondeur physiques. Les évaluations, menées en étude d'ablation puis en déploiement réel sur une plateforme robotique physique, montrent une forte précision d'identification de l'intention de passation et un faible taux de déclenchements erronés.

Cette avancée cible un verrou concret de la robotique collaborative : la rareté des jeux de données humains à grande échelle pour l'interaction homme-robot, combinée au fossé persistant entre modèles entraînés en simulation et comportements observés sur robot réel. En démontrant qu'un entraînement sur données synthétiques générées par PassGen permet un transfert zero-shot robuste et une anticipation plus précoce de l'intention de passation que les approches classiques centrées sur la main, les auteurs apportent une preuve empirique que la génération vidéo synthétique peut compenser le manque de données réelles annotées, un problème central pour tout intégrateur travaillant sur des tâches de manipulation collaborative en espace partagé.

Le travail s'inscrit dans la lignée des recherches sur la perception d'intention en robotique de collaboration, où les méthodes existantes se limitaient largement à des indices centrés sur la main, sans exploiter le langage corporel ou les expressions faciales du partenaire humain. En intégrant ces signaux sociaux dans le pipeline génératif et en validant l'approche par un déploiement réel plutôt qu'en simulation seule, les auteurs positionnent Hand2Bot et PassGen comme une brique méthodologique reproductible pour la perception sociale robotique, sans toutefois préciser de partenaires industriels, de calendrier de diffusion du jeu de données ou de plans de commercialisation à ce stade.

Dans nos dossiers

À lire aussi

Détection de contact active pour un transfert d'objet robuste de robot à humain
1arXiv cs.RO 

Détection de contact active pour un transfert d'objet robuste de robot à humain

Une équipe de chercheurs propose une méthode de détection de contact active pour fiabiliser les transferts d'objets de robot à humain, publiée en prépublication sur arXiv (2605.04610, mai 2026). Au lieu d'attendre passivement un signal de saisie, le robot génère des micro-mouvements exploratoires et mesure les forces appliquées en retour par l'humain : une saisie ferme produit des forces dans plusieurs directions, un contact accidentel non. Le système repose sur un modèle bayésien linéaire par morceaux qui estime la probabilité de chaque état de contact à partir de ces réponses en force. Testé avec 12 participants sur 30 objets rigides variés, il atteint un taux de succès de 97,5 %, soit plus de 30 points au-dessus des deux approches passives utilisées comme référence. Les applications visées vont du robot d'assistance à domicile (servir un verre) au bloc opératoire (passer un instrument chirurgical). Ce résultat est significatif car la généralisation inter-objets est précisément le point dur des approches passives (tactile, force/couple) : elles peinent à distinguer saisie ferme et contact fortuit face à la diversité des formes, des masses et des comportements humains. L'active sensing force une perturbation contrôlée qui rend les états ambigus séparables. Pour les intégrateurs et les décideurs industriels, l'enjeu est directement lié à la sécurité : dans un environnement collaboratif ou chirurgical, un relâchement prématuré peut causer un incident grave. Un taux de 97,5 % commence à entrer dans la plage exploitable pour des assistants robotiques en conditions réelles, même si le périmètre du test reste limité (objets rigides, 12 sujets, conditions de laboratoire). La question du handover robot-humain est active en recherche depuis plusieurs années, portée notamment par les domaines de l'assistance à la personne et de la chirurgie robotique. Ce papier est une prépublication non encore évaluée par les pairs, et l'abstract ne mentionne ni institution ni partenaire industriel, ce qui rend difficile l'évaluation de sa trajectoire vers un déploiement réel. Aucune intégration commerciale n'est annoncée. Les suites logiques incluent des tests sur objets déformables ou non rigides, une validation en conditions cliniques contrôlées, et une intégration dans des plateformes à retour d'effort comme les cobots ou les mains de robots humanoïdes qui commencent à offrir les interfaces mécaniques nécessaires à ce type de dialogue haptique.

RecherchePaper
1 source
Apprendre de l'humain pour une assistance proactive dans le transport collaboratif homme-robot
2arXiv cs.RO 

Apprendre de l'humain pour une assistance proactive dans le transport collaboratif homme-robot

Une équipe de recherche en robotique présente PROACT, un framework pour le transport collaboratif homme-robot, décrit dans un article arXiv (2609.25351v1) publié en septembre 2026. Le système combine anticipation du comportement humain et contrôle compliant du corps entier d'un robot, via une architecture transformer entraînée sur un vaste jeu de données réel de démonstrations de transport en binôme humain-humain. Ce modèle apprend à prédire le mouvement futur de l'objet transporté à partir du comportement collaboratif observé. Testé sur 108 essais réels avec un manipulateur mobile à 9 degrés de liberté, PROACT réduit le travail d'interaction moyen de 59,2% par rapport à une approche purement compliante, et de 20,4% par rapport à une commande prédictive (MPC) classique. Le temps de complétion moyen baisse de 12,9% et 6,9% respectivement face à ces deux références. Une vidéo des expériences a été mise en ligne pour illustrer les résultats. Le transport collaboratif d'objets lourds ou encombrants reste un problème non résolu en robotique, avec des applications directes en logistique, en manufacturing et à domicile. Jusqu'ici, les approches se scindaient en deux familles incompatibles: des robots efficaces pour déplacer l'objet mais rigides face aux ajustements de l'utilisateur, ou des robots souples et réactifs mais incapables d'agir sans guidage humain constant. En démontrant qu'un seul modèle peut réduire simultanément l'effort physique perçu par l'utilisateur et le temps d'exécution, PROACT apporte une preuve empirique que l'anticipation apprise et la compliance mécanique ne sont pas mutuellement exclusives, un résultat qui intéresse directement les intégrateurs travaillant sur la cobotique industrielle et l'assistance physique. Le travail s'inscrit dans la lignée des recherches sur le contrôle compliant et le model prédictive control appliqués à la manipulation collaborative, deux approches jusque-là traitées séparément dans la littérature. L'apport de PROACT est de fusionner ces deux paradigmes grâce à un modèle appris du comportement humain plutôt qu'à des règles ou une planification pure. L'article ne précise pas de partenariat industriel ni de calendrier de déploiement commercial: il s'agit à ce stade d'un résultat de recherche validé en environnement contrôlé, avec du matériel expérimental, et non d'un produit ou d'un pilote industriel annoncé.

RecherchePaper
1 source
Évaluation de l'état de préhension centrée sur l'humain : transférer l'évaluation subjective aux robots
3arXiv cs.RO 

Évaluation de l'état de préhension centrée sur l'humain : transférer l'évaluation subjective aux robots

Des chercheurs détaillent dans une prépublication arXiv (2609.17540, mise en ligne mi-septembre 2026) un framework qui transféré a un robot le jugement subjectif qu'un humain porte sur la qualité d'une prise appliquée a un objet déformable. Le système associe un modèle vision-langage (VLM), charge de générer semi-automatiquement des labels de supervision, a un prédicteur léger d'état de prise : a partir d'un très petit nombre d'essais annotes manuellement par des humains, utilises comme ancres contextuelles, le VLM propage ce jugement a de larges volumes de données non annotées. Une fois entraine, le prédicteur estime en continu, a partir de mesures tactiles et de force de préhension en série temporelle, si la prise est trop laxiste ou trop serrée, et permet un ajustement rapide de la force en ligne. La méthode a été validée sur trois objets déformables représentatifs, avec une étude d'évaluation humaine réunissant 25 participants charges de juger l'adéquation entre les ajustements du robot et leur propre perception d'une prise appropriée. L'enjeu vise un angle mort connu de la manipulation robotique : saisir un objet déformable (tissu, sac souple, aliment, composant fragile) reste bien plus difficile a automatiser que saisir un objet rigide, car le critère de réussite n'est pas géométrique mais dépend d'un jugement humain qualitatif difficile a formaliser. Les approches de deep learning classiques butent sur ce problème car elles exigent un volume prohibitif d'annotations manuelles pour chaque nouvel objet, ce qui freine leur déploiement dans des environnements industriels varies comme la logistique ou l'agroalimentaire. En réduisant ce besoin d'annotation grâce a un VLM utilise comme générateur de supervision plutôt que comme pilote direct du robot, ce travail illustre une piste distincte de l'approche "VLA de bout en bout" popularisée par des systèmes comme Pi-0, GR00T N2 ou Helix. Ce travail relève de la recherche académique plutôt que d'un produit commercial : il s'agit d'une simple prépublication arXiv, sans partenaire industriel ni déploiement annonce, et les auteurs limitent eux-mêmes leurs conclusions a un cadre expérimental restreint a trois objets. La contribution se positionne comme une brique complémentaire aux modèles de manipulation généralistes actuellement pousses par les laboratoires de robotique humanoïde et industrielle, en ciblant un problème souvent absent des démonstrations grand public : l'ajustement fin de la force de préhension sur des matières molles. Les étapes suivantes attendues pour ce type d'approche consisteraient a étendre la validation a davantage d'objets et de morphologies de robots avant d'envisager un transfert vers des applications industrielles réelles.

RecherchePaper
1 source
Repenser les implications du retour humain pour l'apprentissage des préférences dans la collaboration homme-robot
4arXiv cs.RO 

Repenser les implications du retour humain pour l'apprentissage des préférences dans la collaboration homme-robot

Une équipe de recherche en interaction homme-robot publie sur arXiv (2609.13982) une remise en cause de la méthode standard d'apprentissage des préférences pour le comportement des robots collaboratifs. Cette méthode standard fonctionne en trois étapes : le robot collecte un feedback humain direct limité, généralement binaire (positif ou négatif) ; il en déduit ensuite des étiquettes "acceptée" ou "rejetée" pour des actions faisables mais non choisies, via des règles d'implication fixes préétablies ; puis il met à jour son modèle de récompense avec l'ensemble de ces données. Une étude utilisateur menée sur deux environnements de simulation collaboratifs montre que les étiquettes d'implication réellement données par les humains divergent souvent de ce que prédit la règle fixe, et que l'usage des étiquettes humaines réelles améliore nettement l'apprentissage de récompense avec l'algorithme PIE (Preference Learning from Implicit and Explicit Feedback). Les chercheurs proposent en réponse IMPLIED, une méthode qui utilise la règle fixe comme simple point de départ tout en apprenant à inférer et corriger les étiquettes au fil des interactions. Testée sur des trajectoires d'interaction homme-robot enregistrées ainsi que sur une étude avec un robot physique préparant des pizzas, IMPLIED prédit les implications humaines plus fidèlement que la règle fixe et que des références basées sur des LLM, en se rapprochant des performances d'un oracle utilisant directement des étiquettes humaines. Ce résultat questionne une hypothèse implicite largement répandue dans la conception des systèmes de robots collaboratifs : que des règles logiques figées suffisent à extrapoler les préférences humaines au-delà du feedback explicite donné. Pour les concepteurs de robots d'assistance ou de cobots industriels, cela signifie que les modèles de récompense actuels risquent de mal interpréter systématiquement l'intention des opérateurs sur les actions non directement évaluées, ce qui peut se traduire par un comportement robotique perçu comme irrationnel ou mal aligné en situation réelle de collaboration. En réduisant l'erreur d'estimation des préférences, IMPLIED promet des robots capables de s'adapter plus vite et plus fidèlement à un opérateur humain sans multiplier les sollicitations de feedback, un enjeu direct pour l'efficacité des déploiements en environnement partagé homme-robot. Le travail s'inscrit dans la lignée des approches d'apprentissage de préférences par renforcement inverse appliquées à la robotique collaborative, où l'algorithme PIE sert de référence pour combiner feedback explicite et implicite. En comparant IMPLIED à la fois à la règle fixe classique et à des références utilisant des grands modèles de langage, les auteurs positionnent leur méthode comme une alternative apprise et adaptative aux heuristiques statiques du domaine. La validation combine environnements simulés et un cas d'usage physique concret de fabrication culinaire, suggérant une voie vers une intégration future dans des architectures de robots collaboratifs déployés en usine ou en environnement de service.

RecherchePaper
1 source