Aller au contenu principal
RecherchearXiv cs.RO 

Perception à basse résolution pour la préhension robotique en entrepôt

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs publient sur arXiv (référence 2608.25874v1) un article consacré à la perception robotique pour le rangement d'objets en caisse, ou "bin packing", à partir de capteurs de profondeur bas coût et basse résolution. Le système articule deux mécanismes: une stratégie de sélection de la prochaine vue optimale (Next Best View) qui pilote la reconstruction 3D de la scène en évitant les prises de vue redondantes tout en préservant la géométrie utile à la tâche, et un estimateur de stabilité par objet mis à jour à partir des preuves de préhension recueillies pendant la manipulation. Les auteurs valident l'approche en deux temps: une étude d'ablation de la fonction d'utilité testée en très basse résolution, puis une évaluation de bout en bout comparant plusieurs politiques de perception et de saisie.

L'enjeu dépasse la démonstration académique. La perception robotique industrielle s'appuie généralement sur des caméras RGB-D haute résolution, coûteuses et gourmandes en calcul, ce qui freine le déploiement à grande échelle dans la logistique et l'emballage. En montrant qu'une politique de vision active peut maintenir des performances de saisie correctes avec des capteurs bas de gamme, ce travail cible les intégrateurs cherchant à réduire le coût matériel par poste robotisé, facteur clé de rentabilité pour les cellules de "pick and pack" en entrepôt. Il illustre une tendance du secteur à déplacer l'intelligence vers le logiciel, planification et politiques adaptatives, plutôt que vers un capteur toujours plus précis.

Ce travail prolonge une lignée de recherche en planification de vue et manipulation guidée par la perception, active depuis plusieurs années en robotique et vision par ordinateur. Publié comme preprint arXiv sans affiliation industrielle précisée dans le résumé, il n'a pas encore été relu par les pairs ni testé en entrepôt réel; les résultats rapportés restent circonscrits à des évaluations en laboratoire ou en simulation, selon les pratiques usuelles de ce type de publication. Les suites attendues sont une validation sur du matériel physique varié et une comparaison directe avec des capteurs RGB-D haut de gamme déjà utilisés en production.

Dans nos dossiers

À lire aussi

REPAIR-Bench : benchmark pour la perception des erreurs et la reprise d'interaction en robotique
1arXiv cs.RO 

REPAIR-Bench : benchmark pour la perception des erreurs et la reprise d'interaction en robotique

Une équipe de chercheurs a publié REPAIR-Bench (Robot Error Perception And Interaction Recovery Benchmark), un jeu de données et de tâches d'évaluation conçu pour mesurer comment les utilisateurs humains perçoivent les pannes robotiques et y répondent. Le benchmark repose sur 214 essais d'interaction impliquant 41 participants exposés à quatre types de défaillances induites. Pour chaque session, les chercheurs ont capturé des données multimodales synchronisées : unités d'action faciale (AU), posture de la tête, transcriptions vocales, ainsi que des rapports d'affect et de stratégies de récupération recueillis après interaction. Trois tâches d'évaluation inédites structurent le benchmark : la détection de pannes sur des sessions interdépendantes (pour modéliser l'adaptation longitudinale de l'utilisateur), la classification visuelle du type de défaillance au-delà du simple binaire succès/échec, et la prédiction de stratégie de récupération centrée utilisateur. En baseline, un modèle récurrent hiérarchique atteint un F1 strict de 0,80 contre 0,68 pour un modèle mono-session, avec une erreur signée moyenne de -0,51 s et une erreur absolue médiane de 2,97 s pour la localisation temporelle des pannes. Pour la prédiction de récupération, un Mistral-7B affiné par QLoRA obtient Hit@5 = 0,76 et F1@5 = 0,32. L'intérêt scientifique de REPAIR-Bench tient à ce qu'il rompt avec trois limites persistantes de la littérature en interaction humain-robot (HRI) : le traitement des défaillances comme des événements isolés, la réduction de la détection à une décision binaire, et la modélisation de la récupération par des règles figées. En intégrant la dimension longitudinale, le benchmark permet de modéliser comment un utilisateur adapte progressivement son comportement face à des défaillances répétées, un phénomène documenté mais rarement instrumenté à cette échelle. Pour les équipes qui déploient des robots de service ou médicaux, c'est un signal concret : la robustesse perçue n'est pas seulement une propriété technique du système, mais une fonction de l'historique d'interaction. Le benchmark ouvre aussi la voie à des systèmes de récupération adaptatifs pilotés par les préférences inférées de l'utilisateur, plutôt que par des arbres de décision codés à la main, ce qui est pertinent pour les intégrateurs qui cherchent à réduire la charge cognitive des opérateurs. Ce travail s'inscrit dans un champ de recherche en expansion sur la fiabilité perçue des robots autonomes, accéléré par la multiplication des déploiements en contexte médical et industriel où une panne mal gérée peut rompre la confiance de façon durable. Les approches précédentes, comme les travaux sur la détection d'anomalies en manipulation ou les études d'affect en HRI, restaient souvent cloisonnées ; REPAIR-Bench propose un cadre unifié couvrant le cycle de vie complet de la défaillance. Le benchmark est publié sur arXiv (2606.29937) et cible explicitement les communautés HRI et HRI médicale. Les prochaines étapes naturelles incluent l'extension à des plateformes robotiques variées (bras manipulateurs, robots mobiles, humanoïdes) et l'évaluation de modèles de langage multimodaux en temps réel comme superviseurs de récupération, une piste que les résultats Mistral-7B rendent crédible sans pour autant la valider à l'échelle.

RecherchePaper
1 source
RoboDesign1M : un jeu de données à grande échelle pour la compréhension de la conception robotique
2arXiv cs.RO 

RoboDesign1M : un jeu de données à grande échelle pour la compréhension de la conception robotique

Le dataset RoboDesign1M rassemble un million d'échantillons multimodaux consacrés à la conception de robots, extraits automatiquement de la littérature scientifique couvrant plusieurs domaines de la robotique. Les auteurs ont mis au point un pipeline de collecte semi-automatisé permettant d'agréger efficacement des données diverses (texte et images) issues de publications existantes, plutôt que de les créer manuellement. Pour valider l'utilité du corpus, l'équipe a mené des expériences sur trois tâches distinctes : la génération d'images de conception robotique, la réponse à des questions visuelles portant sur des schémas de conception, et la recherche d'images de conception à partir de requêtes. Les résultats montrent que ce jeu de données constitue un nouveau benchmark exigeant pour ces tâches de compréhension du design. Le dataset sera rendu public, avec une page de projet dédiée (airvlab.github.io/robotdesign1m). Il s'agit d'une version mise à jour d'un article déposé sur arXiv (2503.06796), initialement publié en mars puis révisé. Ce travail cible un goulot d'étranglement méthodologique plutôt qu'un produit commercial : la conception mécanique d'un robot reste un processus long, coûteux et dépendant d'une expertise rare, et les modèles de fondation qui pourraient l'automatiser manquaient jusqu'ici de données d'entraînement à grande échelle sur ce sujet précis. En fournissant un million d'exemples annotés, RoboDesign1M ouvre la voie à des assistants IA capables de proposer des pistes de conception, de retrouver des schémas existants à partir d'une description textuelle, ou de générer des visualisations de composants robotiques. Pour les laboratoires de recherche et les équipes R&D en robotique, c'est surtout un instrument de mesure standardisé qui manquait pour comparer objectivement les approches de génération et de compréhension de designs. Le projet s'inscrit dans la tendance plus large d'application des modèles de fondation multimodaux à des domaines d'ingénierie spécialisés, après leur succès en vision et en langage naturel. La rareté des jeux de données de conception robotique freinait jusqu'à présent ce transfert, contrairement à des domaines comme la manipulation ou la navigation qui disposent déjà de corpus massifs. La mise à disposition publique annoncée par les auteurs devrait permettre à d'autres équipes de recherche de reproduire et d'étendre ces travaux, sans toutefois que des applications commerciales concrètes ou des partenariats industriels n'aient été mentionnés à ce stade.

RecherchePaper
1 source
Réception centrée sur le destinataire pour la remise robot-humain avec orientation d'objet sensible à la préhension
3arXiv cs.RO 

Réception centrée sur le destinataire pour la remise robot-humain avec orientation d'objet sensible à la préhension

Des chercheurs ont présenté un système de transmission d'outils robot-humain centré sur le receveur, piloté par la voix, construit sur un bras collaboratif Franka Emika à sept degrés de liberté, plateforme cobot largement utilisée en recherche robotique. Le système combine un grand modèle de langage (LLM) pour la reconnaissance d'intention, c'est-à-dire comprendre quel outil l'opérateur demande et comment il compte le saisir, avec MediaPipe pour le suivi 3D de la main en temps réel. À partir de ces données, l'effecteur terminal ajuste dynamiquement son orientation pour présenter l'outil poignée en avant, dans une pose jugée ergonomiquement optimale, plutôt que dans une orientation fixe prédéfinie. Les auteurs ont mené une étude intra-sujets comparant cette approche adaptative à une référence statique agnostique à l'objet, sur des outils industriels asymétriques, ceux dont la forme rend la prise malaisée si l'orientation de présentation ne correspond pas à la façon naturelle de les empoigner. Les résultats indiquent que le système adaptatif réduit le délai de préhension pour ces outils asymétriques et améliore la fluidité de l'interaction, ainsi que certaines perceptions liées à la confiance, notamment la prévisibilité du mouvement et la simplicité perçue de la tâche. L'abstract ne détaille pas de chiffres précis (nombre de participants, pourcentage de gain), ce qui invite à la prudence sur l'ampleur réelle de l'effet. L'enjeu dépasse le confort ponctuel: la transmission d'outils est une micro-interaction sécuritaire critique dans les cellules collaboratives humain-robot, et les systèmes statiques actuels, qui ignorent la géométrie de l'objet, produisent régulièrement des prises maladroites voire dangereuses avec des outils asymétriques comme des tournevis ou des pinces. Pour les intégrateurs industriels et les concepteurs de cobots, cette étude illustre une piste concrète pour fiabiliser les interactions main-à-main sur ligne de production, en s'appuyant sur des briques déjà matures, LLM pour l'intention, vision par ordinateur pour le suivi de main, plutôt que sur des capteurs dédiés coûteux. Le travail s'inscrit dans un champ de recherche actif sur le handover robot-humain, où les approches précédentes reposaient surtout sur la vision pour estimer la pose de préhension sans intégrer la voix ni une compréhension sémantique de l'intention via LLM. Le choix du bras Franka, standard de facto dans les laboratoires académiques, facilite la reproductibilité mais souligne aussi le stade encore expérimental de la démonstration, un preprint arXiv sans mention de déploiement industriel ni de partenaire commercial. Les suites logiques attendues seraient une validation sur un plus large panel d'outils et d'opérateurs, ainsi qu'une soumission à une conférence en robotique ou interaction humain-robot.

RecherchePaper
1 source
Un système robotique de perception-manipulation pour la découpe alimentaire
4arXiv cs.RO 

Un système robotique de perception-manipulation pour la découpe alimentaire

Une équipe de recherche publie sur arXiv (juillet 2026) un système de perception et manipulation robotique dédié à la découpe alimentaire, l'une des tâches les plus délicates pour les robots de cuisine. Le système combine deux modules : un premier de sélection du couteau, qui s'appuie sur les données de force capturées lors d'une coupe d'essai fixe pour identifier automatiquement l'outil adapté à l'aliment présenté, et un second de découpe adaptative piloté par apprentissage par renforcement (RL), qui ajuste en continu la trajectoire pour équilibrer vitesse de coupe et consommation d'énergie. Dans les expériences menées par les auteurs, le module de sélection de couteau atteint un taux de réussite de 100% sur des aliments jamais vus à l'entraînement, et les chercheurs comparent trois approches, une politique fixe préprogrammée, la politique RL, et des opérateurs humains, sur les mêmes tâches de découpe. L'enjeu dépasse la simple démonstration technique. La découpe alimentaire est réputée difficile à automatiser car les propriétés mécaniques des aliments, texture, dureté, élasticité, varient énormément d'un ingrédient à l'autre, ce qui oblige souvent à changer d'outil et de stratégie de coupe en cours de préparation. En obtenant des performances comparables à celles d'opérateurs humains, tout en automatisant le choix de l'outil via un simple test de force, cette approche adresse un goulot d'étranglement concret pour les robots de cuisine commerciaux, qu'il s'agisse de restauration automatisée, de traitement agroalimentaire ou de cuisine domestique assistée. Ce travail s'inscrit dans un courant de recherche plus large sur les robots de cuisine, un segment encore largement expérimental où la plupart des démonstrations restent limitées à des gestes simples ou répétitifs. Contrairement à une annonce produit, il s'agit ici d'un article de recherche, sans mention de partenaire industriel ni de calendrier de commercialisation. Les auteurs eux-mêmes cadrent leurs résultats comme une preuve de concept, ouvrant la voie à des tests sur une gamme plus large d'aliments et, potentiellement, à une intégration future dans des systèmes robotiques de cuisine plus complets.

RecherchePaper
1 source