Aller au contenu principal
PartialBiGrasp : déduire la géométrie locale cachée pour la préhension bimanuelle à partir de vues partielles
RecherchearXiv cs.RO 

PartialBiGrasp : déduire la géométrie locale cachée pour la préhension bimanuelle à partir de vues partielles

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs ont publié PartialBiGrasp, un système de génération de prises bi-manuelles conçu pour fonctionner directement à partir de nuages de points partiels plutôt que d'une géométrie complète de l'objet. L'article, mis en ligne sur arXiv sous la référence 2608.19188v1, s'attaque à la préhension à deux bras pour les objets volumineux, lourds ou de forme complexe qu'un seul manipulateur ne peut saisir de manière fiable. Le modèle s'appuie sur des réseaux d'occupation convolutionnels pour apprendre implicitement des propriétés géométriques locales, comme l'épaisseur d'une surface, la structure des bords ou le dégagement nécessaire pour les pinces, sans disposer d'un modèle 3D complet de l'objet. À partir de cette représentation, PartialBiGrasp génère des paires de prises respectant le critère de fermeture de force, puis les affine par une optimisation basée sur l'échantillonnage afin de corriger les ambiguïtés issues d'une géométrie incomplète. Les auteurs valident l'approche via des métriques analytiques de fermeture de force, des simulations à grande échelle, et des essais réels sur robot avec des nuages de points bruités et partiels d'objets inédits, obtenant des prises bi-manuelles physiquement stables.

L'intérêt pratique tient au fait que les méthodes de préhension bi-manuelle existantes supposaient un accès à un nuage de points complet de l'objet, une hypothèse rarement tenable hors laboratoire, où une caméra unique, des occlusions ou des angles de vue limités ne livrent qu'une observation partielle. En démontrant des prises stables sans reconstruction 3D exhaustive, ces travaux réduisent la dépendance à des configurations de capture multi-caméras coûteuses, un facteur clé pour les intégrateurs logistiques ou industriels qui manipulent cartons volumineux, meubles ou pièces encombrantes avec des bras doubles ou des cellules robotisées. Cela va dans le sens d'un rapprochement entre les démonstrations académiques et les conditions réelles de perception, plutôt que d'ajouter une nouvelle promesse de rupture technologique.

Le travail s'inscrit dans la continuité de la recherche en préhension robotique, où la génération de prises à partir de géométrie observée reste un axe actif, la préhension bi-manuelle constituant une extension plus récente et plus exigeante que la préhension mono-bras classique. L'abstract ne mentionne ni acteur industriel, ni pilote de déploiement, ni calendrier commercial: il s'agit à ce stade d'une contribution de recherche académique, évaluée en simulation et sur banc robotique, sans indication d'intégration produit annoncée.

Dans nos dossiers

À lire aussi

Latents de mouvement sensibles à la géométrie pour des politiques de manipulation robustes
1arXiv cs.RO 

Latents de mouvement sensibles à la géométrie pour des politiques de manipulation robustes

Ils entraînent GeoMoLa (Geometry-Aware Motion Latents) en prédisant l'évolution de nuages de points plutôt qu'en reconstruisant des images, pour capturer les transformations géométriques 3D sous-jacentes aux gestes de manipulation. Contrairement aux approches existantes qui nécessitent une reconstruction multi-vues, GeoMoLa atteint des performances état de l'art avec une seule caméra RGB-D en entrée. Les auteurs valident la méthode sur plusieurs bancs d'essai de manipulation robotique standards, ainsi que sur des expériences en conditions réelles, où le système parvient à manipuler des objets dans des environnements encombrés avec un nombre minimal de démonstrations. Leurs études d'ablation confirment que c'est la prédiction géométrique, et non la richesse visuelle, qui pilote la performance du modèle. Ce résultat pèse sur un débat central de la robotique manipulative actuelle: faut-il apprendre le mouvement à partir de motifs visuels (pixels, textures, apparence) ou à partir de la géométrie sous-jacente de la scène (formes, profondeur, déplacement des points dans l'espace)? En montrant que des latents entraînés sur la géométrie 4D (espace + temps) généralisent à des scènes visuellement inédites tout en produisant des transformations physiquement cohérentes, l'étude apporte un argument empirique en faveur d'une abstraction du mouvement indépendante de l'apparence. Pour les équipes qui développent des politiques de manipulation type VLA (vision-language-action) destinées à des bras robotiques ou des humanoïdes, cela suggère une voie pour réduire la dépendance à des configurations multi-caméras coûteuses, tout en gagnant en robustesse face au bruit visuel et au clutter, un problème récurrent des déploiements industriels réels. Cette recherche s'inscrit dans la lignée des travaux sur les représentations latentes discrètes pour le contrôle robotique, où plusieurs équipes académiques cherchent depuis quelques années à dépasser les limites des politiques purement pixel-to-action, jugées fragiles hors distribution. L'approche par nuages de points 4D rejoint des efforts plus larges en robotique combinant perception 3D (depth, LiDAR, RGB-D) et apprentissage de politiques, un axe également exploré par des laboratoires travaillant sur les modèles VLA généralistes comme Pi-0 ou GR00T N2. Le papier, publié sur arXiv début juillet 2026, ne précise pas de partenariat industriel ni de déploiement commercial: il s'agit à ce stade d'une contribution de recherche fondamentale, dont la prochaine étape naturelle serait une validation à plus grande échelle sur des plateformes robotiques commerciales.

RecherchePaper
1 source
Prédire la distribution des forces de contact à partir de la vision en exploitant les a priori de géométrie des objets
2arXiv cs.RO 

Prédire la distribution des forces de contact à partir de la vision en exploitant les a priori de géométrie des objets

Une équipe de recherche a publié le 1er août 2026 sur arXiv (référence 2608.00464) un modèle qui prédit la distribution tridimensionnelle des forces de contact à partir d'une seule image RGB, appliqué à des scènes d'objets du quotidien empilés en vrac. Pour entraîner ce système, les auteurs ont d'abord généré des données appariées vision-force via un simulateur de corps rigides classique en robotique, un outil qui produit normalement des forces ponctuelles bruitées et peu exploitables telles quelles. Leur idée centrale consiste à lisser statistiquement ces forces ponctuelles pour obtenir des distributions continues, plus proches de la façon dont un humain anticipe intuitivement le comportement physique d'une pile d'objets. Ils vont plus loin en intégrant la géométrie de chaque objet dans ce processus de lissage, afin de tenir compte des variations d'état de contact selon la forme des pièces. Le modèle a été évalué à la fois en simulation et sur des scènes réelles, alors qu'il n'a jamais été entraîné que sur des données synthétiques. L'enjeu dépasse la simple précision de prédiction : il touche directement au problème classique du transfert sim-to-real, l'un des principaux points de friction pour rendre la manipulation robotique fiable hors laboratoire. Un robot capable d'anticiper visuellement où et comment les forces se répartissent dans une pile d'objets peut ajuster sa stratégie de préhension avant même le contact, ce qui intéresse directement les intégrateurs travaillant sur le tri, le bin-picking ou la logistique en environnement non structuré. Les résultats indiqués montrent que le lissage améliore non seulement la prédiction elle-même, mais aussi la performance sur les tâches en aval, et que le guidage par géométrie apporte un gain supplémentaire, ce qui suggère que la représentation du signal cible compte autant que l'architecture du modèle. Ce travail s'inscrit dans un courant de recherche plus large sur l'estimation de propriétés physiques à partir de la seule vision, sans capteurs de force embarqués coûteux. Il reste à ce stade une contribution académique, sans déploiement industriel annoncé ni partenaire cité, et les prochaines étapes attendues concernent probablement l'extension à des géométries d'objets plus variées et des scénarios de manipulation plus complexes.

RecherchePaper
1 source
Cadre de contrôle par vision monoculaire pour la préhension
3arXiv cs.RO 

Cadre de contrôle par vision monoculaire pour la préhension

Des chercheurs présentent un système de préhension robotique piloté uniquement par une caméra RGB monoculaire, capable de manipuler aussi bien des objets rigides que déformables avec un seul pipeline de contrôle, sans capteur tactile ni pince spécialisée. Le framework combine détection d'objets en vocabulaire ouvert, segmentation d'image, assignation de points sensible aux contours, suivi de points en temps réel et estimation de profondeur monoculaire pour reconstruire la géométrie et le mouvement des objets à partir de la seule vision. Son élément central est un modèle qui estime la raideur attendue d'un objet à partir de sa description sémantique, fournissant un a priori pour choisir la stratégie de préhension avant tout contact. Pour les objets déformables, l'adaptation de la prise s'appuie sur une mesure de dissimilarité de type Procrustes calculée sur des points-clés suivis, utilisée comme indicateur visuel de déformation. Pour les objets rigides, l'écartement de la pince est réglé par la mise à l'échelle des distances entre points suivis. Le système a été testé sur un bras Franka Emika Research 3, en conditions réelles de prise et dépose, sur de la salade, de la mozzarella fraîche, des croissants, du papier essuie-tout et des bouteilles en plastique rigide. L'intérêt pratique tient à l'unification: la plupart des approches existantes traitent séparément le rigide et le souple, en s'appuyant souvent sur des capteurs tactiles, des modèles spécifiques par objet ou des pinces dédiées. Démontrer une préhension stable sur les deux catégories avec une seule pipeline vision, sans tactile, ouvre une piste économique et généralisable pour la manutention alimentaire et la manipulation domestique, deux domaines où la variabilité des objets rend coûteuse toute solution sur mesure. Le travail s'inscrit dans la lignée des recherches en préhension robotique cherchant à réduire la dépendance au capteur tactile au profit de la vision seule, à l'heure où les modèles vision-langage-action gagnent en popularité pour la manipulation généraliste. Les auteurs positionnent leur approche comme une alternative sensor-efficient à ces pipelines multimodaux plus lourds, la validation restant pour l'instant limitée à un jeu restreint d'objets en laboratoire.

RecherchePaper
1 source
DEAL-Grasp : représentation d'alignement découplée pour une préhension dextérique tenant compte de la géométrie
4arXiv cs.RO 

DEAL-Grasp : représentation d'alignement découplée pour une préhension dextérique tenant compte de la géométrie

Publié sur arXiv le 24 septembre 2026 sous la référence 2609.28131, l'article présente DEAL-Grasp, une méthode de génération de prises dextres pour mains articulées, robotiques ou virtuelles, destinée à la réalité virtuelle, l'intelligence incarnée et les humains numériques. Plutôt que de mélanger mouvement rigide global et articulation des doigts dans un même espace comme le font les méthodes existantes, ce qui produit des contacts instables et physiquement implausibles, DEAL-Grasp sépare les deux : la pose de la main est recalculée par un alignement de Procrustes en forme close, sans optimisation itérative, tandis que l'articulation des doigts est préservée. La génération repose sur du flow matching avec régularisation physique pendant l'entraînement, sans optimisation ni guidage physique requis à l'inférence. Sur les benchmarks MultiDex et RealDex, ce dernier testé en zero-shot, la méthode affiche un fort taux de réussite sous perturbation de force, une pénétration minimale entre main et objet, une grande diversité de prises générées, et une latence d'inférence nettement inférieure aux méthodes concurrentes fondées sur l'optimisation. Ce résultat s'attaque à un vrai goulot d'étranglement de la manipulation robotique et de l'animation numérique : la plupart des générateurs de prises dextres nécessitent une optimisation physique coûteuse après génération pour corriger des contacts aberrants, ce qui freine leur usage en temps réel. En supprimant cette étape grâce à un calcul en forme close, DEAL-Grasp réduit la latence, un atout pour la téléopération, la simulation et les mains robotiques multi-doigts des humanoïdes. Cela confirme la montée du flow matching comme alternative à la diffusion pour générer des comportements robotiques rapides et physiquement plausibles. Les résultats restent toutefois limités à des benchmarks académiques et à la simulation ; rien n'indique à ce stade un déploiement sur robot physique. Le travail s'inscrit dans la lignée des méthodes de synthèse de prises par régression ou diffusion, qui couplent pose globale et articulation et recourent à une optimisation physique post-hoc ou à un guidage auxiliaire pour stabiliser les contacts, une contrainte que DEAL-Grasp cherche précisément à éliminer. Il rejoint aussi la tendance à l'adoption du flow matching dans les politiques de contrôle robotique, technique également employée par des modèles VLA comme Pi-0. MultiDex et RealDex servent de bancs d'essai standards du domaine. Publié comme preprint non encore évalué par les pairs, avec code et page projet en ligne, le travail n'annonce pour l'instant aucune validation sur mains robotiques physiques ni calendrier de déploiement.

RecherchePaper
1 source