Aller au contenu principal
PHANES AI intègre le toucher aux modèles fondation de robots : TouchWorld, un modèle tactile pour la manipulation dextérique
IA physiquePandaily 

PHANES AI intègre le toucher aux modèles fondation de robots : TouchWorld, un modèle tactile pour la manipulation dextérique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

PHANES AI, start-up fondée par Yang Shuo, professeur à l'Institut de technologie de Harbin (campus de Shenzhen), a publié un nouveau modèle de fondation tactile baptisé TouchWorld, conçu pour la manipulation dextre en robotique. L'objectif est de combler une faille des modèles vision-langage-action (VLA) actuels: ceux-ci peuvent voir qu'un doigt robotique touche un bouton, mais ne peuvent pas savoir s'il a réellement été enfoncé. TouchWorld attribue au toucher un double rôle. En mode prédictif, avant d'exécuter une action, le modèle anticipe non seulement l'image visuelle attendue en fin de sous-tâche, mais aussi une carte tactile précisant quel doigt devrait ressentir une pression, à quel endroit et avec quelle intensité, une référence physique que la vision seule ne peut fournir. En mode réactif, une fois le contact établi, le modèle lit en continu les signaux tactiles et l'état des articulations pour appliquer des micro-corrections de position, de force de préhension et d'angle du poignet, sans nécessiter une replanification par la politique de haut niveau. Sur six tâches réelles (arrosage de plantes, nettoyage de table, insertion de prise, insertion de tasse, récurage de poêle, prise de mouchoir), TouchWorld atteint 65,0% de réussite en conditions normales et 57,2% en présence de perturbations comme le déplacement de la cible ou une interférence de préhension, soit 15,7 et 16,0 points de plus que la meilleure référence testée. Chaque tâche a été entraînée sur 200 trajectoires de téléopération et évaluée sur 100 essais robotiques réels.

Cette approche répond à un problème concret pour l'industrie: les modèles VLA actuels échouent souvent en silence lorsqu'un contact physique ne se passe pas comme prévu, un angle mort critique pour des applications comme l'assemblage de précision ou la manipulation d'objets fragiles. En traitant le signal tactile comme un flux séparé plutôt que comme une modalité fondue dans le pipeline visuel, PHANES AI défend l'idée que la densité d'information et la vitesse de traitement du toucher sont trop différentes de celles de la vision pour partager une même architecture sans que le signal tactile ne soit noyé. Si les résultats se confirment à plus grande échelle, ce découplage pourrait devenir un standard pour les robots humanoïdes ou les bras industriels appelés à manipuler des objets déformables ou mal positionnés, un domaine où la démonstration en laboratoire peine souvent à se traduire en fiabilité réelle.

Yang Shuo, né en 1998, est déjà professeur titulaire et directeur de thèse à HIT Shenzhen, l'un des plus jeunes professeurs titulaires de Chine. Lauréat de la bourse doctorale Google (un des neuf récipiendaires mondiaux) et finaliste du prix du meilleur article à ICLR, il est rentré en Chine à 26 ans pour fonder PHANES AI, qui réunit désormais une équipe couvrant les données, la modélisation, le contrôle robotique et le matériel. L'entreprise s'inscrit dans une compétition mondiale sur les modèles de fondation pour la manipulation dextre, aux côtés d'acteurs comme les équipes derrière Pi-0 ou GR00T N2, avec pour différenciation affichée le traitement natif du signal tactile plutôt qu'un simple ajout de capteurs.

À lire aussi

Genesis AI introduit GENE-26.5, un modèle pour une manipulation robotique plus dextérique
1Robotics Business Review 

Genesis AI introduit GENE-26.5, un modèle pour une manipulation robotique plus dextérique

Genesis AI, startup californienne fondée par Zhou Xian et basée à San Carlos, a dévoilé GENE-26.5, un modèle fondamental d'IA conçu pour la manipulation robotique dextre bimanuelle. Sortie de stealth l'an dernier avec une levée de 105 millions de dollars, l'entreprise annonce avoir résolu le principal verrou du secteur : le manque de données d'entraînement pour les tâches à haute dextérité. GENE-26.5 repose sur deux composants propriétaires : un moteur de données à grande échelle et une main robotique dimensionnée à l'échelle humaine, couplée à un gant de collecte doté d'une peau électronique tactile. Ce gant permet une correspondance 1:1:1 entre la main du démonstrateur, le gant et l'effecteur robotique, facilitant le transfert direct de compétences humaines vers le robot sans recodage. Pour illustrer les capacités du modèle, Genesis AI a publié des vidéos montrant la réalisation d'une recette en 20 étapes (découpe de tomates, cassage d'oeuf à une seule main, coordination bimanuelle), la préparation d'un smoothie avec service en vol, des expériences de laboratoire impliquant pipetage et transferts de liquides, du câblage de faisceaux électriques, la résolution d'un Rubik's Cube en manipulation aérienne, la préhension simultanée de quatre objets de tailles différentes, et l'interprétation d'une composition pianistique complexe. L'enjeu industriel est direct : le câblage de faisceaux électriques, désigné par l'entreprise comme "l'une des tâches les plus difficiles en électronique", représente des milliers de postes non automatisés dans les secteurs automobile et aérospatial, faute de robots capables de gérer la variabilité géométrique des fils. Si les performances démontrées se confirment hors conditions de laboratoire contrôlées - ce que des vidéos promotionnelles soigneusement sélectionnées ne permettent pas d'établir -, cela ouvrirait un marché significatif pour les intégrateurs cherchant à robotiser des tâches à haute variabilité morphologique. L'approche de Genesis AI vise à combler l'"embodiment gap" : l'écart de morphologie entre humain et robot qui a historiquement limité l'efficacité des modèles entraînés sur données humaines. L'investissement d'Eric Schmidt, ex-PDG de Google, dans la société souligne l'intérêt stratégique croissant pour ce segment au-delà du seul milieu robotique. Genesis AI s'inscrit dans une course à la manipulation dextre où plusieurs acteurs avancent en parallèle : Physical Intelligence avec son modèle Pi-0, Sanctuary AI et les équipes manipulation de Figure (Figure 03) et Tesla (Optimus Gen 3) développent également des architectures de type VLA (Vision-Language-Action) pour le contrôle fin des effecteurs. Genesis AI se distingue en concentrant son offre exclusivement sur la main et la manipulation bimanuelles, sans plateforme humanoide annoncée à ce stade. Le communiqué reste toutefois vague sur les suites opérationnelles : aucun pilote industriel nommé, aucune timeline de déploiement ni tarification n'est communiqué, ce qui place cette annonce clairement du côté de la démonstration technologique plutôt que du produit commercialisé.

IA physiqueOpinion
1 source
TouchWorld : un modèle fondation tactile, prédictif et réactif, pour la manipulation dextérique
2arXiv cs.RO 

TouchWorld : un modèle fondation tactile, prédictif et réactif, pour la manipulation dextérique

Une équipe de recherche présente TouchWorld, un modèle fondationnel tactile conçu pour la manipulation dextre, dans un article publié sur arXiv (2607.07287v1) début juillet 2026. Le système repose sur une politique hiérarchique en trois couches : une couche de planification vision-langage qui découpe la tâche en sous-objectifs et prédit des sous-buts tactiles, une politique visuo-tactile conditionnée par objectif qui génère des séquences d'actions nominales, et une politique de raffinement conditionnée par le toucher qui corrige en temps réel à partir du retour tactile et proprioceptif haute fréquence. Évalué sur six tâches de manipulation dextre longues et riches en contacts, TouchWorld atteint 65,0% de réussite en conditions propres et 53,7% sous perturbations humaines, soit 15,7 et 18,5 points de plus que la meilleure référence testée. L'apport principal tient à la séparation des échelles de temps : la plupart des politiques existantes traitent le toucher comme un simple flux d'observation basse fréquence, mélangé dans la même boucle que le raisonnement de tâche et la génération d'action. TouchWorld découple ce retour rapide (glissement, désalignement, force, stabilité de prise) du raisonnement sémantique lent porté par la vision et le langage. Pour les intégrateurs et chercheurs en robotique, cela répond directement à une limite connue des architectures vision-langage-action : leur capacité de généralisation sémantique ne suffit pas à gérer les micro-corrections de contact nécessaires en manipulation fine, un écart souvent cité entre démonstrations impressionnantes et robustesse réelle en conditions perturbées. L'article s'inscrit dans la lignée des travaux récents sur les modèles de fondation tactiles et les politiques visuo-tactiles pour la robotique, un axe de recherche encore jeune comparé aux modèles vision-langage-action purement visuels. Les auteurs ne précisent pas d'affiliation ni de calendrier de déploiement dans le résumé ; il s'agit à ce stade d'un travail de recherche évalué en environnement contrôlé, sans indication de transfert vers un produit ou un déploiement industriel.

RecherchePaper
1 source
Facet-0 : un modèle fondation robotique pour la manipulation précise en contact riche
3arXiv cs.RO 

Facet-0 : un modèle fondation robotique pour la manipulation précise en contact riche

Un preprint publié sur arXiv (2609.01596) présente Facet-0, un modèle de fondation robotique pour l'assemblage de précision à tolérance sous-millimétrique, capable de prédire et d'évaluer les conséquences de contact de ses actions. Par flow matching, il génère chaque segment de mouvement avec le profil de force au poignet attendu, aligné sur l'historique des forces, la sémantique vision-langage et l'état cinématique, puis affine sa politique grâce à un critique distributionnel entraîné sur les déploiements réels et des récompenses ciblant les interactions de contact décisives. Entraîné sur ManuFacet-1K, un corpus de 1 000 heures synchronisées avec des données de force sur trois embodiments et plusieurs cellules de fabrication, le système atteint 82% de réussite moyenne sur cinq tâches d'assemblage informatique sous-millimétrique, contre 15% pour la meilleure référence, avec 0,5 mm de précision de placement et 50 ms de latence de commande. Ce résultat cible un angle mort des modèles vision-langage-action actuels, à l'aise pour saisir et déplacer des objets mais peu fiables dès qu'une tâche exige un contact fin, comme l'insertion de connecteurs ou le vissage. En traitant le retour de force comme signal d'apprentissage plutôt que garde-fou de sécurité, Facet-0 s'attaque à l'écart entre démonstrations impressionnantes et fiabilité réelle en ligne d'assemblage électronique, un enjeu concret pour les intégrateurs qui évaluent des bras génériques au-delà du tri ou de la manutention. Si l'écart revendiqué entre 82% et 15% se confirme dans des évaluations indépendantes, la modélisation explicite du contact pourrait devenir un prérequis pour les modèles de fondation visant l'industrie manufacturière exigeante. Facet-0 s'inscrit dans la vague des modèles de fondation robotique généralistes lancée par des systèmes comme Pi-0, GR00T N2 ou Helix, qui unifient perception, langage et contrôle moteur mais brillent surtout sur des tâches de manipulation grossière. En couplant une tête de prédiction de force à un critique dédié aux conséquences du contact, ses auteurs cherchent à combler ce manque sans abandonner l'architecture VLA générale. Le travail reste à ce stade une publication de recherche, sans annonce de déploiement industriel ni de mise à disposition du code ou du jeu de données ManuFacet-1K, les prochaines étapes attendues étant la revue par les pairs et des comparaisons indépendantes.

IA physiqueActu
1 source
DeMaVLA : un modèle fondation vision-langage-action (VLA) pour la manipulation de matériaux déformables
4arXiv cs.RO 

DeMaVLA : un modèle fondation vision-langage-action (VLA) pour la manipulation de matériaux déformables

Des chercheurs ont publié DeMaVLA, un modèle fondation de type Vision-Langage-Action (VLA) conçu pour la manipulation d'objets déformables, en particulier le pliage de vêtements. Annoncé en preprint arXiv (2605.31286, mai 2026), DeMaVLA couple un backbone VLM à un module appelé "action expert" qui génère des trajectoires continues par flow matching. Pour réduire les coûts d'entraînement et d'inférence, cet action expert est construit en élaguant une couche transformer sur deux du backbone, tout en préservant l'alignement entre les deux modules. Le modèle est d'abord pré-entraîné sur environ 5 000 heures de démonstrations bimanuals en conditions réelles, puis affiné via un pipeline DAgger (Data Aggregation) avec supervision humaine : des trajectoires correctives sont collectées à partir des échecs du robot sur plusieurs tâches de pliage, puis réinjectées en entraînement. Les résultats sont compétitifs sur le benchmark RoboTwin et solides sur un benchmark maison de pliage domestique. La plupart des systèmes VLA actuels entraînent des politiques séparées par catégorie d'objet (un réseau pour les t-shirts, un autre pour les pantalons), ce qui limite la généralisation et alourdit la maintenance. DeMaVLA propose une politique unifiée capable de traiter des vêtements de géométries, matières et états initiaux variés sans réentraînement par catégorie, ce qui est directement pertinent pour les intégrateurs en robotique domestique et logistique. Le recours au DAgger avec boucle humaine est aussi un signal industriel : les corrections issues des échecs du robot, structurées et réinjectées, améliorent concrètement la robustesse au-delà des seules démonstrations expertes. Cela valide l'hypothèse que les données correctives à grande échelle sont un levier clé pour réduire le sim-to-real gap sur des tâches à haute variabilité. La manipulation d'objets déformables reste l'un des problèmes ouverts les plus difficiles en robotique physique : contrairement aux objets rigides, un vêtement n'a pas d'état canonique stable, ce qui complique radicalement la planification et la perception. Plusieurs équipes travaillent sur ce terrain : Physical Intelligence avec Pi-0 (manipulation généraliste bimanuels), NVIDIA avec GR00T N2, et divers laboratoires académiques (Columbia, CMU) sur la manipulation textile. DeMaVLA se positionne sur le créneau des fondations multi-tâches déformables, en combinant pré-entraînement à grande échelle et fine-tuning correctif. Ce travail reste un preprint non encore évalué par les pairs, et les benchmarks maisons appellent à une validation indépendante. Les suites naturelles sont l'extension à d'autres objets déformables (câbles, sacs souples) et l'évaluation sur des plateformes robotiques commerciales en environnement non contrôlé.

IA physiqueOpinion
1 source