Aller au contenu principal
General Robotics mise sur une intelligence modulaire plutôt qu'un cerveau robotique unique
IA physiqueRobotics Business Review 

General Robotics mise sur une intelligence modulaire plutôt qu'un cerveau robotique unique

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

General Robotics, jeune société de robotique cofondée par Sai Vemprala, a détaillé sa stratégie technologique dans l'épisode 263 du podcast The Robot Report, publié en marge de la conférence RoboBusiness qui fête cette année ses 20 ans. Vemprala, CTO et cofondateur de l'entreprise, titulaire d'un doctorat en robotique de Texas A&M et ancien chercheur senior chez Microsoft Research, y dirige le développement de GRID, l'architecture logicielle maison, et y défend une approche d'"intelligence modulaire" plutôt qu'un cerveau robotique unique et généraliste. Cet épisode fait suite à un précédent numéro, le 234, consacré à Dinesh Narayanan, responsable de la commercialisation chez General Robotics. Le même podcast relaie aussi plusieurs mouvements de la semaine dans le secteur : Agility Robotics, constructeur de l'humanoïde Digit, explorerait des variantes à roues de ses robots ; Boston Dynamics a ouvert un "Metaplant Application Center" pour entraîner son humanoïde Atlas ; Cognex a annoncé le rachat de RealSense ; et Qualcomm celui de PickNik Robotics.

Le choix de General Robotics touche à un débat structurant du secteur : faut-il un modèle unique de type vision-langage-action censé couvrir perception, décision et manipulation, ou des briques logicielles spécialisées, assemblées selon la tâche ? En misant sur la modularité, l'entreprise prend le contre-pied d'architectures monolithiques comme GR00T de NVIDIA ou pi-0 de Physical Intelligence, en pariant que la fiabilité industrielle, condition d'adoption pour les intégrateurs et les décideurs B2B, passe par des composants testables et remplaçables séparément plutôt que par un modèle géant entraîné de bout en bout. Les autres nouvelles évoquées confirment une tendance de fond : consolidation rapide par acquisitions autour des capteurs et des logiciels robotiques, et diversification des form factors chez les leaders historiques de l'humanoïde.

General Robotics a émergé du parcours de Vemprala chez Microsoft Research, où il travaillait sur la robotique fondée sur la simulation et les systèmes d'IA physique à grande échelle ; GRID incarne cette philosophie modulaire au sein de l'entreprise. Sur le plan concurrentiel, elle se positionne face aux acteurs misant sur un modèle fondation unique pour la robotique humanoïde, dans un marché où les rachats stratégiques (RealSense, PickNik Robotics) et les repositionnements produits (Digit, Atlas) s'enchaînent rapidement, sans qu'aucune architecture ne se soit encore imposée comme standard.

À lire aussi

Genesis AI introduit GENE-26.5, un modèle pour une manipulation robotique plus dextérique
1Robotics Business Review 

Genesis AI introduit GENE-26.5, un modèle pour une manipulation robotique plus dextérique

Genesis AI, startup californienne fondée par Zhou Xian et basée à San Carlos, a dévoilé GENE-26.5, un modèle fondamental d'IA conçu pour la manipulation robotique dextre bimanuelle. Sortie de stealth l'an dernier avec une levée de 105 millions de dollars, l'entreprise annonce avoir résolu le principal verrou du secteur : le manque de données d'entraînement pour les tâches à haute dextérité. GENE-26.5 repose sur deux composants propriétaires : un moteur de données à grande échelle et une main robotique dimensionnée à l'échelle humaine, couplée à un gant de collecte doté d'une peau électronique tactile. Ce gant permet une correspondance 1:1:1 entre la main du démonstrateur, le gant et l'effecteur robotique, facilitant le transfert direct de compétences humaines vers le robot sans recodage. Pour illustrer les capacités du modèle, Genesis AI a publié des vidéos montrant la réalisation d'une recette en 20 étapes (découpe de tomates, cassage d'oeuf à une seule main, coordination bimanuelle), la préparation d'un smoothie avec service en vol, des expériences de laboratoire impliquant pipetage et transferts de liquides, du câblage de faisceaux électriques, la résolution d'un Rubik's Cube en manipulation aérienne, la préhension simultanée de quatre objets de tailles différentes, et l'interprétation d'une composition pianistique complexe. L'enjeu industriel est direct : le câblage de faisceaux électriques, désigné par l'entreprise comme "l'une des tâches les plus difficiles en électronique", représente des milliers de postes non automatisés dans les secteurs automobile et aérospatial, faute de robots capables de gérer la variabilité géométrique des fils. Si les performances démontrées se confirment hors conditions de laboratoire contrôlées - ce que des vidéos promotionnelles soigneusement sélectionnées ne permettent pas d'établir -, cela ouvrirait un marché significatif pour les intégrateurs cherchant à robotiser des tâches à haute variabilité morphologique. L'approche de Genesis AI vise à combler l'"embodiment gap" : l'écart de morphologie entre humain et robot qui a historiquement limité l'efficacité des modèles entraînés sur données humaines. L'investissement d'Eric Schmidt, ex-PDG de Google, dans la société souligne l'intérêt stratégique croissant pour ce segment au-delà du seul milieu robotique. Genesis AI s'inscrit dans une course à la manipulation dextre où plusieurs acteurs avancent en parallèle : Physical Intelligence avec son modèle Pi-0, Sanctuary AI et les équipes manipulation de Figure (Figure 03) et Tesla (Optimus Gen 3) développent également des architectures de type VLA (Vision-Language-Action) pour le contrôle fin des effecteurs. Genesis AI se distingue en concentrant son offre exclusivement sur la main et la manipulation bimanuelles, sans plateforme humanoide annoncée à ce stade. Le communiqué reste toutefois vague sur les suites opérationnelles : aucun pilote industriel nommé, aucune timeline de déploiement ni tarification n'est communiqué, ce qui place cette annonce clairement du côté de la démonstration technologique plutôt que du produit commercialisé.

IA physiqueOpinion
1 source
E-TTS : un nouveau cadre de mise à l'échelle au moment de l'inférence pour la manipulation robotique
2arXiv cs.RO 

E-TTS : un nouveau cadre de mise à l'échelle au moment de l'inférence pour la manipulation robotique

Des chercheurs présentent sur arXiv (2606.27268, juin 2026) E-TTS, un cadre de mise à l'échelle à l'inférence (test-time scaling) pour la manipulation robotique, applicable en surcouche de modèles vision-language-action (VLA) existants sans réentraînement ni collecte de données supplémentaire. Le framework repose sur deux mécanismes : un échantillonnage conjoint raisonnement-action avec notation par paires, et un tampon d'historique (history buffer) qui stocke les observations passées pour contextualiser les décisions d'action. Contrairement aux méthodes TTS en boucle ouverte, E-TTS intègre du feedback durant l'inférence via un mécanisme de raffinement itératif en boucle fermée, piloté par des vérificateurs vision-langage. Les auteurs rapportent des gains jusqu'à 33,14 % en simulation et 26,62 % en conditions réelles, mesurés sur 4 benchmarks, 6 environnements, 3 morphologies de robots et 4 modèles VLA de base. L'enjeu est de transposer à la robotique ce qui a fonctionné pour les LLMs : amplifier les capacités à l'inférence sans modifier les poids du modèle. Le défi spécifique aux robots est que les tâches sont séquentielles et longues : une observation instantanée ne suffit pas pour choisir la bonne action, contrairement à une requête texte isolée. En partageant un buffer d'historique entre les modules de raisonnement et de vérification d'action, E-TTS comble un angle mort des méthodes TTS précédentes pour l'embodied AI. Le fait que le gain tienne en conditions réelles (26,62 %) et pas seulement en simulation est un signal positif sur le sim-to-real gap, même si les conditions exactes de ces expériences en monde réel méritent examen dans le papier complet. Le test-time scaling a émergé avec les architectures o1 et o3 d'OpenAI et les approches chain-of-thought pour les LLMs, avant d'être progressivement exploré pour les VLA robotiques. E-TTS s'inscrit dans ce mouvement que les auteurs eux-mêmes qualifient d'"early attempts", ce qui situe honnêtement le niveau de maturité. L'architecture modulaire et plug-and-play est conçue pour s'adapter à des VLA variés, ce qui pourrait faciliter l'adoption par des équipes travaillant sur des modèles comme pi0 (Physical Intelligence), GR00T N2 (NVIDIA) ou OpenVLA. Le papier ne mentionne ni déploiement industriel ni partenariat avec un constructeur de robots : il reste une preuve de concept académique dont la validation sur des tâches industrielles réelles (assemblage, palettisation) constituerait l'étape suivante naturelle.

💬 Ce qui change ici, c'est le buffer. Appliquer le test-time scaling à un robot, c'est pas aussi simple qu'à un LLM : un bras qui visse en étape 7 ne peut pas raisonner sur une observation instantanée, il lui faut les étapes précédentes pour contextualiser. Que les gains tiennent à 26 % en conditions réelles et pas seulement en sim, c'est le seul résultat qui compte pour l'instant.

IA physiqueOpinion
1 source
Genesis AI présente GENE-26.5, un modèle pour une manipulation robotique plus dextérique
3Robotics Business Review 

Genesis AI présente GENE-26.5, un modèle pour une manipulation robotique plus dextérique

Genesis AI, startup californienne basée à Palo Alto, a présenté le 6 mai 2026 son modèle fondation GENE-26.5, conçu pour la manipulation robotique dextre bimane à vocation généraliste. La société fondée par Zhou Xian revendique des "capacités de manipulation physique au niveau humain" et annonce simultanément deux composants propriétaires : un moteur de données destiné à lever le plafond de volumétrie d'entraînement, et une main robotique à l'échelle humaine couplée à un gant de capture tactile. Ce gant, équipé d'une peau électronique à capteurs, est conçu pour assurer un mappage 1:1:1 entre le gant, la main humaine et l'effecteur robotique, réduisant la perte de fidélité dans le transfert de compétences téléopérées. Pour illustrer les capacités de GENE-26.5, Genesis AI a publié une vidéo montrant un robot réaliser une séquence de cuisson en 20 étapes (découpe de tomates, cassage d'œuf d'une main, coordination bimane), préparer un smoothie avec service en plein air, exécuter des expériences de laboratoire incluant pipetage et transfert de liquides, câbler des faisceaux électroniques, résoudre un Rubik's Cube en manipulation aérienne, saisir simultanément quatre objets de tailles variables, et jouer du piano. Genesis AI était sortie de stealth en 2025 avec 105 millions de dollars de financement. L'enjeu industriel de cette annonce se situe à deux niveaux distincts. Le moteur de données propriétaire cible le principal frein aux modèles de fondation en robotique : l'absence de données de manipulation dextre à grande échelle et haute fidélité. Le gant tactile cherche à résoudre l'embodiment gap, soit la discontinuité morphologique entre effecteur robotique et main humaine qui dégrade le transfert de compétences. Si le mappage 1:1:1 annoncé tient en production, il ouvrirait la voie à une scalabilité des données de téléopération rarement atteinte dans les systèmes actuels. Il convient toutefois de tempérer : les démonstrations présentées sont des vidéos produites et sélectionnées par l'entreprise elle-même. Aucun benchmark indépendant, aucun taux de succès en environnement industriel non contrôlé n'est communiqué. Les affirmations de performance "au niveau humain" émanent exclusivement de Genesis AI et d'Eric Schmidt, ex-PDG de Google et investisseur dans la société. Genesis AI évolue dans un segment en pleine consolidation. Sur le terrain des modèles de fondation pour la manipulation, elle affronte Physical Intelligence (Pi-0, Pi-0.5, Pi-1, San Francisco), Nvidia avec GR00T N2 lancé en novembre 2024, et Figure AI dont la plateforme Figure 03 progresse vers le déploiement industriel chez BMW. La différenciation de Genesis AI porte sur la verticalisation hardware-software : là où Physical Intelligence s'appuie sur du matériel tiers, Genesis AI contrôle à la fois le modèle et l'effecteur. L'entreprise n'a communiqué aucun calendrier de déploiement commercial précis ni partenariat industriel signé. La prochaine étape observable sera de vérifier si les performances démontrées en vidéo se traduisent en métriques reproductibles dans des environnements réels, hors conditions de studio.

IA physiqueOpinion
1 source
Transférer l'intelligence des VLM au contrôle robotique
4arXiv cs.RO 

Transférer l'intelligence des VLM au contrôle robotique

Un papier de recherche publié sur arXiv (2609.22966v1) présente RoboDawn, une interface qui permet à un modèle vision-langage (VLM) généraliste de piloter un robot sans entraînement spécifique à la tâche, via un jeu restreint de commandes discrètes de translation, rotation et pince, exécutées en boucle fermée d'observation, de raisonnement et d'action. Un mécanisme d'apprentissage en contexte fournit au modèle quelques démonstrations pour lui apprendre l'usage de l'interface et la stratégie de la tâche. Sur le banc d'essai RoboTwin 2.0 C2R, le taux de réussite passe de 53,2% en zero-shot à 73,6% avec une seule démonstration, dépassant la référence pi-0.5 (46,0%) ; sur RoboDojo, il grimpe de 35,67% à 47,17%. Le système est aussi testé sur un bras Franka réel, pour des tâches de rangement et d'empilement de cubes. Le résultat questionne l'hypothèse dominante selon laquelle un contrôle robotique fiable exige d'entraîner ou d'affiner un modèle vision-langage-action sur de vastes jeux de démonstrations robotiques collectées tâche par tâche, comme le font pi-0, GR00T N2 ou Helix. RoboDawn suggère qu'un VLM généraliste, jamais entraîné sur des données robot, peut être compétitif via une simple interface d'action et quelques exemples en contexte, ce qui réduirait le coût de collecte de données pour les intégrateurs. Pour les décideurs évaluant leur pile de contrôle robotique, c'est un argument pour des architectures VLM plus interface plutôt qu'un fine-tuning coûteux par tâche. Le bémol : les gains les plus marquants restent mesurés en simulation, et la validation réelle se limite à deux tâches simples sur un seul bras, avec des taux de réussite qui restent sous 75%. RoboDawn s'inscrit dans le débat sur les modèles vision-langage-action porté par Physical Intelligence (pi-0, pi-0.5), NVIDIA (GR00T N2) ou Figure (Helix), qui misent sur un entraînement spécifique sur des données robotiques. L'approche inverse consiste à garder le VLM tel quel et à n'ajouter qu'une couche d'interface et un protocole de prompting en contexte, sans réentraînement. Classé comme nouvelle soumission sur arXiv, le papier n'a pas encore été publié en conférence et ne correspond à aucun produit commercial ; la suite logique serait d'étendre la validation réelle au-delà du bras Franka et des deux tâches testées.

IA physiqueOpinion
1 source