Aller au contenu principal
Light Origins publie en open source Light-O1-Preview, son modèle corps entier de 6 milliards de paramètres
IA physiquePandaily 

Light Origins publie en open source Light-O1-Preview, son modèle corps entier de 6 milliards de paramètres

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Light Origins a mis en open source Light-O1-Preview, un modèle d'action « corps entier » d'environ 6 milliards de paramètres, publié sous licence Apache 2.0 sur Hugging Face et GitHub selon le blog technique de l'entreprise daté du 21 septembre. Ce checkpoint public constitue la partie visible de Light-O1, la ligne de fondation incarnée de Light Origins, distincte de son précédent cerveau de navigation LightNav-0. Le pipeline segmente des humains filmés en vidéo, reconstruit leur mouvement en trois dimensions, puis tokenise trajectoire, pose et état des mains en jetons discrets entrelacés avec le langage et la vision pour un pré-entraînement Transformer autorégressif. Des expériences de mise à l'échelle allant de 3,75 à 120 milliards de tokens multimodaux, soit jusqu'à environ 100 000 heures d'action humaine récupérée dans le plus grand budget testé, montreraient une baisse en loi de puissance de l'erreur de prédiction après adaptation à des données égocentriques, à des jeux de téléopération du Unitree G1 et aux corpus maison LightBot. Les démonstrations montrent ce modèle transféré sur LightBot et un Unitree G1 pour s'agenouiller, tenir l'équilibre, essuyer une surface ou saisir des objets. Bâti sur l'arbre Qwen3.5-4B-Base, le checkpoint accepte une instruction textuelle, produit une courte trace de raisonnement puis des séquences à 20 images par seconde, avec 138 valeurs par image couvrant mouvement racine, hauteur du bassin, lacet, 22 articulations et ouverture des mains. Déployer ces trajectoires exige encore un modèle de comportement séparé : l'exemple Unitree G1 documenté tourne aujourd'hui en simulation avec un checkpoint de politique additionnel. Light Origins revendique 79,3% de succès sur 24 tâches en simulation de cuisine RoboCasa GR-1, un chiffre produit en interne, sans classement public indépendant.

Pour les intégrateurs et équipes robotique, Light-O1-Preview n'est pas un système clé en main mais une couche de « prior » de mouvement téléchargeable sous licence permissive, qui permet de tester publiquement l'hypothèse d'un pré-entraînement sur vidéo humaine généralisable à plusieurs embodiments, une piste aussi suivie par Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou Helix de Figure. La qualité de la manipulation locomotrice inter-embodiments dépend cependant toujours de données d'adaptation et de contrôleurs bas niveau restés partiellement propriétaires, ce que cette publication ne résout pas. Le taux de 79,3% cité provient d'un benchmark maison, non d'un classement tiers vérifiable, et les démonstrations mêlent simulation et robot réel sans distinction toujours explicite : la sortie relève donc pour l'instant davantage de l'ouverture de recherche que d'un produit déployé en usine ou en entrepôt.

Light-O1-Preview prolonge la stratégie de Light Origins consistant à bâtir des modèles fondation incarnés à partir de vidéos humaines plutôt que de téléopération coûteuse à grande échelle, après son précédent LightNav-0 dédié à la navigation. L'entreprise positionne ainsi Light-O1 face aux laboratoires occidentaux de modèles vision-langage-action déjà cités, dans une course où des poids ouverts sous Apache 2.0 restent rares comparés aux offres fermées de Physical Intelligence ou NVIDIA. Le recours au Unitree G1 comme plateforme de référence confirme le rôle de ce humanoïde chinois comme banc d'essai standard pour plusieurs équipes de recherche. Aucune date de pilote industriel n'est annoncée en dehors des environnements de simulation et de démonstration ; l'étape suivante reste l'ajout d'un modèle de comportement ou d'un contrôleur bas niveau capable de transformer ces séquences en commandes robot fiables en conditions réelles.

Impact France/UE

Aucun acteur ni déploiement français ou européen n'est implique, mais les équipes robotique européennes peuvent télécharger ce modèle Apache 2.0 pour évaluer l'hypothèse d'un pré-entrainement vidéo humaine généralisable.

À lire aussi

Light Origins ouvre le code source de LightNav-0, son cerveau de navigation généraliste
1Pandaily 

Light Origins ouvre le code source de LightNav-0, son cerveau de navigation généraliste

Light Origins a publié en open source LightNav-0, un modèle de navigation généraliste compact bâti sur un socle Qwen3-VL-4B, avec poids, code, rapport technique et kit d'évaluation INSIGHT-Bench, sous licence Apache 2.0 (GitHub lightorigins/LightNav-0, Hugging Face LightOriginsHQ/LightNav-0). Le modèle partage une interface à token unique pour le suivi d'instructions, la navigation vers des objets en vocabulaire ouvert et le suivi visuel, sans têtes de prédiction dédiées par tâche. Son entraînement repose sur un pipeline Real2Sim2Real convertissant plus de 2000 scènes réelles glanées sur internet en simulateurs réutilisables, générant plus de 4000 heures de données vision-langage-action, avant trois phases d'apprentissage (pré-entraînement de raisonnement incarné, fine-tuning supervisé sur trajectoires alignées, puis renforcement en ligne) et une randomisation de la hauteur, du champ de vision et de l'inclinaison de caméra. Light Origins affirme que sa version monoculaire RGB arrive première parmi les méthodes à caméra unique sur dix bancs d'essai (VLN-CE, navigation d'objets sur Matterport3D/HM3D, HM3D-OVON, suivi EVT-Bench), tout en restant compétitive face aux systèmes panoramiques, via des tokens de pointage spatial et un tokenizer d'action à quantification vectorielle résiduelle générant des séquences de dix points de passage avec une erreur de reconstruction centimétrique selon les propres tests de l'équipe. Des démonstrations zero-shot transfèrent le même modèle sur des robots humanoïdes, quadrupèdes, à roues et aériens, en intérieur comme en extérieur, jusqu'au suivi dans une rue encombrée. Pour l'industrie robotique, l'intérêt ne tient pas tant au score de navigation qu'à la démonstration d'une boucle reproductible: scènes réelles vers simulation, puis retour vers des corps hétérogènes, ce qui pourrait réduire la dépendance à la téléopération pour collecter des données de navigation. La publication complète sous licence permissive tranche avec des modèles VLA plus fermés comme Pi-0 de Physical Intelligence, GR00T N2 de Nvidia ou Helix de Figure, et donne aux intégrateurs une base testable plutôt qu'une démonstration fermée. Le fait qu'un même checkpoint pilote sans réentraînement des humanoïdes, quadrupèdes, plateformes à roues et drones appuie l'idée qu'un cerveau de navigation générique et transférable entre morphologies est atteignable, hypothèse encore débattue dans le secteur. Il faut cependant nuancer les chiffres avancés: le classement sur dix bancs d'essai et l'erreur de reconstruction centimétrique proviennent des propres évaluations et ablations de Light Origins, sans validation indépendante rapportée, ce qui invite à traiter ces résultats comme des annonces à confirmer plutôt que des faits établis. LightNav-0 s'inscrit dans la vague des modèles vision-langage-action ouverts qui cherchent à concurrencer des systèmes propriétaires en misant sur la reproductibilité et l'adoption communautaire plutôt que sur la démonstration marketing. L'article ne mentionne aucun acteur français ou européen ni de partenariat de déploiement industriel; la comparaison implicite se fait avec des laboratoires et fabricants positionnés sur la navigation et la manipulation par VLA, tels que Physical Intelligence ou Nvidia. Aucun calendrier de pilote commercial n'est communiqué: les artefacts sont disponibles immédiatement, ouvrant la voie à des fine-tunings communautaires sur de nouvelles morphologies plutôt qu'à un déploiement annoncé chez un client.

IA physiqueOpinion
1 source
Efficient-WAM : un modèle monde-action de 1 milliard de paramètres à faible coût d'anticipation
2arXiv cs.RO 

Efficient-WAM : un modèle monde-action de 1 milliard de paramètres à faible coût d'anticipation

Une équipe de recherche présente Efficient-WAM, un World-Action Model (WAM) d'un milliard de paramètres conçu pour la manipulation robotique en temps réel, dont les résultats sont publiés sur arXiv (2606.10040) en juin 2026. Les WAMs constituent une classe de modèles qui couplent la prédiction visuelle du futur avec la génération d'actions motrices : le robot "imagine" ce que va ressembler la scène dans quelques instants avant de décider quoi faire. Efficient-WAM ramène la latence d'inférence à environ 100 ms par chunk lors du déploiement physique, soit un gain de 30x par rapport aux WAMs existants. Pour y parvenir, trois leviers techniques sont combinés : un expert vidéo compact distillé depuis WAN-2.2-5B (modèle de génération vidéo à 5 milliards de paramètres), des représentations vidéo token-sparse, et un débruitage asymétrique qui alloue moins d'étapes d'échantillonnage à la branche vidéo qu'à la branche action. Les évaluations portent sur le benchmark RoboTwin 2.0 et des tâches de manipulation en conditions réelles. Le résultat central est contre-intuitif : Efficient-WAM maintient des performances d'action compétitives même si ses prédictions visuelles sont visiblement grossières, ce qui invalide l'hypothèse implicite que la fidélité photorealiste de l'imagination future est nécessaire au contrôle. Pour un intégrateur ou un responsable robotique, cela signifie que le goulot d'étranglement computationnel des WAMs n'est pas une fatalité architecturale mais un problème de design résolu ici par une re-priorisation : la vidéo future n'est plus un objectif visuel mais un signal de guidage compact pour la génération d'actions. À 100 ms par chunk, le modèle entre dans la fenêtre de faisabilité pour des boucles de contrôle sur manipulateurs industriels ou cobots, là où les WAMs précédents restaient confinés à la démonstration labo. Les WAMs s'inscrivent dans une compétition dense avec les Vision-Language-Action models (VLAs) comme Pi-0 de Physical Intelligence, GR00T N2 de NVIDIA ou OpenVLA, qui traitent directement la génération d'actions sans passer par la prédiction vidéo explicite. L'argument des WAMs est que l'imagination du futur améliore la robustesse en dehors de la distribution d'entraînement, mais leur coût computationnel a jusqu'ici limité leur adoption. Efficient-WAM rééquilibre ce trade-off. La distillation depuis WAN-2.2-5B, un modèle de génération vidéo généraliste, suggère une stratégie de transfer learning inter-domaine qui pourrait s'étendre à d'autres architectures. Les prochaines étapes naturelles sont l'évaluation sur des plateformes humanoïdes complètes et des déploiements en environnements semi-structurés, deux dimensions absentes de ce papier.

IA physiqueActu
1 source
LingBot-Vision d'Ant Group : 12 premières mondiales, un modèle de 1,1 milliard de paramètres bat DINOv3 (7 milliards)
3Pandaily 

LingBot-Vision d'Ant Group : 12 premières mondiales, un modèle de 1,1 milliard de paramètres bat DINOv3 (7 milliards)

Ant Group, via sa division robotique LingBot, a dévoilé LingBot-Depth 2.0, un modèle de perception spatiale construit sur un nouveau modèle de vision baptisé LingBot-Vision, présenté comme le premier modèle de fondation vision nativement conçu pour la perception spatiale en IA incarnée. L'entreprise revendique douze résultats inédits sur des benchmarks publics et privés, une affirmation à prendre avec précaution puisqu'elle émane de son propre communiqué. Avec environ 1,1 milliard de paramètres, soit environ un septième des 7 milliards de DINOv3 de Meta, et moins d'un tiers de son volume d'entraînement, LingBot-Vision affirme surpasser DINOv3 sur le benchmark d'estimation de profondeur NYUv2. Le modèle cible trois défauts classiques de l'estimation de profondeur: le flou des contours, la détection des petits objets et le bruit sur les longues distances. LingBot-Depth 2.0 revendique une clarté de contours suffisante pour de la planification de trajectoire de bras robotique au millimètre près, une meilleure détection des câbles et fils fins, un filtrage du bruit pour les obstacles distants, et des cartes de profondeur stables face aux surfaces réfléchissantes, objets transparents, obscurité et environnements encombrés. Le modèle et son code sont disponibles en open source sur Hugging Face, ModelScope et GitHub, avec un rapport technique publié sur arXiv. Ant Group a aussi noué un partenariat avec ORBBEC, fabricant chinois de capteurs 3D, dont le laboratoire Depth Vision Lab a validé le modèle; la collaboration produit un nouveau dispositif de collecte EGO-RGBD, une intégration SDK pour le matériel ORBBEC, et une future caméra intégrée sans réglage algorithmique complexe. La sortie illustre un pari de plus en plus partagé en IA incarnée: les modèles de vision entraînés sur des images web généralistes, comme DINOv3, reconnaissent des objets mais ignorent leur géométrie précise, ce qui limite leur usage pour des robots devant saisir, éviter ou manipuler des objets réels. En intégrant la compréhension spatiale dès l'entraînement, LingBot-Vision s'attaque à l'écart entre perception "de spectateur" et perception "d'acteur", un enjeu central pour les modèles vision-langage-action qui pilotent bras robotiques et humanoïdes. Le passage du papier de recherche à un partenariat matériel concret avec ORBBEC, plutôt qu'une simple démonstration, est le signal le plus tangible pour les intégrateurs: un début de commercialisation réelle plutôt qu'un prototype isolé. Gérer nativement les cas difficiles, surfaces réfléchissantes, câblage fin, objets transparents, est précisément ce qui bloque aujourd'hui le déploiement en environnement réel non contrôlé. Ant Group, mieux connu pour Alipay, a multiplié ces derniers mois les investissements en robotique et IA incarnée via LingBot, dans un contexte de compétition intense entre laboratoires chinois et américains sur les modèles de fondation pour robots. La comparaison affichée avec DINOv3, modèle phare de Meta, positionne explicitement l'entreprise face aux géants américains sur la perception, pendant que d'autres acteurs, Figure AI avec Figure 03, Tesla avec Optimus, Physical Intelligence avec Pi-0, NVIDIA avec GR00T N2 ou Google DeepMind avec Helix, se concentrent davantage sur les modèles d'action et le contrôle moteur. LingBot-Vision se positionne ainsi comme une brique de perception complémentaire, potentiellement intégrable en amont de ces systèmes. Le partenariat avec ORBBEC laisse présager un déploiement progressif dans les prochains mois, avec l'arrivée annoncée d'une caméra grand public intégrant directement le traitement 3D, un jalon qui déterminera si les gains annoncés sur benchmarks se traduisent en performance réelle chez les intégrateurs industriels.

IA physiqueActu
1 source
« FabriVLA de Youibot, modèle 1 milliard de paramètres, dépasse Pi-Zero et prend la tête du classement en IA incarnée »
4Pandaily 

« FabriVLA de Youibot, modèle 1 milliard de paramètres, dépasse Pi-Zero et prend la tête du classement en IA incarnée »

Youibot a annoncé que son modèle FabriVLA, doté d'à peine 1 milliard de paramètres, s'est hissé en tête du classement Evo-SOTA sur le benchmark Meta-World MT50, avec un taux de réussite moyen de 90,0%, devançant ainsi Pi-Zero de Physical Intelligence. MT50 évalue la maîtrise simultanée de 50 tâches de manipulation distinctes, un test jugé représentatif des exigences multi-tâches du secteur industriel. L'innovation revendiquée par Youibot ne tient pas à la taille du modèle mais à son architecture, pensée spécifiquement pour la manipulation robotique plutôt que calquée sur la course générale au nombre de paramètres. Deux mécanismes sont mis en avant : une fusion de caractéristiques visuelles profondes et superficielles, censée permettre au modèle de saisir à la fois l'objectif sémantique global d'une tâche et le positionnement spatial fin, et un mécanisme d'auto-attention à portes qui relie chaque étape d'une séquence d'actions aux étapes précédentes et suivantes pour fluidifier les transitions. Une étude d'ablation fournie par l'entreprise indique que retirer la fusion profonde/superficielle fait chuter le score moyen de 90,0% à 82,9%, l'auto-attention à portes étant présentée comme le composant le plus déterminant de la tête d'action. Youibot revendique par ailleurs plus de 800 déploiements industriels réels dans les secteurs des semi-conducteurs, de l'énergie et des batteries, ainsi que 4 000 commandes enregistrées dès le lancement de son robot humanoïde Fengxi. L'enjeu commercial de ce résultat, s'il se confirme au-delà du seul classement, tient à la taille du modèle. Un modèle plus compact consomme moins de puissance de calcul, réduit la latence et peut fonctionner directement sur le matériel embarqué du robot sans dépendre du cloud, un facteur clé dans des usines où la connectivité réseau n'est pas garantie. Cela vient contredire l'hypothèse dominante selon laquelle la performance en intelligence embarquée passerait nécessairement par une montée en échelle massive des paramètres, à l'image des modèles VLA les plus lourds du marché. Il convient toutefois de noter que les classements de type Evo-SOTA reposent sur des benchmarks en simulation, dont la représentativité vis-à-vis de conditions industrielles réelles reste à démontrer au cas par cas. Ce résultat s'inscrit dans une compétition de plus en plus vive entre modèles VLA (vision-langage-action), aux côtés d'acteurs comme Physical Intelligence, Nvidia avec GR00T N2, ou Figure AI avec Helix. Youibot, déjà présent industriellement en Chine, affiche un objectif de déploiement sur 10 000 sites, un chiffre que la légèreté de FabriVLA rendrait, selon l'entreprise, plus atteignable qu'auparavant faute d'infrastructure de calcul massive à installer sur chaque site.

IA physiqueActu
1 source