Aller au contenu principal
Au-delà du placement et de l'articulation : des scènes de code pilotées par l'usage pour l'interaction incarnée
RecherchearXiv cs.RO 

Au-delà du placement et de l'articulation : des scènes de code pilotées par l'usage pour l'interaction incarnée

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent RoomWright dans un preprint arXiv (2608.18840v1, catégorie "new", diffusé fin août 2026), un framework agentique de génération de scènes 3D d'intérieur entièrement représentées sous forme de code pour l'interaction incarnée. Le système effectue un raisonnement d'objets piloté par l'usage : chaque point d'ancrage de la scène est traité comme un centre de tâche autour duquel sont ajoutés les objets requis et leurs affordances. Un agent de code compile ensuite chaque interaction en une règle trigger-condition-effet qui met à jour des états d'objets structurés, capturant les dépendances causales entre eux, par exemple ouvrir un meuble avant d'en extraire un objet. Pour lever l'ambiguïté d'orientation des objets manipulables, difficile à déduire de simples pixels, la méthode s'appuie sur une orientation guidée par l'usage et informée par annotation. Les auteurs indiquent avoir mené des expériences extensives validant l'approche, produisant des scènes exécutables, éditables et directement utilisables en simulation.

Les méthodes existantes de génération de scènes par code produisent certes des environnements éditables, mais restent focalisées sur la construction visuelle et l'articulation au niveau objet, laissant l'usage fonctionnel des scènes largement non modélisé, un manque que RoomWright cible directement. Pour l'entraînement de modèles vision-langage-action (VLA) tels que Pi-0, GR00T N2 ou Helix, disposer de scènes encodant non seulement le placement des objets mais aussi leurs règles d'usage et leurs dépendances causales représente un enjeu concret : cela permet de générer automatiquement des tâches de manipulation multi-étapes cohérentes, sans scénarisation manuelle systématique. L'approche s'adresse ainsi directement au fossé entre démonstrations statiques et environnements de simulation réellement exploitables pour l'apprentissage de politiques, un point sensible pour les équipes robotique qui peinent à produire des données d'entraînement diversifiées et causalement cohérentes à grande échelle.

RoomWright s'inscrit dans la lignée des travaux récents combinant grands modèles de langage et génération de code pour la synthèse procédurale de scènes 3D destinées à l'IA incarnée, à la manipulation robotique et à l'apprentissage de politiques par simulation, un champ où les publications se sont multipliées depuis l'essor des VLA. Le papier, publié en preprint sur arXiv sans mention d'acteur français ou européen, reste à ce stade une contribution de recherche et non un produit déployé : aucune date de mise à disposition du code source ni de jeu de données n'est précisée. Les auteurs présentent les résultats comme une démonstration de faisabilité plutôt qu'un système prêt à l'emploi, la suite logique étant une intégration dans des pipelines de simulation existants pour la robotique de manipulation.

À lire aussi

UniPart : segmentation 3D zéro-coup des pièces guidée par le langage pour l'interaction incarnée
1arXiv cs.RO 

UniPart : segmentation 3D zéro-coup des pièces guidée par le langage pour l'interaction incarnée

Des chercheurs présentent UniPart, un modèle de segmentation 3D par parties conditionné par le langage, décrit dans un article déposé sur arXiv sous l'identifiant 2609.12898v1. Le système est un Transformer 3D cross-modal en propagation directe qui associe un nuage de points à une expression textuelle libre, par exemple "la poignée" ou "le bouton", en la conditionnant sur les embeddings textuels de CLIP. Pour entraîner ce modèle, les auteurs ont construit LangPart-1M, un jeu de données combinant plus de 160 000 objets 3D issus de la base Objaverse et 8 millions de paires texte-partie générées via une méthode de génération multi-vues cohérente. Un sous-ensemble annoté manuellement à haute qualité, baptisé LangPart-4K, a ensuite été créé pour affiner et évaluer le modèle. Selon les auteurs, UniPart obtient de bons résultats en zero-shot sur des benchmarks ouverts de segmentation de parties et a été testé en conditions réelles sur des tâches de préhension robotique guidées par le langage. Cette approche s'attaque à un verrou concret de la manipulation robotique fine: la plupart des modèles 3D généralistes raisonnent à l'échelle de l'objet entier, tandis que les modèles capables de distinguer les parties fonctionnelles restent limités à des taxonomies fermées et ne généralisent pas à du vocabulaire nouveau. Pour un intégrateur ou un ingénieur robotique, disposer d'un système qui associe une instruction en langage naturel à une sous-partie précise d'un objet, sans réentraînement, ouvre la voie à des pipelines de manipulation plus flexibles, avec préhension ciblée d'une poignée, d'un bouton ou d'une charnière plutôt que de l'objet dans son ensemble. Le passage du benchmark zero-shot à une démonstration de préhension réelle constitue un indice encore préliminaire que la compréhension fine des parties par vision-langage peut passer à l'échelle sans dépendre d'annotations exhaustives, une hypothèse encore débattue dans le secteur des modèles vision-langage-action appliqués à la manipulation. UniPart s'inscrit dans la lignée des modèles fondation 3D qui se sont multipliés ces deux dernières années, dont la majorité peine à concilier généralisation et granularité fine. Le travail s'appuie sur des briques désormais courantes du secteur, l'encodeur texte-image CLIP et la base d'objets 3D Objaverse, pour construire à moindre coût une supervision massive plutôt que de dépendre uniquement d'annotations manuelles onéreuses. Il se positionne face aux modèles 3D dits "part-aware" à taxonomie fermée déjà existants, qu'il cherche explicitement à dépasser en ouverture de vocabulaire. À ce stade, il s'agit d'un travail de recherche publié en préimpression, sans produit ni déploiement commercial annoncé; les auteurs ne précisent ni calendrier de publication du code, ni disponibilité des jeux de données LangPart-1M et LangPart-4K, ni intégration prévue dans une pile robotique existante.

RecherchePaper
1 source
Planification du réarrangement de scènes pour l'IA incarnée
2arXiv cs.RO 

Planification du réarrangement de scènes pour l'IA incarnée

Une équipe de recherche présente Embodied Scene Rearrangement Planning (ESRP), une nouvelle tâche qui demande à un agent incarné de réorganiser des meubles dans une scène 3D pour atteindre une configuration cible, en ne disposant que d'observations égocentriques et d'un plan cible vu du dessus. Pour évaluer cette tâche, les auteurs publient ESRP-Bench, un benchmark construit sur le simulateur OmniGibson qui comprend plus de 5 400 paires de scènes et 8 200 objets, accompagné de trois métriques à plusieurs niveaux pour juger la qualité de la réorganisation. Quatre méthodes de référence sont testées: une approche hiérarchique de planification tâche-et-mouvement (TAMP), une méthode basée sur un modèle vision-langage (VLM), et deux approches par apprentissage, l'une par imitation (IL) et l'autre par renforcement (RL). Le papier est publié sur arXiv sous la référence 2608.27371, avec une page projet disponible sur pie-lab.cn/ESRP. L'intérêt de ce travail tient à sa contrainte centrale: contrairement aux tâches de réarrangement étudiées jusqu'ici, ESRP interdit tout accès à un état global de la scène et introduit des occlusions mutuelles entre objets, ce qui oblige l'agent à recouper des vues partielles avec un objectif global, un problème représentatif des limites réelles du déploiement robotique. Les résultats expérimentaux montrent que les quatre approches testées, y compris celles fondées sur des modèles vision-langage, peinent à accomplir la tâche efficacement sur un horizon long. Ce constat va à l'encontre de l'idée reçue selon laquelle les architectures VLA ou VLM se généralisent facilement à des tâches de planification complexe: ici, ni la planification symbolique classique ni l'apprentissage ne suffisent seuls face à la perception partielle et aux occlusions. ESRP s'inscrit dans la lignée des benchmarks de réarrangement de scènes utilisés pour évaluer la compréhension spatiale et la planification à long horizon chez les agents incarnés, mais se distingue en supprimant l'hypothèse commode d'un accès à l'état complet de l'environnement. Aucun calendrier de déploiement industriel n'est annoncé: il s'agit d'un jalon de recherche ouvert, destiné à servir de terrain d'essai standardisé pour la communauté avant tout transfert vers des scénarios robotiques réels.

RecherchePaper
1 source
CIDER : distillation interactive continue pour l'apprentissage par renforcement incarné
3arXiv cs.RO 

CIDER : distillation interactive continue pour l'apprentissage par renforcement incarné

Des chercheurs en robotique ont publié en août 2026 sur arXiv (référence 2608.21899v1) un article décrivant CIDER (Continual Interactive Distillation for Embodied Reinforcement Learning), un cadre d'apprentissage par renforcement continu pour bras manipulateurs. Le système part d'un constat pratique : l'apprentissage par renforcement interactif en boucle humaine sur robot réel permet déjà d'acquérir une politique de manipulation efficace pour une tâche donnée en quelques dizaines de minutes, mais aucune méthode existante ne parvenait à enchaîner plusieurs tâches sans oubli catastrophique des compétences précédentes. CIDER gèle la politique historique cumulée pour en faire un modèle "professeur" avant chaque nouvel apprentissage, puis alterne apprentissage de la nouvelle tâche et distillation de rétention, avec un mécanisme de séparation des gradients ("gradient routing") qui distingue ceux dédiés à l'acquisition de la nouvelle tâche de ceux dédiés à la préservation des comportements acquis. L'équipe a testé un unique acteur partagé sur six tâches de manipulation réelles, domestiques et industrielles, chaque nouvelle tâche étant apprise en 10 à 20 minutes tout en conservant un taux de succès mesuré élevé sur les tâches précédentes, alors que toutes les méthodes de référence comparées oublient au moins une compétence en cours de séquence. Ce résultat compte dans un secteur où l'apprentissage continu reste l'un des principaux verrous pour des robots véritablement polyvalents. La plupart des politiques de manipulation actuelles, qu'elles reposent sur des modèles vision-langage-action comme Pi-0, GR00T N2 ou Helix, sont entraînées hors ligne sur de larges jeux de données agrégés plutôt que mises à jour en continu sur le terrain ; ajouter une tâche implique généralement un nouveau cycle d'entraînement et une revalidation complète des compétences existantes. En montrant qu'un seul acteur peut apprendre séquentiellement six tâches réelles sans réentraînement complet ni dégradation mesurée des tâches antérieures, CIDER ouvre une piste pour des intégrateurs qui voudraient faire évoluer un robot déployé en usine ou en environnement domestique en lui ajoutant des tâches au fil de l'eau, sans immobiliser la ligne pour une campagne de réentraînement globale. Il s'agit néanmoins d'un résultat de recherche obtenu en laboratoire sur six tâches et un seul bras robotique, pas d'un produit commercialisé ni d'un déploiement en flotte. CIDER s'inscrit dans la lignée des travaux récents sur l'apprentissage par renforcement interactif en boucle humaine, qui ont déjà montré qu'un robot pouvait acquérir une tâche de manipulation en quelques dizaines de minutes avec une supervision humaine ponctuelle ; la contribution ici est d'étendre ce paradigme à l'apprentissage continu, un problème jusque-là traité surtout via l'apprentissage par imitation à grande échelle sur des modèles fondation de type VLA plutôt que par du renforcement en ligne. Les auteurs positionnent explicitement leur approche face aux méthodes existantes de renforcement continu en conditions réelles, qui ne contraignent pas le comportement antérieur et souffrent donc d'un oubli sévère. Des études d'ablation accompagnent l'article pour isoler les choix de conception qui gouvernent l'arbitrage entre stabilité, soit la conservation des acquis, et plasticité, soit la capacité à apprendre du nouveau, un compromis classique en apprentissage continu. L'article ne mentionne ni partenariat industriel, ni feuille de route de déploiement au-delà du laboratoire, ni calendrier de suite annoncé.

RecherchePaper
1 source
Modèle vision-langage-action débiaisé causalement pour modèles du monde conditionnés par l'action incarnée
4arXiv cs.RO 

Modèle vision-langage-action débiaisé causalement pour modèles du monde conditionnés par l'action incarnée

Des chercheurs publient sur arXiv (arXiv:2607.09185v1) un nouveau framework baptisé CD-LAM, destiné à améliorer les modèles du monde conditionnés par l'action (ACWM), ces systèmes qui simulent les observations futures d'un robot en fonction des actions qu'il pourrait exécuter. Ces modèles reposent sur des données massives étiquetées avec les actions correspondantes, coûteuses à collecter en conditions réelles. Pour contourner ce goulot d'étranglement, les modèles d'action latente (LAM) infèrent des actions directement depuis des vidéos non étiquetées, mais souffrent d'un biais connu : entraînés uniquement sur des objectifs de reconstruction, ils mélangent la dynamique liée à l'action avec des éléments visuels non pertinents comme l'arrière-plan ou des objets non manipulés. CD-LAM introduit trois objectifs de fine-tuning complémentaires, une reconstruction centrée sur le corps du robot, un apprentissage contrastif centré sur l'action, et une calibration de l'espace latent, pour produire des représentations plus fidèles et non dégénérées. Testé sur des backbones ACWM de 2 et 14 milliards de paramètres, CD-LAM améliore la contrôlabilité des actions latentes, le suivi des commandes en aval, la fidélité visuelle, et ne nécessite que 6 000 étapes de fine-tuning, soit plus de 12 fois moins de mises à jour d'adaptation que la méthode de référence. L'enjeu dépasse la seule performance technique : réduire d'un facteur 12 le coût d'adaptation d'un modèle du monde à un nouveau robot ou une nouvelle tâche s'attaque directement au principal frein à l'échelle des politiques robotiques actuelles, la rareté des données actions-étiquetées réelles. Ce type de travail nourrit la course aux modèles VLA (vision-language-action) comme Pi-0, GR00T N2 ou Helix, où la capacité à généraliser à partir de peu de démonstrations conditionne la viabilité commerciale des humanoïdes. Il faut toutefois distinguer clairement ce résultat, une contribution de recherche à l'échelle du benchmark, d'un déploiement en production. CD-LAM s'inscrit dans la lignée des travaux récents sur les modèles d'action latente, une direction de recherche née du constat que l'étiquetage manuel des actions robotiques ne passera jamais à l'échelle des humanoïdes commerciaux. L'abstract ne cite ni laboratoire ni entreprise précise, signe d'une publication académique classique plutôt que d'une annonce produit. Les auteurs évoquent des pistes de suite via l'adaptation à davantage de plateformes robotiques et de backbones plus larges, sans calendrier de déploiement communiqué.

RecherchePaper
1 source