PackLab : un cadre complet pour développer, entraîner et évaluer les MLLM en bin packing robotique
Des chercheurs présentent PackLab, un framework complet pour développer, entraîner et évaluer des modèles de langage multimodaux (MLLM) appliqués au bin packing robotique, où chaque placement d'objet conditionne l'espace disponible pour les suivants. Publié sur arXiv (2609.23784), le système combine trois briques : PackLab-Suite, une plateforme de simulation physique générant à grande échelle des trajectoires d'empilement variées pour l'entraînement et l'évaluation des résultats ; PackLab-VLM, un modèle multimodal spécialisé qui perçoit l'état évolutif des objets et du contenant pour choisir l'objet suivant et prédire son placement en boucle fermée ; et PackLab-Bench, un benchmark standardisé proposant plusieurs niveaux de difficulté pour une évaluation systématique. Le code, le modèle, le jeu de données et le benchmark sont publiés en accès libre sur GitHub, sous le dépôt Correr-Zhou/PackLab.
Le bin packing robotique est un cas d'usage central en logistique et en préparation de commandes, une décision séquentielle sur horizon long où les solutions existantes reposent soit sur des heuristiques géométriques manuelles optimisant des objectifs prédéfinis, soit sur des politiques d'apprentissage par renforcement entraînées par essais-erreurs sur des configurations fixes, deux approches jugées peu robustes face à la diversité réelle des objets et des contenants. Les auteurs indiquent que PackLab-VLM surpasse en moyenne ces heuristiques classiques, les méthodes de RL traditionnelles et des MLLM généralistes sur plusieurs jeux d'objets et configurations de contenants, un résultat à prendre avec prudence puisqu'il provient des auteurs eux-mêmes sans validation indépendante tierce. Pour les intégrateurs logistiques, le signal reste notable : les modèles multimodaux entraînés spécifiquement pourraient traiter la planification combinatoire aussi bien que la manipulation fine, domaine où l'approche VLA s'était surtout illustrée jusqu'ici.
Le travail s'inscrit dans la généralisation des MLLM aux tâches de décision robotique en boucle fermée, au delà de la perception et de la manipulation guidée par le langage. PackLab-VLM n'est pas un simple habillage d'un modèle généraliste appliqué tel quel à la tâche : il est spécifiquement entraîné via les trajectoires générées par PackLab-Suite, distinction que les auteurs mettent en avant en comparant leurs résultats à ceux de MLLM généralistes non spécialisés. Aucun déploiement industriel ni partenaire commercial n'est mentionné dans la publication : il s'agit à ce stade d'une contribution de recherche académique, avec mise à disposition ouverte du code et du benchmark comme référence pour la communauté, avant toute validation sur robot physique réel et tout élargissement à des objets et contenants encore plus hétérogènes.
Dans nos dossiers




