Poussée à horizon glissant avec politiques composables centrées objet
Une équipe de recherche publie le 22 septembre 2026 sur arXiv (arXiv:2609.23439v1) une méthode hiérarchique de manipulation non préhensile, pousser un objet plutôt que le saisir, utile pour déplacer des charges volumineuses, lourdes ou impossibles à empoigner. Une politique apprise prédit, depuis un nuage de points normalisé, les contacts pour atteindre un sous-objectif proche, évalués par un score de stabilité glissement contre basculement, tandis que l'algorithme BIT* planifie la trajectoire globale de l'objet, vérifie la faisabilité des sous-objectifs suivants et replanifie en cas d'échec, une seule action étant exécutée par cycle, à horizon glissant. Testée en simulation sur 22 objets dans six scènes avec des études d'ablation, la méthode a aussi été validée sur un bras Franka et, qualitativement, sur un manipulateur mobile portant des charges lourdes, avec un transfert direct de la simulation vers le réel, sans réentraînement.
Ce travail répond à un besoin concret en logistique et en industrie, où de nombreux objets sont trop volumineux, lourds ou irréguliers pour une préhension classique et où pousser reste souvent la seule option de repositionnement. Le verrou visé est le couplage entre trois décisions habituellement traitées séparément où pousser, si le contact est stable, si les actions suivantes resteront possibles, principale cause d'échec des approches réactives à un seul pas sur des tâches longues. Le transfert zero-shot vers un bras réel, s'il se confirme, appuierait l'idée qu'une politique apprise en simulation généralise sans réglage coûteux sur robot physique, mais les résultats sur manipulateur mobile restent qualitatifs et le banc d'essai simulé, 22 objets et six scènes, demeure modeste; il s'agit d'une prépublication non revue par les pairs, une preuve de concept plus qu'une solution prête au déploiement.
Cette approche prolonge les travaux cherchant à dépasser les politiques de poussée réactives à un seul pas, en les couplant à une planification à plus long terme capable d'anticiper obstacles et échecs de mouvement plutôt que de tout recalculer à chaque étape. Elle se distingue des politiques génératives de bout en bout entraînées sur de vastes corpus de démonstrations en conservant un score de stabilité physique explicite et un planificateur séparé de la politique de contact apprise. Le résumé ne précise ni institution ni calendrier de déploiement, mais vise une généralité démontrée sur des scènes et géométries variées, sur un terrain où la manipulation non préhensile reste peu couverte par les modèles vision-langage-action mis en avant dans la robotique généraliste.
Dans nos dossiers




