Aller au contenu principal
Ce qui se prépare pour #IROS2026
RechercheRobohub 

Ce qui se prépare pour #IROS2026

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

La 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026) se tiendra du 27 septembre au 1er octobre à Pittsburgh, aux États-Unis. Le programme comprend des conférences plénières et des keynotes, des workshops, des tutoriels, des forums, des compétitions et un débat. Les keynotes se dérouleront du 28 au 30 septembre avec une quinzaine d'intervenants confirmés, dont Elena De Momi sur la chirurgie autonome, Genta Suzuki (Fujitsu) sur le système d'exploitation physique Kozuchi Physical OS pour l'IA physique à l'échelle, Al Rizzi sur les capacités robotiques développées au RAI Institute, He Wang sur un possible "moment AlphaGo/ChatGPT" de l'IA incarnée, Yekai Sun sur l'accélération de l'apprentissage via des données multimodales incarnées, Robin Murphy sur la robotique de catastrophe, David Held sur l'adaptation rapide des politiques après déploiement, et Ralph Hollis sur la lévitation de Lorentz pour la manipulation fine. Deux intervenants, Gaurav Bansal et Nancy Pollard, figurent encore avec un titre à confirmer. La conférence prévoit aussi trois panels pléniers (startups et entrepreneuriat le 28, spatial le 29, généralistes contre spécialistes en robotique le 30), trois forums de discussion ouverts (financement public américain, éducation en robotique, sous-investissement présumé dans les fondations de la discipline), ainsi que 44 workshops et tutoriels le 27 septembre et 42 supplémentaires le 1er octobre, soit 86 sessions au total.

Ce programme donne une photographie assez nette des priorités actuelles du secteur académique et industriel de la robotique. La récurrence de thèmes comme l'IA physique, les modèles vision-langage-action et les données multimodales incarnées confirme que la course à des systèmes généralistes capables d'apprendre après déploiement, plutôt que des robots figés en usine, structure désormais la recherche autant que l'industrie. Le forum consacré au sous-investissement dans les fondations de la robotique, tout comme le débat plénier sur généralistes contre spécialistes, signale des tensions réelles sur la manière dont capital et effort de recherche devraient être alloués, entre paris sur des plateformes universelles et optimisation de systèmes dédiés à des tâches précises. Pour les intégrateurs et décideurs B2B, ces sessions valent moins comme annonces produit que comme baromètre des orientations que labos et grands groupes jugeront prioritaires dans les 12 à 24 mois à venir.

IROS est, avec ICRA, l'une des deux conférences généralistes de référence en robotique, organisée conjointement par l'IEEE et la Robotics Society of Japan, et sert traditionnellement de vitrine à la fois académique et industrielle, avec tours techniques et compétitions en marge du programme scientifique. L'édition 2026 illustre la montée en puissance d'acteurs industriels dans la programmation scientifique, à l'image de Fujitsu ou du RAI Institute aux côtés des laboratoires universitaires habituels. Une session d'initiation à la communication scientifique est prévue le 29 septembre à 11h00 avec Sabine Hauert, Ella Scallan et Evan Ackerman d'IEEE Spectrum, signe de l'attention croissante portée à la médiatisation de la recherche robotique. Aucun acteur français ou européen n'apparaît nommément dans le programme communiqué à ce stade.

Impact France/UE

Aucun acteur français ou européen n'apparaît nommément dans le programme d'IROS 2026 communiqué à ce stade.

À lire aussi

Ce qu'il faut à un robot pour dialoguer avec toute une pièce, pas seulement une personne
1Robohub 

Ce qu'il faut à un robot pour dialoguer avec toute une pièce, pas seulement une personne

Imperial College London a accueilli, du 20 au 24 juillet, la Imperial Robotics Summer School, un programme intensif réunissant chercheurs en début de carrière, académiques et professionnels de l'industrie robotique. Parmi les participants figurait Umar Farooq, dont la place a été financée par le programme britannique UK RAS STEPS, qui a sélectionné cinq jeunes chercheurs (RTP) pour y assister, avec le soutien de Marie Daniels pour le processus de candidature. Le programme combinait cours magistraux sur la cinématique, la dynamique, la perception et le contrôle des robots, sessions spécialisées sur la robotique aérienne, l'intelligence robotique, la vision en chirurgie robotique, la perception et le contrôle bio-inspirés, ainsi que la robotique d'assistance personnelle. Les participants ont aussi visité les laboratoires d'Imperial dédiés à la robotique adaptative et intelligente, à la robotique aérienne, à la chirurgie robotique, à la manipulation tactile et à l'assistance. Le projet de groupe d'Umar Farooq portait sur l'interaction homme-robot multi-personnes: détection de l'interlocuteur actif en temps réel, suivi de l'identité de chaque personne au fil de l'échange, et génération de comportements naturels de regard et de rotation de tête pour que le robot paraisse attentif à l'ensemble du groupe plutôt qu'à un seul individu. Ce projet illustre un angle mort fréquent de la robotique sociale actuelle: la plupart des robots conversationnels sont conçus pour une interaction un-à-un, alors que les usages réels, accueil, assistance en entreprise, environnements de soin, impliquent souvent plusieurs interlocuteurs simultanés. L'exercice a aussi permis de dérouler concrètement la chaîne technique complète reliant le langage au mouvement: un LLM traduit une intention exprimée en langage naturel en commandes structurées, celles-ci sont converties en fonctions robotiques de haut niveau, la cinématique inverse les transforme en trajectoires articulaires, qui sont enfin exécutées par la pile de contrôle jusqu'aux actionneurs. Loin d'un produit commercial ou d'une démonstration marketing, ce travail de formation souligne la difficulté réelle de l'interaction homme-robot multi-partie et la nécessité d'une approche interdisciplinaire, mêlant traitement du langage, perception, planification et contrôle moteur, pour qu'un robot social fonctionne au-delà du cas d'usage scripté à deux. Ce stage s'inscrit dans l'action plus large de UK RAS STEPS, le réseau britannique de robotique et systèmes autonomes, qui multiplie les ateliers de formation pour les chercheurs en début de carrière au-delà de cette seule summer school. Aucun produit ni déploiement commercial n'est annoncé ici: il s'agit d'un exercice académique destiné à structurer la prochaine génération de chercheurs britanniques en robotique, sur des thématiques allant de la locomotion quadrupède à l'apprentissage par vision, en passant par la robotique chirurgicale et la robotique d'assistance. Les suites concrètes évoquées restent la poursuite de la participation aux ateliers UK RAS STEPS et l'approfondissement des recherches menées dans les laboratoires d'Imperial College.

UEProgramme de formation britannique (hors UE), sans impact direct sur la France ou l'Union europeenne.

RecherchePaper
1 source
Play2Perfect : ce qui compte dans le pré-entraînement par jeu habile pour l'assemblage de précision
2arXiv cs.RO 

Play2Perfect : ce qui compte dans le pré-entraînement par jeu habile pour l'assemblage de précision

Des chercheurs ont publié fin juin 2026 sur arXiv (2606.26428) Play2Perfect, un cadre d'apprentissage par renforcement pour entraîner des robots à mains multi-doigts à réaliser des assemblages de précision, sans pinces spécialisées ni montages mécaniques contraignants. Le principe repose sur deux phases : un pré-entraînement agnostique à la tâche, dit "play", où le robot explore des objets et objectifs variés pour acquérir des priors de manipulation réutilisables (saisie, réorientation en main, atteinte de pose), puis un affinage ciblé sur l'assemblage précis. Les résultats avancés sont nets : Play2Perfect atteint une efficacité 33 fois supérieure en termes d'échantillons par rapport à un entraînement RL from scratch avec récompenses denses et multi-étapes, 60 % de succès sur des insertions serrées à 0,5 mm de jeu de contact, et plus de 50 % sur des assemblages multi-pièces et des vissages en longues séquences. Le transfert sim-to-real est réalisé en zéro-shot, sans entraînement supplémentaire sur robot physique. Ces résultats s'attaquent à un verrou structurel de la robotique dextère : les tâches à contact riche résistent à l'imitation learning (collecte de données difficile sur mains multi-doigts) et à l'RL classique (récompenses trop parses pour explorer efficacement). Un jeu de 0,5 mm correspond à des tolérances industrielles réelles, pas à des benchmarks assouplis. Si la démonstration du sim-to-real zéro-shot s'avère reproductible, elle signalerait que le fossé simulation-réalité pour la manipulation fine commence à se résorber, un signal fort pour les équipes qui investissent dans les mains robotiques. Il s'agit toutefois d'un preprint non encore soumis à revue par les pairs, sans déploiement industriel confirmé. La manipulation dextère fine est restée un défi depuis OpenAI Dactyl (2019) sur le cube Rubik, malgré des années de recherche avec des environnements très contraints. Play2Perfect s'inspire du paradigme "play then perfect", appliqué jusqu'ici à la locomotion et aux jeux de blocs, et l'étend pour la première fois aux assemblages industriels précis avec mains multi-doigts, sans structures d'aide. Aucune affiliation institutionnelle n'est précisée dans la publication ; les suites logiques seraient une validation sur un spectre plus large de pièces industrielles et une évaluation de la robustesse aux perturbations du monde réel.

RecherchePaper
1 source
MOFU : ce mini-robot à fourrure se gonfle et se dégonfle en respirant pour paraître plus vivant
3Interesting Engineering 

MOFU : ce mini-robot à fourrure se gonfle et se dégonfle en respirant pour paraître plus vivant

Un robot mobile sphérique baptisé MOFU (MOrphing Fluffy Unit), développé conjointement par des chercheurs de l'Université d'Electro-Communications (UEC) au Japon et par Sony Corporation, fait l'objet d'une étude publiée dans la revue PLOS ONE consacrée à la perception de l'"animacy", c'est-à-dire le degré auquel un objet paraît vivant. MOFU repose sur une structure géométrique de type Jitterbug, où plusieurs segments se déplacent de façon coordonnée pour modifier l'ensemble du volume du robot. Un seul mécanisme linéaire motorisé fait varier sa hauteur d'environ 210 à 280 millimètres lors de l'expansion et de la contraction, tandis qu'un système de traction différentielle à deux roues lui permet d'avancer en ligne droite ou de pivoter. Recouvert d'un pelage doux et doté d'une forme abstraite plutôt que d'une ressemblance animale précise, l'engin utilise des moteurs à entraînement direct pour limiter le bruit mécanique et embarque une batterie qui le rend autonome, sans câble. Pour tester l'effet de ce mouvement volumétrique, les chercheurs ont mené trois expériences vidéo en ligne auprès de 498 participants, qui notaient l'animacy perçue de MOFU sur l'échelle du Godspeed Questionnaire Series (version japonaise, six items, note sur cinq). Résultat : l'expansion-contraction et la rotation augmentent chacune la perception d'animacy par rapport à l'absence de mouvement, sans différence nette entre les deux effets ; utiliser deux robots plutôt qu'un seul ne change rien à ce constat ; et un robot combinant expansion, rotation et déplacement est jugé plus vivant qu'un robot qui se contente de rouler, bien que cette dernière expérience, menée avec un échantillon plus restreint que prévu, nécessite une réplication. L'intérêt pour l'industrie de la robotique sociale et de l'interaction homme-robot est de proposer un canal d'expressivité alternatif aux visages, écrans ou bras articulés habituellement utilisés pour rendre un robot attachant. Un simple changement de volume corporel, sans traits faciaux ni gestuelle complexe, suffirait à modifier la perception de vivant, ce qui ouvre une piste de conception moins coûteuse et mécaniquement plus simple pour des robots compagnons ou d'accueil. Il s'agit toutefois d'une recherche académique en amont, testée uniquement via des vidéos de vingt secondes, et non d'un produit commercialisé ou déployé. Le concept s'inspire de phénomènes biologiques comme la respiration ou les parades animales, telles que la poche gulaire gonflable de la frégate ou le déploiement de la roue du paon. Les auteurs annoncent vouloir comparer directement ce mouvement à d'autres formes de gestuelle robotique et faire varier vitesse, amplitude et timing, tout en reconnaissant les limites d'une évaluation purement vidéo qui ne mesure ni la texture, ni le son, ni la présence physique du robot.

RecherchePaper
1 source
Ce qui compte pour les actions latentes dans l'apprentissage robotique
4arXiv cs.RO 

Ce qui compte pour les actions latentes dans l'apprentissage robotique

Des chercheurs publient sur arXiv (2608.19613v1, article inédit non encore évalué par les pairs) la première étude empirique systématique consacrée aux Latent Action Models (LAM), une famille de modèles qui permet à l'apprentissage robotique d'exploiter de grands volumes de vidéos non étiquetées en les traduisant en actions latentes, des substituts compacts aux commandes physiques réelles. Les auteurs unifient les méthodes LAM existantes dans un cadre autoencodeur commun, puis testent systématiquement 41 choix de conception répartis en trois axes : les paradigmes de modélisation des actions latentes, les objectifs d'apprentissage et méthodes de régularisation associées, et les stratégies d'intégration de ces actions latentes dans les politiques de contrôle robotique. Ils évaluent également quatre métriques proxy censées juger la qualité des actions latentes, en vérifiant si elles prédisent effectivement la performance en manipulation. Les expériences couvrent trois benchmarks standards du domaine, avec une validation complémentaire sur des tâches de manipulation exécutées par un robot réel. Le résultat principal, le fine-tuning du backbone d'un modèle vision-langage (VLM) avec des actions latentes offre une meilleure initialisation pour l'apprentissage de politiques robotiques en aval qu'une simple utilisation figée du VLM, apporte une base empirique à un pan de recherche jusqu'ici dispersé. Pour les équipes qui développent des modèles VLA (vision-langage-action), ce travail répond à un problème concret : la rareté et le coût des données d'action étiquetées poussent le secteur à préentraîner sur des vidéos non annotées, mais chaque laboratoire testait ses propres choix d'architecture dans des conditions expérimentales différentes, rendant les comparaisons peu fiables. Cette étude fournit des repères de conception réels plutôt que des affirmations marketing sur le préentraînement vidéo. Le contexte est celui d'un champ de recherche fragmenté : les méthodes LAM se sont multipliées ces dernières années sans cadre d'évaluation commun, chaque publication isolant une variable différente. En proposant un cadre unifié et une comparaison à grande échelle de 41 configurations, les auteurs cherchent à combler ce vide méthodologique. Il s'agit d'un travail académique de type ablation étude, pas d'un produit ni d'un déploiement commercial : les suites attendues concernent l'adoption de ces recommandations de conception par les équipes développant des modèles VLA préentraînés sur vidéo à plus grande échelle.

RecherchePaper
1 source