Aller au contenu principal
RecherchearXiv cs.RO 

Station holding égocentrique d'un poisson robotique dans un écoulement turbulent inconnu

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Des chercheurs présentent SWiFT (Swimming With Flow Toolbox), un cadre d'apprentissage par renforcement permettant à un poisson robotique de type BCF (corps et nageoire caudale) de maintenir sa position dans un courant turbulent inconnu, sans capteur de flux dédié. Le système combine un banc d'essai en canal hydraulique avec nage libre, un simulateur de mécanique des fluides numérique (CFD) conçu pour rester physiquement cohérent tout en restant efficace en calcul, et un pipeline de transfert simulation vers réel. La politique de contrôle obtenue s'appuie uniquement sur un retour égocentrique, c'est à dire la perception du robot sur son propre état, sans mesure explicite du courant environnant. Selon les auteurs, elle dépasse les méthodes de référence existantes sur l'ensemble des métriques testées, avec une amélioration notable de l'erreur quadratique moyenne (RMSE) sur la distance à la position cible. L'article, publié sur arXiv fin juillet 2026, reste un préprint de recherche et non un produit ou un système déployé en conditions réelles.

L'enjeu est significatif pour la robotique sous marine: tenir une station fixe face à un courant est une brique de base pour l'inspection de structures, la surveillance environnementale ou l'intervention en eaux naturelles, un environnement bien plus imprévisible que les bassins contrôlés où la plupart des poissons robotiques ont jusqu'ici été testés. Le résultat suggère qu'un contrôle purement égocentrique suffit à répliquer un comportement proche de la rhéotaxie observée chez les poissons biologiques, ce qui simplifierait l'instrumentation nécessaire sur de futurs robots sous-marins tout en améliorant leur robustesse face à des flux non caractérisés à l'avance.

Ce travail s'inscrit dans une lignée de recherches sur l'efficacité et la maniabilité des poissons robotiques, un domaine actif depuis plusieurs décennies mais où la tenue de station en flux inconnu restait peu explorée, faute de modèles fiables des interactions fluide-structure fortement non linéaires en nage libre. Les auteurs positionnent SWiFT comme une fondation réutilisable pour des tâches de nage plus complexes, avec pour prochaine étape l'extension à d'autres scénarios de manœuvre en environnement turbulent réel.

Dans nos dossiers

À lire aussi

Estimation de pose 6-DOF pour objets inconnus : vers un déploiement robotique à grande échelle
1arXiv cs.RO 

Estimation de pose 6-DOF pour objets inconnus : vers un déploiement robotique à grande échelle

Une équipe de chercheurs a publié en 2025 SinRef-6D, une méthode d'estimation de pose 6-DoF (six degrés de liberté) conçue pour des objets inconnus à partir d'une seule image de référence RGB-D. Contrairement aux approches dominantes qui exigent soit un modèle CAO complet, soit un ensemble dense de vues de référence, SinRef-6D n'utilise qu'un unique cliché annoté capturé pendant la manipulation robotique. Le système a été validé sur six benchmarks académiques standards et intégré dans un système robotique réel pour des tâches de préhension (grasping). Le code source et des démonstrations vidéo sont disponibles publiquement via le site associé à l'article. L'enjeu est significatif pour les intégrateurs industriels : l'absence de dépendance à un modèle CAO ou à une base de données de vues représente un frein majeur au déploiement de la manipulation robotique en environnement non contrôlé. Si la méthode tient ses promesses à l'échelle, elle réduit le coût de mise en service pour des objets nouveaux ou variables, un problème concret dans la logistique, le pick-and-place e-commerce ou l'assemblage à variantes élevées. Le système repose sur des State Space Models (SSMs), une architecture alternative aux Transformers qui offre une complexité linéaire pour la modélisation de dépendances spatiales longue portée à partir d'un seul point de vue. Cela permet de compenser la pauvreté géométrique inhérente à une image unique, via un alignement itératif point-à-point dans un système de coordonnées objet commun. Une nuance s'impose cependant : les démonstrations robotiques présentées restent des scénarios de laboratoire, et aucune donnée de déploiement industriel à grande échelle n'est communiquée. La problématique de la scalabilité en estimation de pose est active depuis plusieurs années, avec des travaux comme FoundPose, FoundPose, Gen6D ou GigaPose qui tentent chacun de réduire la dépendance aux données de référence. SinRef-6D se positionne sur le segment le plus contraint, une seule vue, ce qui le distingue techniquement mais pose la question de la robustesse face aux occlusions partielles ou aux variations d'éclairage importantes, non documentées dans l'abstract. Les prochaines étapes attendues pour ce type de travaux incluent l'intégration dans des pipelines de manipulation généraliste (type pi0 ou RDT-1B), où l'estimation de pose externe peut compléter les approches end-to-end visuomotrices.

RecherchePaper
1 source
Suivi du visage ou du corps pour l'interaction humain-robot : un jeu de données égocentrique
2arXiv cs.RO 

Suivi du visage ou du corps pour l'interaction humain-robot : un jeu de données égocentrique

Des chercheurs ont publié en juin 2026 sur arXiv (arXiv:2606.03694) une évaluation systématique des méthodes de suivi visuel pour la robotique sociale, en s'appuyant sur un jeu de données original capturé via le robot social Furhat. L'enjeu central est la continuité d'identification des utilisateurs pendant une interaction : lorsqu'un robot perd de vue son interlocuteur, même brièvement, il peut confondre deux personnes distinctes, phénomène désigné sous le terme "identity switch" (IDSW). L'étude compare deux approches (suivi par le visage versus suivi par le corps entier) et évalue l'effet de deux mécanismes complémentaires : la mémoire spatiale étendue et la réidentification par apparence (ReID). Le pipeline optimisé qui en résulte réduit les IDSW de 49 %, limitant ainsi les ruptures de dialogue entre humains et robots. Les résultats mettent en lumière une tension technique inattendue : la ReID améliore substantiellement la stabilité du suivi corporel, mais dégrade celui du visage en raison d'une sensibilité aux angles de profil. Ce comportement antagoniste n'est pas anodin pour les intégrateurs de systèmes HRI, qui ne peuvent pas transposer mécaniquement les mêmes optimisations à toutes les modalités de tracking. Plus fondamentalement, l'étude confirme que les modèles de vision par ordinateur les plus performants, conçus pour la vidéosurveillance ou la conduite autonome, ne couvrent pas les contraintes propres à la robotique sociale : occlusions mutuelles entre interlocuteurs, mouvements brusques, sorties et rentrées dans le champ de vision à courte distance. Le fossé entre démo contrôlée et déploiement réel reste ouvert pour les systèmes HRI en environnements denses. Furhat Robotics, entreprise suédoise spécialisée dans les robots conversationnels à tête projetée, fournit ici la plateforme matérielle, ce qui oriente naturellement l'évaluation vers les contextes face-à-face rapprochés. Dans le secteur plus large de la perception pour l'interaction humain-robot, des laboratoires académiques européens comme l'INRIA ou TU Delft, ainsi que des acteurs industriels tels SoftBank Robotics, travaillent sur des problématiques proches. Le point de friction central souligné par les auteurs reste l'absence de benchmarks publics capturant des occlusions denses à courte distance : sans jeux de données nativement sociaux, la validation des modèles de perception HRI demeure partielle. Les prochaines étapes naturelles consisteraient à tester ce pipeline sur d'autres plateformes et en conditions multi-utilisateurs réelles.

UEFurhat Robotics (Suède, UE) fournit la plateforme matérielle de l'étude, et l'INRIA est cité parmi les laboratoires européens travaillant sur des problématiques similaires, ce qui ancre ces avancées en perception HRI dans l'écosystème de recherche européen.

RecherchePaper
1 source
Let the Body Follow : contrôle égocentrique couplé pour la téléopération d'un robot en corps entier
3arXiv cs.RO 

Let the Body Follow : contrôle égocentrique couplé pour la téléopération d'un robot en corps entier

Voici l'article : Une équipe de recherche présente le "coupled egocentric control" (contrôle égocentrique couplé), une nouvelle approche de téléopération pour robots à corps complet, détaillée dans un article publié sur arXiv le 20 juillet 2026 (arXiv:2607.16095v1). Le problème visé : lors d'une téléopération classique d'un robot mobile manipulateur, l'opérateur doit gérer simultanément la tête, les bras, le torse et la base, généralement via des commandes explicites au pavé tactile pour chaque ajustement de posture, ce qui alourdit considérablement la charge cognitive. La solution proposée fait suivre automatiquement le torse et la base aux mouvements de tête et de bras de l'opérateur : le tangage (pitch) de la tête ajuste la hauteur du torse, le lacet (yaw) de la tête pilote la rotation de la base, la hauteur de l'effecteur terminal module le mouvement du torse, et le franchissement des limites de l'espace de travail de l'effecteur déclenche une translation de la base. Les chercheurs ont testé ce système lors d'une étude utilisateur sur un robot mobile manipulateur TIAGo, pour des tâches inspirées de l'assistance à domicile, en le comparant à une interface hybride classique. Cette approche s'attaque à un vrai goulot d'étranglement de la téléopération de robots humanoïdes et mobiles : la coordination motrice entre perception, manipulation et déplacement, souvent citée comme facteur limitant pour des applications comme la téléassistance à domicile ou les interventions à distance en environnement dangereux. Les résultats de l'étude sont positifs sur plusieurs axes mesurables : meilleure efficacité de manipulation d'objets, réduction du recours aux commandes au pavé tactile, moins de singularités cinématiques des bras, charge mentale et effort perçu plus faibles, et préférence utilisateur plus marquée pour le contrôle du torse et de la base. Ces gains, s'ils se confirment à plus grande échelle, pourraient simplifier l'entraînement des opérateurs et réduire la fatigue lors de sessions de téléopération prolongées, un enjeu concret pour les déploiements commerciaux de robots téléopérés en environnement réel plutôt qu'en démonstration contrôlée. Le travail s'inscrit dans la lignée des recherches en interfaces homme-robot visant à réduire la charge de contrôle explicite en exploitant les intentions naturelles de l'opérateur (regard, posture) plutôt que des commandes manuelles dédiées, une direction déjà explorée pour les bras robotiques mais moins pour la coordination corps entier incluant base mobile. Le choix du TIAGo, plateforme de recherche standard de PAL Robotics, en fait une étude de faisabilité plutôt qu'un système prêt à déployer ; les auteurs ne mentionnent pas de suite industrielle ou de partenariat commercial à ce stade. La validation reste limitée à une étude utilisateur en laboratoire sur des tâches inspirées du soin à domicile, sans indication de volumes testés, de durée des sessions ni de profil des participants, ce qui appelle à la prudence avant d'extrapoler ces gains à des contextes de téléopération professionnelle à grande échelle.

UELe robot utilisé pour l'étude, TIAGo, est développé par PAL Robotics, entreprise espagnole, ce qui ancre cette recherche en téléopération dans l'écosystème robotique européen, sans toutefois de suite industrielle ou déploiement commercial annoncé.

RecherchePaper
1 source
Co-entraînement avec vidéo égocentrique et démonstration pour la navigation robotique
4arXiv cs.RO 

Co-entraînement avec vidéo égocentrique et démonstration pour la navigation robotique

Des chercheurs ont publié sur arXiv (réf. 2606.01951) un cadre d'apprentissage par imitation pour robots mobiles qui exploite des vidéos égocentrées tournées par des humains en train de marcher. Le principe : estimer le mouvement de la caméra à partir de ces séquences piétonnes, puis convertir ce flux en représentations d'actions compatibles avec des robots mobiles au sol. Un modèle VLA (Vision-Language-Action) est ensuite entraîné conjointement sur ces données dérivées de vidéos humaines et sur des trajectoires collectées directement par le robot. Les expériences portent sur une tâche de navigation avec recherche de fruits, où le robot doit localiser des objets cibles dans un environnement non structuré en suivant des instructions en langage naturel. L'intérêt de cette approche réside dans sa réponse au principal goulot d'étranglement de la robotique apprise : la collecte de données sur robot réel est coûteuse, lente, et difficilement scalable. Si recycler des vidéos égocentrées humaines pour l'apprentissage de tâches de manipulation existe déjà dans la littérature (notamment via des datasets comme EPIC-Kitchens ou des pipelines type ACT), l'étendre à la navigation mobile reste difficile car les changements de point de vue lors de la locomotion créent des discontinuités que les modèles de manipulation ne rencontrent pas. Les résultats montrent que l'entraînement conjoint dépasse les deux sources de données prises isolément, aussi bien en compréhension du langage qu'en robustesse de génération d'actions. Cela valide partiellement l'hypothèse que le sim-to-human-video-to-real peut fonctionner pour la navigation, sans simulation physique. Ce travail s'inscrit dans une course plus large à la scalabilité des données pour les VLA, où des acteurs comme Physical Intelligence (pi0), Google DeepMind (RT-2, GR00T N2 pour Nvidia) ou Boston Dynamics cherchent des pipelines moins dépendants de la téléopération humaine sur robot. La navigation mobile reste moins couverte que la manipulation dans cette littérature, et ce papier ouvre une voie de co-training à moindre coût. Les prochaines étapes naturelles seraient d'évaluer la généralisation à des environnements plus complexes, de mesurer le ratio optimal données humaines/données robot, et de tester sur des plateformes AMR commerciales. Le code et les datasets ne sont pas encore publiés au moment de la soumission arXiv.

RechercheOpinion
1 source