Aller au contenu principal
Communication d'exécution robotique consciente du réseau pour l'inférence cloud sous connectivité spatialement hétérogène
RecherchearXiv cs.RO 

Communication d'exécution robotique consciente du réseau pour l'inférence cloud sous connectivité spatialement hétérogène

1 source couvre ce sujet·Source originale ↗·
Résumé IASource uniqueImpact UE

Les chercheurs proposent un nouveau cadre pour l'exécution robotique s'appuyant sur des modèles fondamentaux hébergés dans le cloud, dans des environnements où la connectivité sans fil varie fortement selon la position du robot. Le problème posé est concret : un robot exécute une primitive de mouvement générée à distance, et doit recevoir la suivante avant d'épuiser la marge de manœuvre de la primitive en cours. Or la qualité de connexion nécessaire pour envoyer une requête et récupérer la réponse dépend de l'endroit où se trouve le robot, pas seulement du temps de latence du réseau. Les auteurs introduisent la notion de "fenêtre requête-réponse", qui intègre le temps de transmission montante, l'inférence cloud, la récupération descendante et l'incertitude d'inférence. Sur cette base, et à partir d'une carte de communication de l'environnement, le système choisit dynamiquement un point d'envoi de requête pendant l'exécution de la primitive en cours, puis guide le robot vers ce point via un planificateur local avant de reprendre sa tâche. Les tests, menés dans un scénario intérieur construit à partir de mesures radio réelles, montrent que la méthode obtient le meilleur taux de réussite de tâche (ou ex æquo) parmi les approches comparées, avec moins de tentatives de requête et un taux d'échec de requête plus faible.

L'enjeu dépasse la démonstration académique : il touche directement à la viabilité des architectures robotiques qui délèguent le raisonnement sémantique lourd à des modèles cloud plutôt que de tout embarquer, une tendance de fond dans la robotique VLA (vision-language-action) actuelle. Jusqu'ici, la plupart des optimisations de latence réseau traitaient la transmission comme un problème purement temporel, en ignorant que la position physique du robot détermine si une requête peut même aboutir. En traitant le point de requête comme une décision de mouvement à part entière, intégrée au planificateur local, les auteurs déplacent le problème de la couche réseau vers la couche de contrôle du robot. Pour les intégrateurs qui envisagent des flottes robotiques dépendantes du cloud dans des entrepôts, usines ou espaces publics où la connectivité Wi-Fi ou 5G est hétérogène, cela offre une piste concrète pour réduire les échecs de tâche liés aux zones mortes, sans nécessiter une couverture réseau uniforme coûteuse.

Ce travail s'inscrit dans la lignée des recherches sur le déchargement de calcul (offloading) pour la robotique cloud, un axe qui a pris de l'ampleur avec la multiplication des modèles fondamentaux trop volumineux pour tourner entièrement en embarqué, à l'image des architectures VLA de type GR00T ou Helix évoquées dans l'industrie humanoïde. Contrairement aux approches qui se concentrent uniquement sur la compression de modèle ou la réduction de latence par transmission optimisée, cette étude aborde le problème sous l'angle de la planification spatiale de la communication elle-même. L'article, déposé sur arXiv (2606.31497v1), ne précise pas de partenariat industriel ni de déploiement réel au-delà du banc de test indoor basé sur des mesures de terrain ; il s'agit à ce stade d'une contribution méthodologique, dont la prochaine étape logique serait une validation sur des plateformes robotiques réelles opérant dans des environnements de connectivité variable, comme des entrepôts logistiques ou des sites industriels multi-étages.

Dans nos dossiers

À lire aussi

CoralPlan : sélection et exécution de compétences d'observation pour l'inspection robotique sous-marine
1arXiv cs.RO 

CoralPlan : sélection et exécution de compétences d'observation pour l'inspection robotique sous-marine

Une équipe de recherche présente CoralPlan, un système vision-langage conçu pour l'inspection robotique sous-marine de colonies coralliennes, décrit dans un preprint publié sur arXiv (2609.31211v1). Le système sélectionne une compétence d'observation à partir d'une image de caméra courante et d'une consigne textuelle fournie par un "manifeste d'épisode". Une interface de mouvement commune exécute ensuite trois primitives de trajectoire relatives à la cible, orbite, patch ou survey (balayage), les autres champs du plan servant de guide pour l'opérateur humain. Deux critères de succès sont définis: la complétion de l'observation, qui exige le maintien de la cible dans le champ et une couverture propre à chaque primitive, et le succès conjoint, qui exige en plus que la compétence choisie corresponde à la référence enregistrée. Le système a été évalué sur 144 épisodes simulés et 36 paires appariées simulation-matériel, réalisées dans une piscine à eau claire avec des poses de référence de cible mesurées par un système externe. Sur matériel réel, le taux de complétion d'observation atteint 77,8% et le taux de succès conjoint 63,9%. Ce travail illustre un enjeu concret pour les opérateurs de robotique sous-marine (inspection de récifs, aquaculture, infrastructures immergées) : reconnaître une cible ne suffit pas, le robot doit aussi choisir le bon type de mouvement d'observation selon la tâche demandée, une décision jusqu'ici largement câblée en dur dans les trajectoires pré-programmées des AUV et ROV. En étendant les systèmes vision-langage-action, jusqu'ici concentrés sur la manipulation et les humanoïdes terrestres, au cadrage caméra sous-marin, l'étude teste la portée de cette approche hors de son terrain habituel. L'écart entre les 144 épisodes simulés et les seules 36 paires testées sur matériel, ainsi que la chute du taux de succès conjoint à 63,9% par rapport à la complétion d'observation à 77,8%, rappelle que le passage de la simulation au réel reste un point de friction, même pour une tâche de perception plutôt que de manipulation fine. Les auteurs documentent eux-mêmes des cas d'échec, complétions ne correspondant pas à la référence ou observations incomplètes malgré une sélection de compétence correcte, une transparence qui tranche avec l'emphase habituelle des annonces du secteur. La surveillance automatisée des récifs coralliens gagne en importance face à leur dégradation, mais les robots sous-marins existants suivent le plus souvent des trajectoires fixes plutôt que des mouvements d'observation adaptés à la tâche. CoralPlan s'inscrit dans la vague plus large des modèles vision-langage-action appliqués jusqu'à présent surtout à la manipulation robotique terrestre, en la transposant à des décisions de cadrage caméra sur une plateforme non humanoïde évoluant en milieu aquatique. Il s'agit d'un travail de recherche publié en preprint, non encore relu par les pairs, testé en piscine à eau claire et non lors de déploiements réels sur récif, ce qui limite pour l'instant sa portée à une preuve de concept en conditions contrôlées. Les auteurs pointent eux-mêmes les cas où la sélection correspond à la référence sans que l'observation soit complète, ouvrant la voie à des travaux futurs visant à combler cet écart avant d'envisager des essais en eau trouble ou sur site naturel.

RecherchePaper
1 source
Séparation comportement-exécution pour l'interaction physique homme-robot contrainte
2arXiv cs.RO 

Séparation comportement-exécution pour l'interaction physique homme-robot contrainte

Des chercheurs proposent, dans une prépublication arXiv (2609.00669v1) du 2 septembre 2026, une architecture qui sépare la spécification du comportement souhaité et sa réalisation contrainte dans les interactions physiques homme-robot. Une couche comportement calcule une accélération désirée au point de contact, ak^id = ftheta(ek, ėk, F_h,k), tandis qu'une couche réalisation distincte la convertit en commandes robot sous contraintes et rapporte explicitement l'écart entre accélération désirée et réalisée, plutôt que de le masquer par saturation. Le système, un programme quadratique à horizon glissant, est testé sur un bras Franka FR3 à 7 degrés de liberté, à commande en couple, simulé sous MuJoCo. Sous une poussée soutenue de 20 newtons, la limite de l'espace de travail est respectée à environ 0,1 à 0,2 mm près, contre un dépassement de 4,4 cm en contrôle d'impédance classique et 4,7 cm en admittance, deux méthodes qui écrêtent instantanément les commandes. Avec un budget d'actionneur réduit, l'application des contraintes sur tout l'horizon garde le plan faisable à 2,1x10^-4 N.m près, contre un dépassement pouvant atteindre 11,329 N.m pour une variante qui ne contraint que le premier pas de calcul. Sur le système non linéaire réellement exécuté, l'écart se réduit mais reste favorable à l'approche par horizon complet, 0,161 contre 0,380 N.m. Cette séparation architecturale intéresse les intégrateurs de robots collaboratifs et humanoïdes en contact physique répété avec des humains ou des objets, un domaine où le contrôle d'impédance et d'admittance restent la norme malgré des dépassements de plusieurs centimètres lors de chocs ou de poussées. En rendant l'erreur de réalisation visible plutôt que dissimulée dans la saturation, l'approche facilite le diagnostic et la certification de sécurité des systèmes à interaction physique, un enjeu central pour les cobots industriels et les humanoïdes partageant des tâches avec des opérateurs. Elle montre aussi qu'un changement de comportement, par exemple passer d'un mode impédance à un mode admittance, peut s'effectuer en modifiant seulement les coefficients d'objectif du solveur sans reconstruire toute la boucle de commande, ce qui simplifierait le déploiement de comportements adaptatifs en temps réel. Le travail s'inscrit dans la lignée du contrôle d'impédance et d'admittance, formalismes classiques de l'interaction homme-robot, en cherchant à corriger leur principal défaut, la gestion approximative des contraintes par écrêtage instantané. La validation reste circonscrite à un cas d'étude planaire et à une seule plateforme robotique en simulation, ce que les auteurs présentent eux-mêmes comme une preuve de concept ciblée plutôt qu'un système prêt au déploiement industriel. Les prochaines étapes attendues incluent l'extension à des tâches tridimensionnelles, à d'autres architectures robotiques, et une validation sur matériel réel au-delà de la simulation MuJoCo.

UELe bras robotique utilisé pour les tests, le Franka FR3, est fabriqué par l'entreprise allemande Franka Robotics, mais aucun déploiement ni application concrète en France ou en UE n'est mentionné.

RecherchePaper
1 source
Conscience contextuelle robotique pour la collaboration humain-robot et la compréhension de l'environnement
3arXiv cs.RO 

Conscience contextuelle robotique pour la collaboration humain-robot et la compréhension de l'environnement

Une thèse de doctorat publiée sur arXiv (référence 2607.10372v1) s'attaque à un problème central pour les robots mobiles autonomes appelés à quitter les usines cloisonnées pour des environnements partagés avec des humains, comme la logistique, la santé ou les lignes de production mixtes. Les travaux se structurent autour de deux axes complémentaires. Le premier porte sur la ré-identification et le suivi d'une personne spécifique par un robot mobile, permettant à la machine de cibler sa collaboration sur un opérateur donné tout en ignorant les autres personnes présentes dans la scène, un prérequis pour des tâches de collaboration homme-robot ciblées plutôt que génériques. Le second axe vise à enrichir la perception géométrique et sémantique de l'environnement par le robot, combinant compréhension spatiale (utile à la planification de trajectoire et à l'évitement de collision) et compréhension sémantique des objets et acteurs présents, pour des interactions plus adaptées au contexte. L'enjeu dépassé ici est celui, bien identifié dans la littérature robotique, du fossé entre perception basique et véritable conscience contextuelle: un robot peut cartographier une pièce sans comprendre qui s'y trouve ni pourquoi, ce qui limite sa capacité à adapter son comportement en temps réel. Pour les intégrateurs industriels, ce type de brique logicielle conditionne directement la sécurité et la fluidité des déploiements en environnement humain dense, notamment en logistique et en santé où la coexistence homme-machine est quotidienne. Il s'agit toutefois de travaux de recherche académique et non d'un produit ou d'un système commercialisé; aucun chiffre de performance (précision de ré-identification, latence, taux de succès) n'est donné dans le résumé, ce qui invite à la prudence avant toute extrapolation vers un cas d'usage industriel concret. Cette thèse s'inscrit dans un courant de recherche plus large sur la perception sémantique embarquée, alimenté par les progrès récents des modèles de vision et de langage appliqués à la robotique. Elle ne mentionne pas de partenariat industriel ni de plateforme robotique spécifique, et ne fournit pas de calendrier de transfert vers un produit. Les prochaines étapes attendues pour ce type de travaux sont généralement une validation expérimentale plus poussée sur robot réel, puis une éventuelle intégration dans des piles logicielles commerciales de navigation et d'interaction homme-robot.

RecherchePaper
1 source
Classement pré-exécution conscient de l'exécution pour le placement robotique conditionné par la préhension
4arXiv cs.RO 

Classement pré-exécution conscient de l'exécution pour le placement robotique conditionné par la préhension

Un article publié en septembre 2026 sur arXiv (2609.19946) présente une méthode qui classe les couples prise-pose avant de lancer la planification de trajectoire, car une prise géométriquement valide peut rester inexécutable une fois prise en compte la pose finale de l'effecteur et le risque de collision pendant le transport. Le modèle associe un nuage de points conditionné par la cible à trois descripteurs de pose, avec des têtes hiérarchiques qui évaluent séparément la réussite de la planification puis celle de l'exécution. Sur un jeu de 30 objets et 1 235 scènes, avec des groupes de test disjoints de l'entraînement, le taux de réussite du candidat classé en tête (top-1) atteint 85,63% en sélection conjointe de la prise et de la pose, et 79,84% à cible fixée, contre 72,84% et 59,65% pour une planification exhaustive de référence via le moteur cuMotion. Transféré sans réentraînement spécifique sur un bras xArm7 piloté par MoveIt, le système réussit 13 des 27 cas testés de bout en bout (48,15%), et 13 des 16 cas ayant franchi le contrôle préalable top-5 (81,25%). Pour les intégrateurs de cellules de manipulation, ce travail cible un angle mort courant des pipelines de prise-dépose: la prise est souvent choisie pour sa seule stabilité, sans vérifier si la pose de dépôt qui en résulte reste exécutable par le bras. Classer les couples prise-pose avant de solliciter un planificateur coûteux comme cuMotion promet de réduire le temps de calcul et les échecs tardifs, un enjeu concret pour le bin-picking industriel et la logistique automatisée. L'écart entre le score académique, supérieur à 85% en top-1, et le taux de réussite réel de bout en bout, inférieur à 50% sur les cas verrouillés, rappelle que la fiabilité en conditions d'exécution reste un problème largement ouvert. Cette approche s'inscrit dans une tendance de la recherche en manipulation qui associe des modules de scoring appris à des planificateurs classiques comme cuMotion (NVIDIA) et MoveIt (ROS), plutôt que de confier la tâche à une politique de bout en bout. Publié en préprint sans affiliation industrielle ni partenariat annoncés, l'article reste un résultat de laboratoire, validé sur un jeu de données fermé et un bras de test, non un produit commercialisé.

RecherchePaper
1 source