Une prépublication mise en ligne sur arXiv le 1er septembre à 17 h 58 UTC décrit Facet-0, que ses auteurs qualifient de modèle fondation robotique qui « prédit et évalue les conséquences de contact de ses actions ». Sur cinq tâches d’assemblage au sous-millimètre, le système adapté à la tâche atteint un taux de réussite moyen de 82 %, contre 15 % pour la meilleure référence, avec une précision de placement de 0,5 mm et une latence de commande de 50 ms.
Ce que le modèle prédit réellement
Pas les pixels. L’architecture s’articule autour d’une proposition conjointe d’action et de wrench — le wrench étant la combinaison de la force et du couple au niveau du poignet. Un historique causal de wrench est aligné sur la sémantique vision-langage et l’état cinématique, et le flow matching génère chaque bloc d’action avec le profil futur de wrench au poignet qu’il est censé induire. Un Action-Wrench Critic distributionnel est ensuite entraîné sur les exécutions de déploiement afin de distinguer des mouvements qui semblent tout aussi réussis mais aboutissent à des résultats de contact différents.
Ce que le cadrage courant comprend mal
L’histoire des modèles fondation robotique de 2026 est racontée comme une affaire de vision-langage-action : montrer des pixels et des mots au robot, obtenir un comportement. Ce résultat suggère qu’aux tolérances de l’assemblage, le canal visuel est presque inutile à lui seul — la meilleure référence guidée par la vision n’atteint que 15 %. Il faut toutefois garder deux éléments bien distincts avant de laisser le 82 % faire le tour du monde. Il est mesuré après une adaptation sur robot, spécifique aux pièces, d’un acteur léger à bornes réutilisant la représentation figée ; ce n’est donc pas une mesure générale en zero-shot. Et il couvre cinq tâches dans un seul laboratoire, sans réplication, dans une prépublication sans évaluation par les pairs.
Le mot « fondation » porte ici une grande partie du poids
Le corpus d’entraînement, ManuFacet-1K, comprend 1 000 heures de données synchronisées avec la force, réparties sur trois embodiments et plusieurs cellules de fabrication. C’est un jeu de données sérieux pour la manipulation riche en contacts, mais bien modeste au regard des corpus que le mot « fondation » laisse habituellement entendre. La description honnête est celle d’un modèle spécialisé pour un régime physique donné, pas d’un modèle généraliste.
Pourquoi le benchmark compte plus que le vainqueur
L’insertion au sous-millimètre est précisément le type de tâche que les fournisseurs de robots humanoïdes et industriels promettent sans cesse aux usines, sans la livrer. Quoi que l’on pense du score propre à Facet-0, le 15 % de la référence est la donnée la plus utile : c’est une mesure publiée de l’écart qui sépare les politiques fondées sur la vision seule des tolérances qu’exige réellement l’assemblage.
