Un preprint publicado en arXiv el 1 de septiembre a las 17:58 UTC describe Facet-0, que sus autores califican como un modelo fundacional robótico que “predice y valora las consecuencias de contacto de sus acciones”. En cinco tareas de ensamblaje submilimétricas por ordenador, el sistema adaptado a la tarea alcanza una tasa media de éxito del 82%, frente al 15% del referente más sólido, con 0,5 mm de precisión de colocación y 50 ms de latencia de comandos.
Qué predice realmente el modelo
No predice píxeles. La arquitectura se basa en una propuesta conjunta de acción-wrench —wrench es la combinación de fuerza y par en la muñeca—. Un historial causal de wrench se alinea con la semántica de visión y lenguaje y con el estado cinemático, y el flow matching genera cada bloque de acción junto con el perfil futuro de wrench en la muñeca que se espera que induzca. Después, se entrena un critic distribucional Action-Wrench Critic con rollouts de despliegue para distinguir movimientos que parecen igualmente exitosos pero terminan en distintos resultados de contacto.
Qué falla en el encuadre habitual
La historia de los modelos fundacionales robóticos de 2026 se cuenta como visión-lenguaje-acción: se muestran píxeles y palabras al robot y se obtiene comportamiento. Este resultado dice que, en tolerancias de ensamblaje, el canal visual es casi inútil por sí solo: el mejor referente guiado por visión se queda en un 15%. Pero antes de que el 82% se generalice, hay dos cosas que dejar claras. Se mide después de una adaptación específica de pieza y realizada sobre el robot de un actor ligero y acotado que reutiliza la representación congelada, por lo que no es una cifra de generalista zero-shot. Y cubre cinco tareas en un solo laboratorio, sin replicación, en un preprint sin revisión por pares.
La palabra “fundacional” pesa mucho aquí
El corpus de entrenamiento, ManuFacet-1K, reúne 1.000 horas de datos sincronizados con fuerza a través de tres embodiments y múltiples celdas de fabricación. Es un conjunto de datos considerable para manipulación rica en contacto y apenas una fracción de lo que normalmente sugiere la palabra “fundacional”. La descripción honesta es la de un modelo especializado para un régimen físico, no la de un generalista.
Por qué importa más el benchmark que el ganador
La inserción submilimétrica es precisamente el tipo de trabajo que los proveedores de robots humanoides e industriales llevan prometiendo a las fábricas y siguen sin entregar. Sea cual sea la interpretación del propio número de Facet-0, el 15% del referente es el dato útil: es una medida publicada de hasta qué punto las políticas basadas solo en visión están por debajo de las tolerancias que exige el ensamblaje real.
