Препринт, опубликованный на arXiv 1 сентября в 17:58 UTC, описывает Facet-0 — по словам авторов, роботизированную базовую модель, которая «предсказывает и оценивает контактные последствия своих действий». На пяти задачах компьютерной сборки с точностью до долей миллиметра адаптированная под задачу система достигает 82% среднего успеха против 15% у сильнейшего базового решения, при точности размещения 0,5 мм и задержке команды 50 мс.

Что именно предсказывает модель

Не пиксели. Архитектура построена вокруг совместного предложения действия и wrench — wrench здесь означает совокупную силу и крутящий момент в запястье. Каузальная история wrench выравнивается с семантикой vision-language и кинематическим состоянием, а flow matching генерирует каждый фрагмент действия вместе с будущим профилем wrist-wrench, который, как ожидается, он вызовет. Затем распределительный Action-Wrench Critic обучается на развертываниях, чтобы различать движения, которые выглядят одинаково успешными, но завершаются разными контактными исходами.

В чем распространенная рамка ошибается

История роботизированных foundation models 2026 года обычно рассказывается как vision-language-action: покажите роботу пиксели и слова — получите поведение. Этот результат говорит, что при допусках сборки визуальный канал сам по себе почти бесполезен — сильнейший визуально-ориентированный базис останавливается на 15%. Однако перед тем, как распространять показатель 82%, важно не упустить два момента. Он измерен после адаптации на самом роботе под конкретную деталь легкого bounded actor, переиспользующего замороженное представление, то есть это не показатель универсальной zero-shot-модели. И он охватывает пять задач в одной лаборатории, без воспроизведения другими, в препринте без рецензирования.

Слово «foundation» здесь делает слишком большую работу

Корпус для обучения, ManuFacet-1K, — это 1 000 часов синхронизированных по усилию данных с трех embodiment и нескольких производственных ячеек. Это серьезный набор данных для манипуляций с контактами и лишь округлительная погрешность по сравнению с корпусами, которые обычно подразумевает слово «foundation». Честнее всего назвать это специализированной моделью для физического режима, а не универсальной.

Почему бенчмарк важнее победителя

Вставка с точностью до долей миллиметра — именно та работа, которую производители гуманоидных и промышленных роботов годами обещают фабрикам и так и не поставляют. Что бы ни думать о собственном числе Facet-0, полезным фактом здесь остается базовый показатель 15%: это опубликованная мера того, насколько далеко визуально-ориентированные политики находятся от допусков, которых требует реальная сборка.