11 июля 2026 года Robbyant, подразделение embodied-AI внутри китайского финтех-гиганта Ant Group, представила LingBot-VA 2.0 — модель для манипуляций роботом, которую компания называет первой базовой моделью «embodied-native». Речь здесь о методе: вместо адаптации готового видеогенератора Robbyant утверждает, что с нуля предобучила каузальный diffusion transformer специально для физического управления.
Почему «с нуля»
Компания утверждает, что дообучение видеомодели для робототехники несёт с собой ограничения — визуальные латенты сохраняют внешний вид, но мало физической структуры, денойзинг слишком медленный для замкнутого контура управления, а обучающие цели так и не учат тому, как действия меняют мир. Ответом версии 2.0, по формулировке Robbyant, стало то, что она «предобучает каузальный DiT нативно», выстраивая весь стек под embodied-AI, а не заимствуя его из генерации контента.
Цифры
LingBot-VA 2.0 использует около 15,3 миллиарда параметров в целом, из них примерно 2,5 миллиарда активны на токен; архитектура разделена на mixture-of-experts «video expert» (128 маршрутизируемых экспертов) и плотный «action expert». Robbyant сообщает о 93,6% среднего успеха на 50 задачах в симуляционном бенчмарке RoboTwin 2.0 — выше, чем у собственной версии v1 с 92,2%, и предыдущего метода Motus с 87,9%. Набор оптимизаций вывода сократил задержку с 927 до 142 миллисекунд на фрагмент, обеспечив асинхронное управление на 225 Гц, то есть примерно шестикратное ускорение.
Оговорки
Все приведённые здесь цифры заявлены вендором, взяты из собственной статьи и страницы проекта Robbyant и пересказаны изданием MarkTechPost без независимого воспроизведения. Результаты бенчмарка относятся только к симуляции; о работе модели на реальном роботе говорится качественно (задачи вроде аэрохоккея и работы с конвейерной лентой). И в отличие от родственной LingBot-VLA 2.0 — отдельной 6-миллиардной модели, выпущенной под Apache-2.0 8 июля, — открытые веса или код для VA 2.0 пока не подтверждены к выпуску, так что пока лучше воспринимать это как анонс по статье и странице проекта.
Китайская гонка embodied-AI
Запуск завершает необычно плотную неделю: Robbyant выпустила depth, vision, policy vision-language-action и world model с интервалом в несколько дней. В совокупности такой темп показывает, что Ant Group масштабирует полный стек embodied-AI, и вписывается в более широкое китайское движение в сторону робототехнических базовых моделей и открытых релизов.
