Le 11 juillet 2026, Robbyant, l’unité d’IA incarnée au sein du géant chinois de la fintech Ant Group, a dévoilé LingBot-VA 2.0, un modèle de manipulation robotique qu’elle présente comme le premier modèle fondation « embodied-native ». La revendication porte sur la méthode : plutôt que d’adapter un générateur vidéo prêt à l’emploi, Robbyant affirme avoir préentraîné de zéro un transformer de diffusion causal spécifiquement conçu pour le contrôle physique.

Pourquoi « de zéro »

L’entreprise soutient que l’ajustement fin d’un modèle vidéo pour la robotique charrie plusieurs limites — des latents visuels qui conservent l’apparence mais peu de structure physique, une dénoyautage trop lente pour le contrôle en boucle fermée, et des objectifs d’entraînement qui n’apprennent jamais comment les actions transforment le monde. Dans la formulation de Robbyant, la réponse apportée par la version 2.0 est qu’elle « préentraîne nativement un DiT causal », en construisant toute la pile pour l’incarnation plutôt qu’en en empruntant une à la génération de contenu.

Les chiffres

LingBot-VA 2.0 utilise environ 15,3 milliards de paramètres au total, dont environ 2,5 milliards actifs par jeton, répartis entre un module « expert vidéo » en mixture-of-experts (128 experts routés) et un module dense « expert action ». Robbyant fait état d’un taux de réussite moyen de 93,6 % sur 50 tâches dans le benchmark de simulation RoboTwin 2.0 — devant sa propre version 1 à 92,2 % et une méthode antérieure, Motus, à 87,9 %. Une série d’optimisations de l’inférence a ramené la latence de 927 à 142 millisecondes par segment, permettant un contrôle asynchrone à 225 Hz, soit un gain d’environ six fois.

Les réserves

Chaque chiffre ici est fourni par le vendeur, tiré du propre article scientifique et de la page projet de Robbyant, puis résumé par le média MarkTechPost, sans réplication indépendante. Les résultats du benchmark sont limités à la simulation ; les performances du modèle sur robot réel sont décrites de manière qualitative (des tâches comme le air hockey et la manipulation sur tapis roulant). Et contrairement à son modèle frère LingBot-VLA 2.0 — un modèle distinct de 6 milliards de paramètres publié sous Apache-2.0 le 8 juillet — ni les poids ni le code de VA 2.0 n’ont été confirmés comme publiés, de sorte qu’il faut pour l’instant y voir avant tout une annonce par article et page projet.

La course chinoise à l’IA incarnée

Ce lancement clôt une semaine inhabituellement dense : Robbyant a expédié, à quelques jours d’intervalle, de la profondeur, de la vision, une politique vision-langage-action et un modèle du monde. Pris ensemble, ce rythme signale qu’Ant Group met à l’échelle une pile complète d’IA incarnée, et s’inscrit dans une poussée plus large de la Chine vers les modèles fondation pour la robotique et les publications en open source.