Dix-huit mois après que Mira Murati a quitté son poste de CTO chez OpenAI pour fonder l’entreprise, Thinking Machines Lab a publié son premier modèle maison. Inkling, lancé le 15 juillet, arrive avec quelque chose que les laboratoires de pointe n’offrent pas : l’ensemble des poids, sous licence Apache 2.0.
L’architecture
Inkling est un transformer decoder-only à 66 couches reposant sur une architecture sparse de mixture-of-experts — 256 experts routés plus deux experts partagés par couche, avec six experts routés actifs par token. Cela représente 975 milliards de paramètres au total, mais seulement environ 41 milliards d’actifs par token. Le modèle a été entraîné sur 45 billions de tokens couvrant du texte, des images, de l’audio et de la vidéo, sur des systèmes Nvidia GB300 NVL72, et gère des fenêtres de contexte allant jusqu’à 1 million de tokens. La fiche modèle indique des entrées texte, image et audio, avec une sortie uniquement textuelle — la vidéo fait partie du mélange d’entraînement, pas de l’interface d’entrée.
Comment l’exécuter
Les poids sont disponibles sur Hugging Face, avec un checkpoint quantifié NVFP4 pour le matériel Blackwell. L’exécuter n’a rien d’anodin : le BF16 nécessite environ 2 To de VRAM, le NVFP4 environ 600 Go. Le modèle est pris en charge dans Transformers, SGLang, vLLM, llama.cpp et Unsloth, servi via TogetherAI, Fireworks, Modal, Databricks et Baseten, et disponible pour le fine-tuning sur la plateforme maison Tinker. Un aperçu d’Inkling-Small — 276 milliards au total, 12 milliards actifs — reprend la même recette.
Un lancement d’une franchise inhabituelle
Les résultats communiqués par l’entreprise placent Inkling à 97,1 % sur AIME 2026, 87,2 % sur GPQA Diamond, 77,6 % sur SWE-bench Verified et 46,0 % sur Humanity's Last Exam avec outils ; aucun n’a été vérifié indépendamment. Le laboratoire affirme qu’Inkling utilise trois fois moins de tokens que Nemotron 3 Ultra de Nvidia pour des performances de codage équivalentes. Mais il refuse l’affirmation habituelle : « Inkling is not the strongest overall model available today, open or closed, » indique son blog.
L’activité derrière le modèle
Fondée en février 2025, Thinking Machines a levé en juillet 2025 un seed de 2 milliards de dollars pour une valorisation de 12 milliards de dollars — le plus important seed de l’histoire de l’IA — mené par Andreessen Horowitz, avec Nvidia, Accel, ServiceNow, Cisco, AMD et Jane Street. Une suite de financement qui, selon les informations disponibles, visait 50 milliards de dollars s’est effondrée en janvier 2026 sans accord, les investisseurs voulant un historique produit plus solide. Inkling est ce premier historique. Il n’est pas monétisé ; les revenus proviennent de Tinker, dont les clients incluent Bridgewater Associates.
