Mira Murati가 OpenAI CTO직을 떠나 이를 시작한 지 18개월 만에, Thinking Machines Lab이 첫 자체 모델을 공개했습니다. Inkling은 7월 15일 출시됐으며, 프런티어 랩들이 제공하지 않는 것, 즉 Apache 2.0 아래의 전체 가중치를 함께 제공합니다.
The architecture
Inkling은 희소 mixture-of-experts 백본을 기반으로 한 66층 decoder-only transformer입니다. 각 층마다 256개의 routed expert와 2개의 shared expert가 있으며, 토큰당 6개의 routed expert가 활성화됩니다. 이에 따라 총 9750억 개 파라미터를 갖지만 토큰당 활성 파라미터는 약 410억 개에 불과합니다. 이 모델은 텍스트, 이미지, 오디오, 비디오를 아우르는 45조 토큰으로 학습됐으며, Nvidia GB300 NVL72 시스템에서 훈련됐고, 최대 100만 토큰의 컨텍스트 윈도우를 처리합니다. 모델 카드는 입력을 텍스트, 이미지, 오디오로 제시하고 출력은 텍스트만 지원한다고 명시합니다. 비디오는 학습 데이터에는 포함됐지만 입력 표면에는 포함되지 않았습니다.
How to run it
가중치는 Hugging Face에 공개됐으며, Blackwell 하드웨어용 NVFP4 quantized checkpoint도 포함됩니다. 실행은 가볍지 않습니다. BF16에는 약 2TB의 VRAM이 필요하고, NVFP4는 약 600GB가 필요합니다. 이 모델은 Transformers, SGLang, vLLM, llama.cpp, Unsloth를 지원하며 TogetherAI, Fireworks, Modal, Databricks, Baseten을 통해 제공됩니다. 또 회사의 Tinker 플랫폼에서 파인튜닝도 가능합니다. Inkling-Small 미리보기 버전은 총 2760억 개, 활성 120억 개로 같은 방식을 사용합니다.
An unusually honest launch
회사 측 벤치마크에 따르면 Inkling은 AIME 2026 97.1%, GPQA Diamond 87.2%, SWE-bench Verified 77.6%, 도구 사용 시 Humanity's Last Exam 46.0%를 기록했습니다. 다만 이 수치는 독립 검증되지 않았습니다. 연구소는 Inkling이 코딩 성능에서 Nvidia의 Nemotron 3 Ultra와 동급을 내는 데 필요한 토큰을 3분의 1만 사용한다고 주장합니다. 그러나 흔한 식의 주장은 하지 않았습니다. 회사 블로그는 “Inkling is not the strongest overall model available today, open or closed,”라고 적었습니다.
The business behind it
2025년 2월 설립된 Thinking Machines는 2025년 7월 Andreessen Horowitz가 주도하고 Nvidia, Accel, ServiceNow, Cisco, AMD, Jane Street가 참여한 120억 달러 기업가치의 20억 달러 시드 투자를 유치했습니다. 이는 AI 역사상 최대 규모의 시드였습니다. 이후 500억 달러를 목표로 한 후속 자금 조달은 투자자들이 더 강한 제품 실적을 원하면서 2026년 1월 무산됐습니다. Inkling은 그 실적입니다. 현재 직접적인 수익화는 없으며, 매출은 Tinker에서 발생합니다. Tinker의 고객에는 Bridgewater Associates가 포함됩니다.
