Mira Murati 离开 OpenAI 首席技术官职位创办该公司 18 个月后,Thinking Machines Lab 推出了其首个自研模型。Inkling7 月 15 日发布,带来的是前沿实验室通常不提供的内容:以 Apache 2.0 许可证发布的完整权重。

架构

Inkling 是一款 66 层仅解码器 Transformer,基于稀疏混合专家架构——每层配备 256 个路由专家和两个共享专家,每个 token 激活 6 个路由专家。其总参数量达到 9750 亿,但每个 token 实际激活的参数只有约 410 亿。该模型在 Nvidia GB300 NVL72 系统上,使用涵盖文本、图像、音频和视频的 45 万亿个 token 进行训练,支持最长达 100 万 token 的上下文窗口。模型卡列出的输入为文本、图像和音频,输出仅为文本——视频只是训练数据的一部分,而不是输入接口。

如何运行

权重已上传至 Hugging Face,并提供面向 Blackwell 硬件的 NVFP4 量化检查点。运行它并不轻松:BF16 大约需要 2TB 显存,NVFP4 则约需 600GB。它受到 Transformers、SGLang、vLLM、llama.cpp 和 Unsloth 支持,可通过 TogetherAI、Fireworks、Modal、Databricks 和 Baseten 提供服务,并可在公司自家的 Tinker 平台上进行微调。名为 Inkling-Small 的预览版——总参数 2760 亿、激活参数 120 亿——采用相同方案。

一场罕见坦率的发布

由公司公布的基准测试显示,Inkling 在 AIME 2026 上得分 97.1%,在 GPQA Diamond 上得分 87.2%,在 SWE-bench Verified 上得分 77.6%,在使用工具的情况下在 Humanity's Last Exam 上得分 46.0%;这些结果均未经独立验证。实验室称,Inkling 在实现相当编码性能时,所用 token 数只有 Nvidia 的 Nemotron 3 Ultra 的三分之一。不过,它并未做出业界惯常的那种宣称:“Inkling 不是当下可用的最强整体模型,无论开源还是闭源。” 其博客写道。

背后的商业逻辑

Thinking Machines 成立于 2025 年 2 月,并于 2025 年 7 月完成 20 亿美元种子轮融资,估值达 120 亿美元——这是 AI 史上规模最大的种子轮,由 Andreessen Horowitz 领投,Nvidia、Accel、ServiceNow、Cisco、AMD 和 Jane Street 跟投。据称,一轮寻求在 500 亿美元估值基础上的后续融资在 2026 年 1 月无果而终,原因是出资方希望看到更强的产品记录。Inkling 就是这份记录。它本身不直接变现;收入来自 Tinker,而其客户包括 Bridgewater Associates