一家押注于挑战 Nvidia 软件护城河的法国初创公司,刚刚推出了一款旨在几乎“无处不跑”的 AI 模型工具。ZML 这家巴黎公司于 7月8日 发布 LLMD——一款免费的 LLM inference server,设计目标是在差异显著的芯片上,通过同一技术栈运行开权重模型。创始人 Steeve Morin 表示,其目标是“打破现有孤岛”,终结将 AI 工作负载绑定到单一硬件厂商的供应商锁定。
任何模型,任何硬件
LLMD 开箱即支持 五种架构:Nvidia CUDA、AMD ROCm、Google TPU、Intel 和 Apple Metal。Morin 告诉 TechCrunch:“我们的想法是把创造自己系统的能力交还给用户,并实现真正的效率提升。”他补充说,ZML 已经“到了我们可以共同设计 silicon 的阶段”。公司的口号也十分直白:“任何模型。任何硬件。零妥协。”
它是如何构建的
LLMD 采用 Zig 编程语言构建,底层基于 MLIR 和 OpenXLA,刻意绕开 Python 和 PyTorch 的依赖链。它依靠显式的提前编译,以便让延迟保持“平稳且可预测”,不包含隐藏的运行时编译。该服务器运行在 ZML 的 open-source inference framework 之上,这一框架最早于 2024 年 9 月发布,并于 2026 年 3 月在 Apache-2.0 许可下更新至 v2。
免费,但不开源
转折在这里:LLMD 免费但不开源——这与其所依托的底层框架不同。Morin 的商业逻辑是先保持耐心:“我宁愿先衡量并在最有效的地方[获取收入],也不想愚蠢地阻碍自己的增长。”先了解人们如何使用,再考虑变现。
现实检验
发布宣传走在了已交付代码前面。ZML 宣传支持 tensor-parallel sharding、prefix caching 以及广泛的模型支持,但 Hugging Face 上一项独立上手测试发现,当前 alpha 版本要窄得多:仅支持单 GPU、最大 batch size 为 16、不支持 prefix caching,且仅限于 Llama 和 Qwen3 模型类型。目前尚未公布硬性的吞吐量或延迟数据;“有时比原生更快”的速度说法仍然只是定性表述。就目前而言,宣传中的功能更像是路线图。
谁在背后
ZML 成立于 2023 年,团队约 20 人,由 Morin 领导;他曾担任 Zenly 的工程副总裁,这款位置共享应用后来被 Snap 于 2017 年收购。公司已融资 2000 万美元,由 Harry Stebbings 旗下 20VC、Xavier Niel 的 Kima Ventures、LocalGlobe 和 Kindred Capital 领投/参与,并汇集了明星天使阵容:图灵奖得主 Yann LeCun、Docker 创始人 Solomon Hykes 以及 Hugging Face 联合创始人。Morin 说:“除了在巴黎,我无法在别的地方做 ZML。”它面对的是一个拥挤的推理赛道,竞争者包括估值 130 亿美元的 Baseten,以及 vLLM 和 SGLang 背后的团队。
