Французский стартап, делающий ставку против программного «рва» Nvidia, выпустил инструмент, призванный запускать ИИ-модели практически где угодно. ZML, парижская компания, представила LLMD 8 июля — бесплатный LLM inference server, предназначенный для запуска open-weight-моделей на резко разных чипах из единого стека. По словам основателя Стива Морины, цель — «сломать существующие силосы» и положить конец vendor lock-in, который привязывает ИИ-нагрузки к одному производителю аппаратного обеспечения.

Любая модель, любое оборудование

LLMD из коробки поддерживает пять архитектур: Nvidia CUDA, AMD ROCm, Google TPU, Intel и Apple Metal. «Идея в том, чтобы вернуть людям возможность создавать собственную систему и добиться реального роста эффективности», — сказал Morin TechCrunch, добавив, что ZML «дошла до точки, когда мы совместно проектируем кремний». Слоган компании предельно прямолинеен: «Любая модель. Любое оборудование. Никаких компромиссов».

Как это устроено

LLMD написан на языке программирования Zig поверх MLIR и OpenXLA, намеренно обходя цепочку зависимостей от Python и PyTorch. Он опирается на явную предварительную компиляцию, чтобы задержки оставались «плоскими и предсказуемыми», без скрытой компиляции во время работы. Сервер работает поверх open-source inference framework ZML, впервые выпущенного в сентябре 2024 года и обновленного до v2 в марте 2026 года под лицензией Apache-2.0.

Бесплатно, но не open source

Вот в чем нюанс: LLMD — бесплатный, но не open source, в отличие от лежащего под ним фреймворка. Логика Morin носит коммерческий характер: «Я бы предпочел измерить и [получать выручку] там, где это наиболее эффективно, не тормозя глупо мой рост». Сначала понять, как люди используют продукт, потом монетизировать.

Проверка реальностью

Промо-обещания запуска опережают поставляемый код. ZML заявляет о tensor-parallel sharding, prefix caching и широкой поддержке моделей, однако независимое практическое тестирование, опубликованное на Hugging Face, показало, что текущая альфа значительно уже: только один GPU, максимальный размер batch — 16, prefix caching отсутствует, а поддержка ограничена типами моделей Llama и Qwen3. Точных данных по пропускной способности или задержке не опубликовано; заявление о скорости «иногда быстрее нативной» остается качественным. На данный момент перечисленные функции выглядят как дорожная карта.

Кто стоит за проектом

Основанная в 2023 году команда ZML насчитывает около 20 человек и возглавляется Morin, бывшим вице-президентом по инженерии в Zenly, приложении для обмена местоположением, которое Snap приобрела в 2017 году. Компания привлекла $20 million под руководством 20VC Гарри Стеббингса при участии Kima Ventures Ксавье Ньеля, LocalGlobe и Kindred Capital, а также с заметным списком бизнес-ангелов: лауреат премии Тьюринга Yann LeCun, основатель Docker Solomon Hykes и сооснователи Hugging Face. «Я не смог бы делать ZML нигде, кроме Парижа», — сказал Morin. Компания конкурирует на переполненном рынке inference с Baseten стоимостью $13 billion и командами, стоящими за vLLM и SGLang.