Nvidia의 소프트웨어 독점력에 맞서는 프랑스 스타트업이 AI 모델을 거의 어디서나 실행할 수 있는 도구를 내놨습니다. 파리 소재 기업 ZML은 7월 8일 LLMD를 공개했습니다. 이는 서로 크게 다른 칩에서도 하나의 스택으로 오픈 웨이트 모델을 실행하도록 설계된 무료 LLM 추론 서버입니다. 창업자 Steeve Morin은 목표가 "기존 사일로를 깨는 것"이며, AI 워크로드를 특정 하드웨어 제조사에 묶어 두는 벤더 종속을 끝내는 데 있다고 말합니다.
어떤 모델이든, 어떤 하드웨어든
LLMD는 기본적으로 5개 아키텍처를 지원합니다. Nvidia CUDA, AMD ROCm, Google TPU, Intel 및 Apple Metal입니다. Morin은 TechCrunch에 "사람들이 자신만의 시스템을 만들 수 있는 힘을 되찾고 진정한 효율성 향상을 이룰 수 있도록 하는 것이 아이디어"라며, ZML이 "이미 실리콘을 공동 설계하는 단계에 이르렀다"고 덧붙였습니다. 회사의 슬로건은 단호합니다. "어떤 모델이든. 어떤 하드웨어든. 타협 없음."
구현 방식
LLMD는 Zig 프로그래밍 언어로 작성됐으며 MLIR와 OpenXLA 위에 구축돼 Python과 PyTorch 의존성 체인을 의도적으로 우회합니다. 명시적 사전 컴파일 방식을 활용해 지연 시간이 "평평하고 예측 가능하게" 유지되며, 숨은 런타임 컴파일은 없습니다. 이 서버는 ZML의 오픈소스 추론 프레임워크 위에 올라가며, 해당 프레임워크는 2024년 9월 처음 공개됐고 2026년 3월 Apache-2.0 라이선스 아래 v2로 업데이트됐습니다.
무료지만 오픈소스는 아님
여기서 반전이 있습니다. LLMD는 무료지만 오픈소스는 아닙니다. 이는 그 기반이 되는 프레임워크와는 다른 방향입니다. Morin의 논리는 상업적 인내입니다. 그는 "저는 성장에 어리석게 해를 끼치지 않는 선에서, 효과가 가장 큰 곳을 측정하고 [수익을 창출]하고 싶다"고 말했습니다. 먼저 사람들이 어떻게 사용하는지 파악한 뒤, 나중에 수익화하겠다는 뜻입니다.
현실 점검
출시 홍보는 실제 배포된 코드보다 앞서 있습니다. ZML은 tensor-parallel sharding, prefix caching, 광범위한 모델 지원을 내세우지만, Hugging Face에 게시된 독립적인 실사용 테스트에 따르면 현재 알파는 훨씬 범위가 좁습니다. 단일 GPU만 지원하고, 최대 배치 크기는 16이며, prefix caching은 없고, 지원 모델은 Llama와 Qwen3로 제한됩니다. 하드 throughput이나 latency 수치는 공개되지 않았으며, "때때로 네이티브보다 빠르다"는 속도 주장은 정성적인 수준에 머물러 있습니다. 지금으로서는 홍보된 기능들이 로드맵처럼 보입니다.
배경
2023년 설립된 ZML은 약 20명 규모의 팀으로 운영되며, Snap이 2017년 인수한 위치 공유 앱 Zenly의 전 부 엔지니어링 부사장이었던 Morin이 이끌고 있습니다. 회사는 Harry Stebbings의 20VC와 Xavier Niel의 Kima Ventures, LocalGlobe, Kindred Capital이 주도한 2,000만 달러를 조달했으며, Turing상 수상자 Yann LeCun, Docker 창업자 Solomon Hykes, Hugging Face 공동창업자들이 이름을 올린 눈에 띄는 엔젤 투자진도 보유하고 있습니다. Morin은 "파리가 아니면 ZML을 할 수 없었을 것"이라고 말했습니다. 회사는 130억 달러 규모의 Baseten과 vLLM 및 SGLang 팀들을 포함한 경쟁이 치열한 추론 시장에서 경쟁하고 있습니다.
