Broadcom은 라스베이거스에서 열린 VMware Explore에서 VMware Cloud Foundation용 검증된 모델 집합을 발표하며, 기업들이 자체 하드웨어에서 모델-as-a-service를 제공할 수 있다고 밝혔습니다. 이름이 제시된 모델은 Nvidia의 Nemotron 3, Google DeepMind의 Gemma 4, NEC의 cotomi, Alibaba Cloud의 Qwen 3.7-Max, 그리고 Z.ai의 GLM 5.2입니다.

5개와 150개는 같은 주장이 아닙니다

이 발표문은 인접한 문단에서 두 숫자를 모두 언급하지만, 의미는 다릅니다. 5개 모델은 Broadcom이 특정 구성에서 테스트하고 검증한 것입니다. 150개 초과vLLM 런타임이 기술적으로 제공할 수 있는 오픈소스 모델 수를 뜻합니다. 이는 공급업체 보증이 붙지 않은 기능 설명입니다. 두 수치를 동일시하면 Broadcom의 약속을 30배로 부풀리게 됩니다.

목록에서 눈에 띄는 이름들

검증된 5개 모델 중 2개는 중국 모델입니다. Qwen 3.7-Max는 이 발표문에서 100만 토큰 컨텍스트 윈도우를 갖춘 독점적 멀티모달 모델로 설명되며, 주권형 온프레미스 접근용으로 제공됩니다. GLM 5.2는 Z.ai의 오픈소스 범용 언어 모델로, 로컬 코딩 및 추론 에이전트용으로 배치됩니다. 데이터를 퍼블릭 클라우드로 보낼 수 없는 기업에게 이는 자체 소유 하드웨어에서 중국 오픈웨이트 모델을 지원된 방식으로 운용할 수 있는 경로이며, 그 주변에는 미국 공급업체의 스택이 깔립니다. NEC의 일본 최적화 cotomi도 같은 이유, 즉 벤치마크 선도보다는 주권성 때문에 같은 목록에 포함됐습니다.

측정값이 아닌 두 숫자

이 발표문은 MLPerf Inference v5.1을 측정 프로그램으로 언급합니다. 그러나 이는 방법론에 대한 참조일 뿐, 공개된 MLPerf 결과는 아닙니다. 발표 어디에도 성능 수치는 나오지 않습니다. 그리고 기업의 생산 추론 워크로드 중 56%가 프라이빗 클라우드에서 운영된다는 자주 인용되는 수치는 독립 분석기관이 아니라 Broadcom 자체 Private Cloud Outlook 2026 조사에서 나온 것입니다.

패키징이 말해주는 것

정해진 하드웨어에서 고정된 짧은 목록을 검증하는 방식은 인프라 업체가 데이터베이스와 하이퍼바이저를 판매해 온 전통적인 방법입니다. 지원되는 조합을 정하고, 지원 계약을 보유하는 방식입니다. 이를 모델 서빙에 적용하면 기업의 선택지는 "Hugging Face의 어떤 모델이든"에서 "전화를 받겠다고 약속한 5개 모델"로 좁아집니다.