AMD는 8월 27일 15:09 UTC에 ROCm 10을 출시하고, ROCm.AI — Hyperloom, AMD Skills, 그리고 ROCm CLI —를 일반 공개했습니다. 핵심 주장으로는 "ROCm.AI로 구성된 시스템은 같은 하드웨어에서 ROCm 7 대비 평균 3.3배의 추론 향상과 2.4배의 학습 향상을 제공한다"고 밝혔습니다.
각주가 말하는 내용
같은 페이지의 각주 MI350-81에는 이렇게 적혀 있습니다. "AMD Performance Labs의 2026년 7월 7일 기준 테스트 … AMD Instinct MI355x 8x GPU 플랫폼과 AMD ROCm 7.0 소프트웨어를, AMD ROCm.ai의 미리보기 버전(ROCm 7.2.2, Optimized Kernels, Parallelism, Scheduling 등의 최적화 포함)을 사용하는 유사 구성 시스템과 비교했다. 제시된 성능 향상은 테스트한 (3)개 모델 전체에 대한 결합 평균 TPS로 표현됐다." 학습 관련 각주인 MI350-82도 DeepSeek-V2-Lite, DeepSeek-V3-16B, Qwen3-30B-A3B를 대상으로 같은 7월 날짜를 명시합니다.
실제로 출시된 것
Hyperloom은 vLLM과 SGLang을 지원하고 HIP, Triton, FlyDSL을 겨냥한 "엔드투엔드 추론 워크로드 최적화를 위한 자율 에이전트 시스템"으로 설명됩니다. AMD Skills는 Claude Code, Cursor, Codex 마켓플레이스와 오픈 GitHub 카탈로그로 함께 제공됩니다. 이것이 진정으로 새로운 부분입니다. AMD는 컴파일러 작업을 기다리는 대신 에이전트를 활용해 커널을 조정하고 있습니다.
일반적인 해석이 놓치는 점
모든 헤드라인은 "ROCm 10이 3.3배 더 빠르다"고 읽힐 것입니다. 그러나 AMD 자체 각주는 이를 세 가지 방식으로 반박합니다. 3.3배는 ROCm 10에서 측정된 것이 아닙니다 — ROCm 7.0과 ROCm 7.2.2 미리보기 빌드의 비교이며, 이번 출시보다 7주 앞서 벤치마크됐습니다. Nvidia 대비 3.3배도 아닙니다. 기준선은 같은 MI355X 하드웨어에서의 AMD 자사 1년 전 소프트웨어이므로, 이 수치는 경쟁 구도가 아니라 AMD가 얼마나 많은 성능을 남겨두고 있었는지를 보여줍니다. 그리고 정확히 3개 모델에 대한 결합 평균일 뿐, 일반적인 속도 향상은 아닙니다. 하나 더 짚을 점은, ROCm.AI의 세 축 중 하나인 ROCm CLI는 '기술 미리보기'로 표시돼 있으며 AMD에 따르면 아직 ROCm 10을 공식 지원하지 않습니다. "ROCm 7.13 소프트웨어부터 시작하며, ROCm 10 공식 지원은 곧 제공될 예정"이라고 AMD는 밝혔습니다.
