Alibaba는 8월 3일 베이징 시간 오전 Qwen3.8-Max를 공개하고, 이를 코딩과 회사가 "Cowork"라고 부르는 전문 사무 업무에 맞춘 모델로 홍보했습니다. 중국어권 주요 보도에 따르면 발표 시각은 베이징 시간 오전 11시, 즉 UTC 기준 03:00입니다.
사양
이 모델은 총 2.4조 파라미터의 전문가 혼합(MoE) 모델입니다. 중국어 보도는 요청당 활성화되는 파라미터 수를 950억 개, 즉 약 4%로 제시한 반면, 영어 기사들은 Alibaba가 이를 공개하지 않았다고 전했습니다. 컨텍스트 길이는 100만 토큰이며, 입력 99만1천 토큰과 출력 13만1천 토큰으로 나뉩니다. 가격은 입력 토큰 백만 개당 2.00달러, 출력은 6.00달러, 캐시는 0.25달러입니다.
모두가 인용한 표
Alibaba는 Terminal-Bench 2.1(86.6), PaperBench(93.0), GPQA Diamond(92.6), OSWorld-Verified(86.1)에서의 우위를 공개했습니다. 또 16일간의 비감독 빌드로 265개의 커밋, 127개의 풀 리퀘스트, 151개의 이슈를 만들어낸 시연, AIME24에서 공개된 방법보다 2.71점 높은 125시간 논문 재현, 게이트 수를 8,298개에서 678개로 줄인 칩 설계 시연, 그리고 24시간 안에 526개 인간 팀 중 458팀보다 앞선 채 마친 실전 대회 참가 결과도 제시했습니다. 그러나 이 모든 결과는 모두 공급업체가 수행한 것이며, 독립적으로 재현할 수는 없습니다.
인용되지 않은 항목들
에이전틱 소프트웨어 엔지니어링에서는 같은 표가 사실상 패배 목록입니다. SWE-bench Pro는 67.7로 Claude Fable 5의 80.0에 못 미칩니다. DeepSWE 1.1은 56.6으로 70.0보다 낮고, FrontierSWE는 73.5로 88.8에 뒤집니다. Humanity's Last Exam은 43.6으로 53.3보다 낮습니다. 대표 수치인 Terminal-Bench조차 GPT-5.6 Sol의 88.8 아래입니다. 이 비교의 일부는 Alibaba 자체 벤치마크인 NL2Repo-Bench에서 이뤄졌으며, 회사 밖에서는 누구도 재현할 수 없습니다.
"오픈"은 일정표에만 있다
이 모델에 대해 제기되는 주권 및 비용 논리는 공개되지 않은 가중치에 의존합니다. 8월 3일 기준 Hugging Face에는 Qwen3.8 저장소가 아예 없었고, 가장 최근 항목은 12일 전에 업데이트된 ASR 모델들이었습니다.
