Alibaba의 Qwen 팀8월 14일 Qwen3.8-27B의 가중치를 공개하고, 이를 Apache 2.0 라이선스 아래 Hugging Face와 ModelScope에 올렸습니다.

모델의 정체

이 모델은 텍스트, 이미지, 수 시간 분량의 비디오를 다루는 27B 파라미터 dense 비전-언어 모델로, mixture-of-experts가 아닙니다. 아키텍처는 64개 레이어에 걸친 하이브리드 구조로, 16개 블록의 세 Gated DeltaNet 레이어가 네트워크에 입력을 보내고, 그 뒤마다 하나의 Gated Attention 블록이 이어집니다. 기본 컨텍스트 길이는 262,144토큰이며 YaRN으로 약 100만 토큰까지 확장할 수 있고, thinking mode는 비활성화할 수 있습니다.

주장

Qwen은 이 27B 모델이 코딩과 사무 작업에서 훨씬 더 큰 Qwen3.7-Plus를 능가한다고 주장합니다. 모델 카드에는 SWE-bench Pro 61.7, Terminal Bench 2.1 73.0, OSWorld-Verified 84.3, GPQA Diamond 89.2, 코드 인터프리터 사용 시 MathVision 94.6, CharXiv 90.2가 기재돼 있습니다.

라이선스를 정확히 읽어야 합니다

여기서의 Apache 2.0은 실제입니다. 가중치는 내려받을 수 있고, 별도 맞춤 라이선스 없이 상업적으로도 사용할 수 있습니다. 그러나 학습 데이터와 학습 코드는 공개되지 않았습니다. 따라서 이는 오픈 소스가 아니라 오픈 weights이며, 모델이 무엇을 배웠는지 감사해야 하는 사람들에게는 중요한 차이가 됩니다.

벤치마크도 같은 방식으로 읽어야 합니다

위의 모든 수치는 Alibaba가 자사 모델 카드에서 자체 보고한 값이며, 아직 독립적인 재현은 없습니다. 훨씬 큰 형제 모델을 작은 dense 모델이 이겼다는 비교는 일반적으로 외부 평가에서 약해지기 쉽습니다. 벤더가 평가 도구와 기준선을 모두 선택하기 때문입니다. 공식 API는 곧 제공될 예정으로 표시돼 있으며, Qwen Cloud에서는 100만 컨텍스트 버전이 호스팅될 예정이라고 합니다.

실제로 새로 나온 것은 무엇인가

Qwen 3.8이라는 이름 자체는 새롭지 않습니다. 7월에는 비공개 모델 Qwen3.8-Max에 사용됐고, 훨씬 더 큰 오픈 웨이트 Qwen3.8-2.4T-A95B mixture-of-experts 모델은 이틀 전에 게시됐습니다. 이번 소식은 이 제품군의 작고 dense하며 로컬에서 실행 가능한 계층이 공개됐다는 점입니다. 실제로 많은 이들이 배포할 수 있는 계층이 바로 그 계층입니다.