DeepSeek는 31 August에 Hugging Face에 V4-Flash-Vision-Exp의 가중치를 공개했다. 저장소 시각은 플랫폼 API에서 그대로 확인된다. 생성 시각은 06:16:18 UTC, 샤드 업로드는 06:57 UTC부터, 모델 카드는 07:57 UTC였다. 이는 중국 기준 14:16 CST, 즉 월요일 오후다.
날짜가 곧 이야기인 이유
DeepSeek는 이 모델을 21 August에 발표했고, 자체 문서에서는 API를 통해 제공된다고 설명했다. 가중치는 언급되지 않았다. 이에 따라 모델 추적 서비스들은 이를 8월 21일로 분류한다. 그래서 이번 공개는 실제로 벌어진 일, 즉 폐쇄형 모델이 오픈 가중치 모델로 바뀐 것이 아니라 10일 전의 중복 항목처럼 기록되고 있다. API에 데이터를 보낼 수 없는 이들에게는 두 사건이 같은 의미가 아니며, 배포 방식을 바꾸는 것은 그중 하나뿐이다.
이번 공개의 내용
MIT 라이선스. 48개 샤드, 167,811,372,792바이트, 약 167.8GB. 43개 레이어, 256개의 라우팅 전문가와 1개의 공유 전문가, 토큰당 6개 활성화, 1,048,576토큰 컨텍스트, 전문가에는 FP4를 적용한 FP8 e4m3 가중치, 그리고 기본 32레이어 비전 타워가 포함된다. 이 규모의 혼합전문가(multimodal) 모델에 MIT 라이선스를 적용한 것은 이례적으로 허용적이다. 최근 중국 오픈 가중치 라이선스에 자주 등장하는 사용 허가 부록, 매출 기준, 검토 조항이 없다.
흔한 해석이 놓치는 점
멀티모달 헤드라인 수치는 주의가 필요하다. 이 모델에서 인용되는 핵심 향상 수치는 DeepSeek의 각주에 따르면 이미지를 받지 못하는 기준 모델과의 비교에서 측정됐다. 즉, 개선의 일부는 텍스트 전용 비교 대상으로 평가된 것이다. 이는 경쟁자라기보다 하한선에 가깝다. 카드 자체는 이를 솔직하게 밝히고 있지만, 해당 수치를 반복 인용하는 요약본들은 그렇지 않다. 또 두 가지가 빠져 있다. 적어도 하나의 코딩·보안 벤치마크는 이전 버전보다 하락했고, 이 모델은 선도적 서구 프런티어 모델과의 일대일 비교 표 대부분에서도 뒤처진다. "비슷한 텍스트 성능"이라는 표현이 많은 평균화를 하고 있다.
사실로 확인되지 않은 주장 하나
보도는 Hugging Face와 ModelScope에서 동시에 공개됐다고 설명한다. 그러나 ModelScope에서는 해당 모델에 대해 record not found가 반환된다. 보도 시점 현재 가중치는 Hugging Face에만 올라와 있다.
