Tencent는 9월 7일 Apache-2.0 라이선스로 시각 문서 검색 모델 2개의 가중치를 Hugging Face에 올렸지만, 이 글을 쓰는 시점까지 별도 발표도 없었고 보도도 없었습니다. 출시 커밋 — "EVIE-8B: teacher weights, inference, 138-task eval" — 은 09:04:08 UTC, 즉 베이징 시간 17:04로 찍혀 있으며, 문서화 커밋은 10:41 UTC까지 이어졌습니다.

출시된 것

EVIE-8B는 Qwen3.5-9B를 기반으로 한 84억1000만 개 파라미터 모델로, 토큰당 4096차원 임베딩을 생성합니다. EVIE-4.5B는 46억1000만 개 파라미터의 증류 학생 모델로, 64에서 2048까지 차원을 잘라 쓸 수 있습니다. 두 모델 모두 ColBERT 계열의 후순위 상호작용 검색기로, 페이지를 하나의 벡터로 압축하지 않고 토큰별 벡터를 유지한 뒤 MaxSim으로 점수를 매깁니다. 이 방식이 표와 레이아웃 구조를 보존합니다. 8B 저장소는 47개 파일에 걸쳐 16.84GB이며, 4.5B는 88개 파일에 걸쳐 9.11GB이고 학습 코드도 포함합니다.

자체 표가 뒷받침하지 못하는 주장

카드에는 금색 Rank #1 배지 2개가 앞에 붙어 있습니다. 첫 번째는 타당합니다. 66.75의 ViDoRe V3 nDCG@10은 비교표에서 최상위로, webAI-ColVec1.1-8b의 65.32와 nemotron-colembed-vl-8b-v2의 63.54를 앞섭니다. 그러나 두 번째 배지에는 "ViDoRe V1+V2 — 92.18 · Rank #1"이라고 적혀 있지만, 92.18은 EVIE-8B의 ViDoRe V1 점수입니다. 같은 표에서 nemotron-colembed-vl-8b-v2는 92.65, VultronRetrieverCore-4.5B는 92.21을 기록합니다. V1 기준으로는 Tencent의 자체 수치상 EVIE-8B가 3위입니다.

벤치마크 프레이밍이 가리는 것

카드는 공개된 체크포인트가 서로 독립적으로 학습된 두 분기를 alpha = 0.40 비율로 합친 "a40" 가중치 공간 혼합이라고 설명하며, V3 최고 점수를 달성했기 때문에 선택됐다고 적고 있습니다. 벤치마크 성능을 위해 정한 혼합 비율은 벤치마크에 맞춘 산물이며, 카드에는 섞지 않은 각 분기의 점수가 보고되지 않았습니다. 또한 논문도 없습니다. 공개 노트는 정식 설명과 구조적 소거 실험이 "upcoming release"에서 업데이트될 것이라고 밝힙니다. 여기의 모든 수치는 독립적 순위표가 아니라 Tencent의 자체 카드에 자가 보고된 값입니다.

8월 공개분과 혼동해서는 안 됩니다

Tencent는 8월 17일 EVIE-Preview-4.5B를 공개했는데, 이는 이 카드의 표에 65.36으로 나타나는 별도의 128차원 체크포인트입니다. 오늘 공개된 두 모델의 저장소는 9월 4일 빈 자리표시자로 만들어졌으며, 가중치 자체는 월요일 전까지는 공개적으로 존재하지 않았습니다.