Tencent 于 9 月 7 日将两款视觉文档检索模型的权重推送至 Hugging Face,采用 Apache-2.0 许可,发布时既无公告,也没有报道。此次发布的提交记录——“EVIE-8B: teacher weights, inference, 138-task eval”——时间戳为 09:04:08 UTC,即北京时间 17:04,文档提交则持续到 10:41 UTC。
发布了什么
EVIE-8B 是一款基于 Qwen3.5-9B 底座、参数量为 8.41B 的模型,可生成 4096 维的逐 token 嵌入;EVIE-4.5B 则是一个 4.61B 参数的蒸馏学生模型,维度可在 64 到 2048 之间截断。两者都属于 ColBERT 系谱中的 late-interaction 检索器——它们保留逐 token 向量,并用 MaxSim 打分,而不是把整页压缩成单一向量,这正是其能够保留表格和版式结构的原因。8B 仓库总计 16.84 GB、47 个文件;4.5B 为 9.11 GB、88 个文件,并包含训练代码。
其自家表格并不支持的说法
模型卡开头就放了两个金色的“第1名”徽章。第一个是站得住脚的:在 ViDoRe V3 上,66.75 的 nDCG@10 确实位居对比表首位,领先 webAI-ColVec1.1-8b 的 65.32 和 nemotron-colembed-vl-8b-v2 的 63.54。第二个徽章写着“ViDoRe V1+V2 — 92.18 · Rank #1”,而 92.18 实际上是 EVIE-8B 在 ViDoRe V1 上的得分。在同一张表里,nemotron-colembed-vl-8b-v2 的得分为 92.65,VultronRetrieverCore-4.5B 为 92.21。在 V1 上,腾讯自家的数字显示 EVIE-8B 只能排第三。
基准测试叙事掩盖了什么
模型卡称,发布的检查点是两条独立训练分支在 alpha = 0.40 下进行的 “a40” 权重空间混合,之所以选用它,是因为它能取得最高的 V3 分数。为追求基准成绩而选定的混合比例,本质上是针对基准优化的产物,而模型卡并未披露未混合前两条分支各自的得分。另一个问题是,没有论文:发布说明称,正式写作和结构消融“将在后续发布中更新”。这里的每一个数字都来自腾讯自家模型卡的自报,而非独立排行榜提交。
不要与 8 月份的版本混淆
腾讯曾于 8 月 17 日发布 EVIE-Preview-4.5B,这是一个不同的 128 维检查点,在这张卡的表格中得分为 65.36。今天发布的两个模型仓库创建于 9 月 4 日,最初只是空占位;权重本身直到周一才公开存在。
