随着AI模型逐渐“刷满”标准测试,业内领军者越来越多地认为,测试本身已经出了问题。7月18日在WAIC上,多位中国AI高管主张,应该放弃静态排行榜,转而衡量模型是否真正能在现实世界中发挥作用

基准测试的问题

批评者指出,MMLUHumanEvalSWE-bench等基准已经趋于饱和,而且更糟的是,受到污染——题目泄露进训练数据后,高分衡量的与其说是能力,不如说是记忆。当每一款前沿模型都挤在排行榜顶部附近时,榜单就不再具有区分度。

新的衡量标准

百度创始人Robin Li提出了一种不同于考试的衡量思路:用“daily active agents”来判断AI是否在持续完成真实工作。产品负责人Li Jingqiu则表示,最好的测试是“一个复杂、耗时的任务”——这类多步骤工作,单个排行榜题目无法覆盖。

“直接用起来”

StepFun的Yang Minghui说得最直接:“基准竞赛并不是全部重点……真正的测试就是直接用起来。”MiniMax的Bai Chuanxu则提出了一个相关观点,强调原生多模态——即在一个模型中同时处理文本、图像等多种输入的能力——而这恰恰是偏重文本推理的排行榜往往低估的能力。

自利与实质

这里面确实也有方便的自利逻辑:围绕“真实使用”重构评测标准,会让那些产品已落地、但基准分数落后的公司显得更占理。然而,这种批评在业内也广泛存在。随着模型在饱和测试中的表现越来越接近,行业确实缺少一种可信的比较方式——而“它到底能不能用”比任何单一数字都更难回答,也更诚实。