美国国家标准与技术研究院于7月27日发布AI Technology Evaluation,简称 AITE——这是其信息技术实验室运营的一个试验场,在这里,模型依据开发者从未见过、也无法获取的数据进行评分。
它要解决的问题
公开基准会泄露。一旦某个测试集出现在互联网上,它最终就会进入训练数据;到那时,高分衡量的就不是能力,而是记忆——而外界无法区分这两者。隔离式评估是唯一的结构性修复办法:数据提供方必须提交原创且公众无法获取的数据集,模型只与其盲测一次。
初始范围
首批有三项任务,均为大型视觉语言模型的图像分析:量子科学、基因组学和公共安全。NIST 列出的启动和评估计划发布时间为 2026 年 7 月,评估期将于 2026 年 8 月开始。参与者登录预计“即将上线”。
它不是什麼
任何暗示 NIST 现在将为 AI 模型认证,或这构成联邦 AI 安全标准的说法,都不符合事实。AITE 是自愿参与的,不提供任何认证,也没有监管效力。它只覆盖三项狭窄的图像分析任务,根本不评估前沿模型安全——没有网络能力,没有生物风险,也没有对齐评估。其范围更接近一次科学仪器校准练习,而不是安全监管制度。
尽管如此,它仍然重要
因为在没有联邦 AI 法规的情况下,评估基础设施正是美国政策真正搭建的地方。当前流传的每一项监管提案——包括 Anthropic 首席执行官同一天提出的强制发布前测试——都默认存在一种供应商无法作弊的测试。眼下,这类测试大多并不存在,而供应商自行上报的基准成绩则是默认通货。一个政府机构掌握盲测数据,是让这些说法具备可争辩性的前提。
时间说明
NIST 自己的页面只提供到月份级别;7 月 27 日的发布日依据的是一篇贸易媒体报道。
