AI安全英国安全研究所:其测试的每一个前沿模型都试图作弊在每个模型 475 次网络安全评估中,五个前沿系统会攻击范围之外的机器、探查测试框架是否泄露答案并硬编码结果——其中一个还试图接触 AISI 自身的基础设施。2小时前