Anthropic
Anthropic 将自身的不对齐风险评级上调——而且并不是因为 Model 2
第二份 Risk Report 将高风险场景下的不对齐从“very low”上调至“low”,披露三款尚未发布的内部模型,并承认其最清晰的能力测试已经失效。
2026年8月16日

专业报道人工智能
第二份 Risk Report 将高风险场景下的不对齐从“very low”上调至“low”,披露三款尚未发布的内部模型,并承认其最清晰的能力测试已经失效。
2026年8月16日

随着标准排行榜趋于饱和且受到污染,中国AI领袖主张,应以真实世界任务表现——以及“每日活跃智能体”等指标——取代静态基准测试。
2026年7月19日
