AnthropicAnthropic 将自身的不对齐风险评级上调——而且并不是因为 Model 2第二份 Risk Report 将高风险场景下的不对齐从“very low”上调至“low”,披露三款尚未发布的内部模型,并承认其最清晰的能力测试已经失效。3小时前