Anthropic
Anthropic Eleva Seu Próprio Risco de Desalinhamento — e Não Por Causa do Modelo 2
O segundo Risk Report move o desalinhamento em cenários de alto risco de 'muito baixo' para 'baixo', revela três modelos internos não lançados e admite que seus testes de capacidade mais claros deixaram de funcionar.
há 3 h
