Pesquisa em IA
Novo benchmark de código: 5.4% passaram, não os 47/100 citados
A tese central do artigo é que testes comportamentais permitem que agentes sejam aprovados copiando a implementação original. Ele nomeia esse modo de falha e mede com que frequência isso acontece.
há 5 d
