Anthropic
I ricercatori di Anthropic hanno testato i loro strumenti di interpretabilità e non hanno trovato alcun miglioramento
Gli sparse autoencoder, i natural-language autoencoder e gli activation oracle sono stati confrontati con un baseline che si limita a leggere la trascrizione. Nessuno li ha battuti.
2 h fa
