Anthropic
Investigadores de Anthropic probaron sus herramientas de interpretabilidad y no encontraron ninguna mejora
Los autoencoders dispersos, los autoencoders en lenguaje natural y los activation oracles se midieron frente a una base que solo lee la transcripción. Ninguno la superó.
hace 2 h
