AI 안전Anthropic 연구진, 해석 가능성 도구 시험했지만 전혀 향상 없음 확인희소 오토인코더, 자연어 오토인코더, 활성화 오라클을 대화록만 읽는 기준선과 비교했지만, 어느 것도 이를 뛰어넘지 못했다.2시간 전