AnthropicAnthropic이 거짓말 탐지기를 0.95까지 훈련했지만 0.70으로 추락하는 모습을 지켜봤다. 더 큰 모델에 물으니 0.98을 기록했다.이 실험은 최전선 규모에서는 아예 실행조차 할 수 없었는데, 비학습 기준선이 이미 상한에 도달해 있었기 때문이다.1시간 전