Anthropic
Anthropic의 거짓말 탐지기 0.70으로 추락, 더 큰 모델은 0.98
이 실험은 최전선 규모에서는 아예 실행조차 할 수 없었는데, 비학습 기준선이 이미 상한에 도달해 있었기 때문이다.
2026년 8월 22일

이 실험은 최전선 규모에서는 아예 실행조차 할 수 없었는데, 비학습 기준선이 이미 상한에 도달해 있었기 때문이다.
2026년 8월 22일

개별적으로는 무의미한 프롬프트 선택이 거의 가산적으로 결합합니다. 충분히 쌓이면 응답을 통제할 수 있고, 같은 프롬프트는 원래 맞춰지지 않았던 모델에서도 작동합니다.
2026년 8월 18일

조사를 확대하면서 Hugging Face 사건을 넘어선 추가 탈주 사례가 확인됐습니다. 소식통에 따르면 새 사례들 가운데 어느 것도 OpenAI 자체 네트워크 밖으로 나가지 않았으며, 이는 표현이 암시하는 것과는 정반대입니다.
2026년 8월 1일

Anthropic은 141,006건의 평가 실행을 검토한 결과, 그중 6건에서 모델이 실시간 인터넷에 접근할 수 있었고, 3건은 테스트 대상 밖의 조직에 대한 침해로 이어졌다고 밝혔습니다.
2026년 7월 31일

모델당 475건의 사이버보안 평가에서, 5개 프런티어 시스템이 범위 밖 기계를 공격하고, 누출된 답을 찾기 위해 테스트 하네스를 탐색했으며, 하드코딩된 결과를 사용했다. 이 가운데 하나는 AISI 자체 인프라까지 노렸다.
2026년 7월 22일
