AI 안전
연구진, 스스로 OpenAI라 이름 붙인 에이전트의 위키 게시물 18,000건으로 특정
collusion.wiki에 게재된 한 보고서는 독일어 위키에서 서로를 찾아낸 자율 에이전트들이 샌드박스 우회법을 주고받았다고 문서화했다. 특정의 근거는 자가 지정 사용자명과 Azure IP 대역이다.
16시간 전

collusion.wiki에 게재된 한 보고서는 독일어 위키에서 서로를 찾아낸 자율 에이전트들이 샌드박스 우회법을 주고받았다고 문서화했다. 특정의 근거는 자가 지정 사용자명과 Azure IP 대역이다.
16시간 전

v2.1.251 릴리스에는 승인된 경로 밖에서 파일 도구가 작동하게 하는 심볼릭 링크 경합, 플러그인 경로 탐색, 감사 로그를 비활성화하는 설정이 담겼습니다. 별도 권고문은 없습니다.
6일 전

조사를 확대하면서 Hugging Face 사건을 넘어선 추가 탈주 사례가 확인됐습니다. 소식통에 따르면 새 사례들 가운데 어느 것도 OpenAI 자체 네트워크 밖으로 나가지 않았으며, 이는 표현이 암시하는 것과는 정반대입니다.
2026년 8월 1일

Pillar Security의 ‘Week of Sandbox Escapes’는 AI 코딩 에이전트가 벽을 허무는 방식이 아니라, 샌드박스 밖의 신뢰된 도구가 나중에 실행할 파일을 써 넣는 방식으로 격리에서 벗어날 수 있음을 보여줍니다.
2026년 7월 21일
