자기진화 코딩 에이전트, 공유 스킬에서 악성 코드를 재현한다
6개 모델과 153개 과제에서 자기 오염률은 20.3%에서 41.8%였다. 보도될 숫자는 페이로드를 과제군에 맞춰 넣었을 때 측정된 값이다.
2026년 8월 27일

AI 안전은 모델 평가, 레드팀 테스트, 안전 약속, 사고 보고를 아우릅니다. 이 허브는 안전 연구기관의 조사 결과, 기업의 안전 프레임워크, 그리고 최첨단 위험을 둘러싼 정책 논의를 다룹니다.
6개 모델과 153개 과제에서 자기 오염률은 20.3%에서 41.8%였다. 보도될 숫자는 페이로드를 과제군에 맞춰 넣었을 때 측정된 값이다.
2026년 8월 27일

유지관리자 계정은 6월에 침해됐다. 해당 경고는 8월 26일 GitHub 데이터베이스에 도달했으며, 0.6.4 버전을 가리키고 있고 PyPI 배포는 중단된 상태다.
2026년 8월 27일

CVE-2026-18252는 신뢰할 수 없는 입력 포함 취약점으로, 에이전트가 사용자가 통제하는 위치에서 구성 정보를 읽었다. 전체 세부 사항은 약 30일간 비공개다.
2026년 8월 27일

안심할 수 있는 점은 모델이 비밀번호를 전혀 보지 않는다는 것입니다. 비밀번호를 알 필요가 없습니다. 인증된 세션은 이후 작업을 위해 OpenAI 서버에 유지됩니다.
2026년 8월 26일

13명의 보고자, 하나의 연속된 식별자 구간, 그리고 같은 버그를 8.6, 7.3, 그리고 점수 없음으로 설명한 3개의 권고문.
2026년 8월 26일

가드는 5월에 추가돼 공지에서 지목한 버전에 포함됐지만, 6월 기능 브랜치에 사라졌다. 오늘 아침 공개된 릴리스에는 없다.
2026년 8월 26일

무엇을 포함하느냐에 대한 단 하나의 선택으로 23배의 격차가 생겼다. 또 이 연구의 출판사는 이를 청소년에 관한 연구라고 설명하지만, 실제로는 그렇지 않다.
2026년 8월 25일

파서와 셸은 $HOME이 무엇인지에 대해 의견이 다르며, 안전 모델은 무서운 문자열 목록에 불과합니다. 버그 보고서는 유지관리자의 답변 없이 36일째 열려 있습니다.
2026년 8월 25일

2025년 SSRF에 대한 불완전한 수정으로, 표준 라이브러리가 CGNAT 공간을 내부로 분류하지 않아 도달 가능했다.
2026년 8월 24일

RPC 서버가 소켓에서 함수 포인터를 읽어들입니다. 더 심각한 취약점은 트리 안에 아직 수정본이 없습니다.
2026년 8월 24일

CVE-2026-78062는 TaxHacker의 하드코딩된 인증 비밀을 다룹니다. VulDB는 CVSS 4.0에서 5.5점, CVSS 3.1에서 7.3점을 부여했으며, 유지관리자는 응답하지 않았습니다.
2026년 8월 23일

모든 Ray Serve 복제본의 내부 gRPC 서버는 add_insecure_port로 바인딩돼 자격 증명을 확인하기 전에 pickle.loads에 도달했습니다. 이는 통상적인 버그 수정으로 배포됐습니다.
2026년 8월 23일

CVE 기록은 회계상 사건일 뿐 공개가 아니다. 그러나 스캐너들은 그 기록에 맞춰 움직이고, 그 때문에 4개월 전 패치가 월요일의 치명적 경고가 된다.
2026년 8월 22일

"문서를 넘겨줬다"는 표현은 공개를 뜻하는 것처럼 들립니다. 규제당국에 자료를 제출하는 것과 이를 대중에 공개하는 것은 서로 다른 일이며, 실제로 일어난 것은 첫 번째뿐이었습니다.
2026년 8월 22일

Claude Security는 Mythos 5를 선별된 허용 목록에서 모든 Enterprise 계약으로 옮겼습니다. 다만 모델 접근이 아니라 결과 보고서 형태이며, 과금은 일반 토큰 기준입니다.
2026년 8월 22일

CVE-2026-72848에는 "지원되지 않음으로 지정됨" 태그가 붙었고, GitHub의 공지에는 패치 버전이 알 수 없다고 나와 있다. 적용할 수정 사항은 없다.
2026년 8월 21일

두 건의 공지 모두 8월 19일, 0.10.0 미만 버전에 대해 나갔다. 해당 버전은 6월 11일 PyPI에 올라왔고, 이후 14개 릴리스가 더 배포됐다.
2026년 8월 20일

MIT와 SRI 연구진이 맹점을 수치로 제시했습니다. 일치하는 에이전트 간 AUROC는 0.993, 벤더가 다르면 0.854였으며, 제어는 화이트박스에서만 작동했습니다.
2026년 8월 20일

OpenAI는 이를 자사 측 문제라고 밝히며 재검증을 요청했다. 영향을 받은 계정 수는 공개하지 않았다.
2026년 8월 20일

Private Safety Processing은 OpenAI가 내용을 읽지 않은 채 여러 상호작용에 걸친 위험을 찾는 기능으로, Microsoft와 Databricks와 함께 테스트 중이며 9월에 출시됩니다.
2026년 8월 20일

Mark Russinovich는 안전 제거의 보상을 무너뜨리는 방안을 제안합니다. 가드레일이 제거되면 모델이 위험한 질문에 잘못 답하도록 만드는 방식입니다.
2026년 8월 19일

측정 논문은 시험한 모든 오픈소스 릴레이가 기본값으로 고객 간 캐시 읽기 유출을 일으킨다고 밝혔으며, 수정 비용은 2.5% 미만이다.
2026년 8월 19일

기간 한정 HackerOne 프로그램으로, 신고당 상한은 5만달러이며, 게스트 OS로만 탈출하는 경우는 명시적으로 인정되지 않습니다.
2026년 8월 19일

희소 오토인코더, 자연어 오토인코더, 활성화 오라클을 대화록만 읽는 기준선과 비교했지만, 어느 것도 이를 뛰어넘지 못했다.
2026년 8월 18일

개별적으로는 무의미한 프롬프트 선택이 거의 가산적으로 결합합니다. 충분히 쌓이면 응답을 통제할 수 있고, 같은 프롬프트는 원래 맞춰지지 않았던 모델에서도 작동합니다.
2026년 8월 18일

이 이야기에서 이견이 없는 부분은 기계가 공격 체인을 통째로 구축했다는 점입니다. 모든 헤드라인이 전제로 삼는 또 다른 절반, 즉 Copilot이 취약점을 작성했다는 주장에는 GitHub도 이의를 제기했고 Wiz도 이를 유보했습니다.
2026년 8월 18일

동의 없이 제작하면 최대 2년형에 처해집니다. 대상이 14세 미만이면 징역이 의무이며 태형도 가능합니다.
2026년 8월 16일

최신 소장은 16세 소년을 위해 제기됐으며, 이 연속 사건에서 처음으로 남성 원고가 포함됐다. 네 건 모두 6월 한 아칸소 사진작가의 체포에서 비롯됐다.
2026년 8월 16일

Gemini 이미지·동영상·노래의 모서리 표시가 설정 항목이 된다. 어떤 선택을 하더라도 SynthID와 C2PA 자격은 내부에 그대로 남는다.
2026년 8월 16일

두 번째 Risk Report는 고위험 정렬 불일치를 'very low'에서 'low'로 높이고, 공개되지 않은 내부 모델 3개를 밝히며, 가장 명확한 역량 테스트가 더 이상 작동하지 않는다고 인정했다.
2026년 8월 16일
