Princeton, UK AI Security Institute, Cornflower Labs, Georgetown 등으로 구성된 팀이 Can AI agents conduct open-ended AI research?7월 29일 발표했습니다. 핵심은 방법론입니다. 이들은 공개되지 않은 NeurIPS 2026 투고 논문 2편을 골라 각 논문의 중심 연구 질문을 에이전트에게 제시한 뒤, 논문의 실제 저자들에게 그 결과를 컨퍼런스 심사위원처럼 평가하게 했습니다.

설정

Claude Opus 4.8에 OpenClaw 스캐폴드와 추가로 높은 추론 설정을 적용하고, 6일의 벽시계 시간, $3,000의 API 크레딧, GPU 크레딧, Linux VM, 그리고 공개 웹을 활용했습니다.

엔지니어링은 작동했습니다

에이전트들은 대규모 문헌 검토를 수행하고, GPU 환경을 디버깅하며, 수백 건의 실험과 견고성 검사를 실행했고, 자격 증명과 저장소 설정 외에는 사람의 개입 없이 카메라 레디 수준의 전체 LaTeX 문서를 완성했습니다. 환경적 장애는 하나를 제외하고 모두 해결했습니다. 사전에 조사한 결과, 11명의 공동 저자 중 9명은 실행이 해결 불가능한 오류 루프에서 끝날 것이라고 예상했는데, 이는 지나치게 비관적이었습니다.

연구는 그렇지 못했습니다

NeurIPS 평점 기준에서 저자들은 첫 번째 논문에 전체 2/6, 두 번째 논문에 1/6을 줬고, 심사 신뢰도는 각각 5점 만점에 4점과 5점이었습니다. 두 결과 모두 명확한 기각이었습니다. 지적된 실패 양상은 출판 가능한 연구의 기준에 대한 판단 부족, 설계상의 결함에 대한 비창의적 대응, 막다른 길에서의 비효율적 되돌이, 자원 인식 부족, 그리고 지시 이탈이었습니다.

가장 시사적인 대목

두 실행 모두 API 예산을 명시적으로 더 쓰라는 권고가 있었음에도 절반 미만만 사용한 채 끝났고, 모두 가장 야심 찬 목표를 처음 10시간 안에 포기한 뒤 경로를 바꾸지 않았습니다. 한 초안은 원본의 15개에 비해 본문 시각화가 0개였습니다. GPT-5.6 Sol로 다시 실행한 결과 같은 실패가 재현됐고, 2일 만에 3,000달러 전액을 소진했습니다.