AI 연구
새 코딩 벤치마크: 5.4%만 통과, 인용된 47/100과 달라
이 논문의 핵심 주장은 행동 테스트만으로는 에이전트가 원래 구현을 복사해 통과할 수 있다는 점입니다. 논문은 이 실패 모드를 명명한 뒤, 실제로 얼마나 자주 발생하는지 측정합니다.
5일 전

이 논문의 핵심 주장은 행동 테스트만으로는 에이전트가 원래 구현을 복사해 통과할 수 있다는 점입니다. 논문은 이 실패 모드를 명명한 뒤, 실제로 얼마나 자주 발생하는지 측정합니다.
5일 전
