AI 안전
Anthropic, 자사 정렬 불일치 위험 등급 상향 — Model 2 때문은 아냐
두 번째 Risk Report는 고위험 정렬 불일치를 'very low'에서 'low'로 높이고, 공개되지 않은 내부 모델 3개를 밝히며, 가장 명확한 역량 테스트가 더 이상 작동하지 않는다고 인정했다.
3시간 전

인공지능을 전문적으로 다룹니다
두 번째 Risk Report는 고위험 정렬 불일치를 'very low'에서 'low'로 높이고, 공개되지 않은 내부 모델 3개를 밝히며, 가장 명확한 역량 테스트가 더 이상 작동하지 않는다고 인정했다.
3시간 전
