AI 연구
새 벤치마크, AI의 X-ray 판독은 틀릴 때 위험할 만큼 자신만만하다고 지적
RadLE 2.0은 200건의 X-ray 사례로 16개 최전선 모델을 신뢰도 가중 점수 체계로 시험했으며, 인간 방사선과 전문의는 2,000점 만점에 988.7점을 받아 최고 AI의 758점을 앞섰습니다.
2일 전

인공지능을 전문적으로 다룹니다
RadLE 2.0은 200건의 X-ray 사례로 16개 최전선 모델을 신뢰도 가중 점수 체계로 시험했으며, 인간 방사선과 전문의는 2,000점 만점에 988.7점을 받아 최고 AI의 758점을 앞섰습니다.
2일 전

표준 리더보드가 포화되고 오염됐다는 지적 속에, 중국 AI 업계 리더들은 실제 업무 수행 능력과 ‘daily active agents’ 같은 지표가 정적 벤치마크를 대체해야 한다고 주장했습니다.
2일 전
