Anthropic
Fable 5.1의 “25% 저렴”은 토큰 요금 인하가 아니라 캐시 읽기 비용 인하입니다
Anthropic의 기준 요금은 변하지 않았습니다. 입력은 100만 토큰당 10달러, 출력은 50달러입니다. 절감분은 전부 캐시 읽기 비용이 75% 내려 100만당 0.25달러가 된 데서 나오며, 이는 접두사를 재사용하는 작업량에서만 실현됩니다.
2일 전

Anthropic의 기준 요금은 변하지 않았습니다. 입력은 100만 토큰당 10달러, 출력은 50달러입니다. 절감분은 전부 캐시 읽기 비용이 75% 내려 100만당 0.25달러가 된 데서 나오며, 이는 접두사를 재사용하는 작업량에서만 실현됩니다.
2일 전

Qwen3.8-Max는 월요일 오전 공개돼 GPT-5.6 Sol과 Claude Fable 5를 이긴 벤치마크 표를 내세웠습니다. 그러나 같은 표를 끝까지 읽으면, 어려운 에이전틱 엔지니어링 항목은 모두 패배한 것으로 나타납니다.
2026년 8월 3일

AI Technology Evaluation은 한 번도 공개된 적 없는 블라인드 데이터셋으로 모델을 평가하며, 벤치마크 결과가 암기된 것이 아님을 확인할 수 있는 사실상 유일한 방법입니다. 다만 어떠한 규제 효력도 없습니다.
2026년 7월 28일

RadLE 2.0은 200건의 X-ray 사례로 16개 최전선 모델을 신뢰도 가중 점수 체계로 시험했으며, 인간 방사선과 전문의는 2,000점 만점에 988.7점을 받아 최고 AI의 758점을 앞섰습니다.
2026년 7월 19일

표준 리더보드가 포화되고 오염됐다는 지적 속에, 중국 AI 업계 리더들은 실제 업무 수행 능력과 ‘daily active agents’ 같은 지표가 정적 벤치마크를 대체해야 한다고 주장했습니다.
2026년 7월 19일
