Anthropic은 금요일 Claude Opus 5를 내놓으며, 사실상 산술로 설명되는 메시지를 제시했습니다. 이 모델은 주요 코딩 벤치마크에서 회사의 프런티어 시스템인 Claude Fable 50.5% 이내 차이를 보이면서도 과업당 비용은 절반에 그쳤고, 가격도 전작이 받던 수준과 정확히 같았습니다. 입력은 백만 토큰당 5달러, 출력은 25달러로 Opus 4.8과 변동이 없으며, Fable 5는 각각 10달러와 50달러입니다. Opus 5는 Claude Max의 기본 모델이 되고 Claude Pro에서 사용할 수 있는 가장 강력한 옵션이 됩니다.

벤치마크 시트가 주장하는 것

Frontier-Bench v0.1에서, Anthropic의 소프트웨어 엔지니어링 평가인 이 벤치마크에서 Opus 5는 다른 모든 모델을 앞서며, 과업당 비용은 더 낮은 상태에서 Opus 4.8의 성능을 두 배 이상 끌어올렸습니다. CursorBench 3.2에서는 최대 노력 설정에서 Fable 5의 최고 점수와 0.5% 이내 차이로 도달하면서도 과업당 비용은 절반이었고, 높은, xhigh, max 노력 설정에서 성능 대비 가격 기준으로도 모든 다른 모델을 능가했습니다.

Frontier-Bench v0.1 차트: 노력 수준별 시도당 비용 대비 에이전트형 터미널 코딩 점수, Claude Opus 5가 Fable 5, Opus 4.8, GPT-5.6 Sol보다 위에 표시됨
에이전트형 터미널 코딩(Frontier-Bench v0.1): 각 노력 수준에서 점수 대비 시도당 비용. Opus 5(빨간색)는 훨씬 낮은 비용에서 Fable 5(주황색)보다 위에 있습니다. 출처: Anthropic.
CursorBench 3.2 차트: 노력별 과업당 비용 대비 에이전트형 코딩 점수, Opus 5가 절반 비용으로 Fable 5의 0.5% 이내에 도달
에이전트형 코딩(CursorBench 3.2): 최대 노력에서 Opus 5는 Fable 5의 최고 점수 0.5% 이내에 도달하면서도 과업당 비용은 절반입니다. 출처: Anthropic.
Artificial Analysis Coding Agent Index 차트: 네 개 모델 전반의 노력 수준별 과업당 비용 대비 지수 점수
Artificial Analysis Coding Agent Index: 노력 수준별 과업당 비용 대비 지수 점수. 출처: Anthropic.

코딩을 벗어나도 패턴은 같습니다:

  • ARC-AGI 3는 새로운 문제를 해결해야 하는 평가인데, Opus 5의 점수는 차점 모델의 세 배입니다.
  • Zapier AutomationBench는 모델이 비즈니스 과업을 처음부터 끝까지 완료할 수 있는지를 측정하는데, 같은 과업당 비용에서 차점 모델의 약 1.5배 성공률을 보였습니다. 또한 가장 낮은 노력 설정에서도 Opus 5는 다른 어떤 모델보다 더 많은 과업을 통과했습니다.
  • OSWorld 2.0은 컴퓨터 사용 벤치마크로, Fable 5의 최고 결과를 약 3분의 1 비용으로 앞섰고, 주어진 가격대에서 모든 모델을 리드했습니다.
ARC-AGI-3 차트: 새로운 문제 해결 점수 대비 총 평가 비용, Opus 5가 약 30%로 GPT-5.6 Sol의 약 세 배이며 Opus 4.8을 크게 상회
새로운 문제 해결(ARC-AGI-3): Opus 5는 약 30%를 기록해 GPT-5.6 Sol의 약 세 배이며 Opus 4.8을 크게 앞섰습니다. 출처: Anthropic.
AutomationBench 차트: 노력별 과업당 비용 대비 에이전트형 비즈니스 워크플로 통과율, Opus 5가 경쟁군을 크게 상회
에이전트형 비즈니스 워크플로(AutomationBench): Opus 5의 통과율은 다른 모든 모델을 크게 앞섭니다. 출처: Anthropic.
OSWorld 2.0 차트: 노력별 과업당 비용 대비 에이전트형 컴퓨터 사용 점수, Opus 5가 약 3분의 1 비용으로 Fable 5의 최고 결과를 앞섬
에이전트형 컴퓨터 사용(OSWorld 2.0): Opus 5는 과업당 비용의 약 3분의 1에서 Fable 5의 최고 결과를 앞섭니다. 출처: Anthropic.

Anthropic은 또한 AA Coding Agent Index, GDPval-AA v2, HLE, AutomationBench, DeepSearchQA에서도 최고의, 그리고 가장 비용 효율적인 결과를 얻었다고 주장합니다. 공개적으로 물러선 유일한 영역은 사이버보안으로, Project Glasswing을 통해 초청자 전용으로 제공되는 Mythos 5가 여전히 앞섭니다.

GDPval-AA v2 차트: 노력 수준별 전체 벤치마크 실행 비용 대비 현실 세계 지식노동 Elo 점수
현실 세계 지식노동(GDPval-AA v2): 노력 수준별 전체 벤치마크 실행 비용 대비 Elo 점수. 출처: Anthropic.
도구를 사용한 Humanity's Last Exam 차트: 노력 수준별 과업당 비용 대비 다학문적 추론 통과율
다학문적 추론(Humanity's Last Exam, 도구 사용 포함): 노력별 과업당 비용 대비 통과율. 출처: Anthropic.
DeepSearchQA 차트: 모델 전반의 노력 수준별 과업당 비용 대비 에이전트형 검색 통과율
에이전트형 검색(DeepSearchQA): 노력 수준별 과업당 비용 대비 통과율. 출처: Anthropic.

헤드라인 차트 아래의 세부 조건

Frontier-Bench 노력 그래프 아래 각주는 읽을 가치가 있습니다. 해당 수치는 GKE 백엔드를 사용하는 mini-SWE-agent 하네스에서의 내부 실행에서 나온 것이며, 과업당 다섯 번 시도의 평균 보상으로 점수가 매겨졌습니다. 그리고 그 실행 중 Opus 5든 Fable 5든 안전 분류기가 요청을 거부하면 Opus 4.8이 대체값으로 사용됐기 때문에, 그래프의 선은 엄밀히 말해 단일 모델 결과가 아닙니다.

전체 성적표 — 어디서 지는지도 포함해

출시 자료에서 가장 유용한 단일 자료는 Anthropic의 자체 비교표입니다. 왜냐하면 바로 그 지점에서 Opus 5의 승리가 멈추기 때문입니다. 이 모델은 14개 항목 중 9개를 선도하지만, Fable 5는 여전히 도구 없는 버전의 Humanity's Last Exam, FrontierCode 코딩 분할, 법률 벤치마크를 가져가고, OpenAI의 GPT-5.6 Sol는 한 에이전트형 코딩 평가에서 outright 1위를 차지하며, Anthropic의 초청자 전용 Mythos 5는 헬스 부문을 지킵니다. 아래 수치는 모두 Anthropic의 것이며, 각 모델은 최상의 노력 설정으로 평가됐습니다:

Anthropic의 전체 벤치마크 성적표: 14개 평가 전반에서 Claude Opus 5, Fable 5, Opus 4.8, GPT-5.6 Sol 비교, 각 범주의 선두는 굵게 표시
Anthropic의 전체 성적표: 14개 벤치마크에서 Claude Opus 5와 Fable 5, Opus 4.8, OpenAI의 GPT-5.6 Sol을 비교한 것입니다. 굵게 표시된 항목이 해당 범주의 선두입니다. Fable 5 열은 해당하는 두 행에서 Mythos 5를 인용합니다. 출처: Anthropic.

서술에서는 넘어가지만 표에서는 두 가지가 눈에 띕니다. DeepSWE v1.1라는 코딩 벤치마크에서 GPT-5.6 Sol의 72.7%는 모든 Claude, Opus 5를 포함해 전부를 앞섭니다. 또 Opus 5의 대표적 승리는 범주별로 편중돼 있습니다. ARC-AGI-3에서는 경쟁군을 30.2% 대 7.8%로 두 배 이상 벌렸고, AutomationBench에서는 26.0% 대 18.1%로 9포인트 앞섰지만, 코딩 분할에서는 전체 집단이 대체로 1포인트 안에서 붙어 있습니다.

Anthropic이 다른 어떤 모델도 끝내지 못했다고 말하는 세 가지 과업

Anthropic의 주장은 점수보다 지속성에서 더 강합니다. 평가와 초기 액세스 테스트에서 나온 세 가지 사례는 다음과 같습니다:

  • 기계 부품의 도면을 받고 이를 3D FreeCAD 모델로 재구성하라는 과제를, 도면을 직접 볼 수 없는 상태에서 받았을 때 Opus 5는 원시 픽셀에서 형상을 추출하기 위해 자체 컴퓨터비전 파이프라인을 작성한 뒤 전체 부품을 재구성했습니다. 이 과정을 반복해서 수행했습니다. Anthropic은 같은 설정에서 경쟁 모델 중 어느 것도 다섯 번의 시도 안에 해결하지 못했다고 말합니다.
  • 널리 쓰이는 오픈소스 패키지 관리자의 실제 버그를 받자, 근본 원인을 찾아 커뮤니티의 패치가 놓친 엣지 케이스까지 수정했습니다. 경쟁 모델은 표면적 증상만 고친 뒤 버그가 해결됐다고 보고했습니다.
  • 한 트레이딩 회사의 엔지니어는 이를 이용해 새 거래소를 위한 시장 데이터 피드를 단일 세션에서 구축했습니다. 이전 모델들은 충분한 계획이 주어져도 이를 전혀 완수하지 못했습니다. 검증할 실시간 피드가 없자, 모델은 자체 테스트 하네스를 만들어 코드가 거래소의 데이터를 올바르게 파싱하는지 확인했습니다.

초기 고객들이 실제로 측정한 것

Anthropic은 초기 액세스 고객들의 22개 증언을 공개했으며, 이 중 상당수는 수치를 담고 있습니다:

  • Box의 CTO Ben Kus: Opus 5는 전반적으로 Opus 4.8보다 8% 더 뛰어나며, 데이터 분석에서는 11%, 실사(due diligence)에서는 17% 향상을 보였습니다.
  • Lovable 공동창업자 Fabian Hedin: 회사의 가장 어려운 에이전트형 코딩 과제에서 Opus 4.7 대비 22% 향상을 보였고, "실행 간 변동이 훨씬 적고 더 안정적"이라고 말했습니다.
  • Zapier CEO Wade Foster: Opus 5는 "이전 Claude 모델보다 더 많은 토큰을 쓰지 않고도" AutomationBench에서 1위를 차지했습니다. 이전 모델들이 완전히 실패했던 이탈 방지 워크플로에서는 100%를 달성했습니다.
  • 한 법률 AI 팀은 최대 추론에서 Opus 4.8보다 26% 적은 토큰을 생성하면서도 더 낮은 추론 수준에서 비슷한 품질을 보고했습니다. 한 금융 평가 책임자는 3분의 1 적은 턴과 도구 호출, 그리고 60% 더 적은 시간으로 9포인트 더 높은 정확도를 측정했습니다. 한 트레이딩 벤치마크는 Opus 4.8보다 대략 7분의 1에 해당하는 추론 토큰과 절반 이하의 지연으로 역대 최고 Opus 결과를 기록했습니다.
  • Cognition CEO Scott Wu는 Devin 내부에서 "Fable 수준의 성능에 절반 비용으로 접근한다"며, 특히 디버깅과 근본 원인 분석에 강하다고 말했습니다. Vercel CTO Madhav Jha는 이를 "4.5 이후 Opus 계열에서 가장 큰 도약"이라고 평가했습니다.

한 보고서는 에이전트형 코딩이 어디로 가는지 예고합니다. 프런트엔드 벤치마크 팀은 모델이 브라우저에서 스스로 페이지를 열어 데스크톱과 휴대폰 폭 모두에서 확인했고, 모바일 접힘 아래에 숨은 제품과 화면 밖 체크아웃 버튼을 찾아내 둘 다 수정한 뒤 작업을 넘겼다고 전했습니다.

화학, 단백질, 그리고 풍동

Opus 5는 구조생물학, 유기화학, 생물정보학을 아우르는 Anthropic의 내부 생명과학 평가 모든 항목에서 Opus 4.8을 앞섭니다. 가장 큰 향상은 분광 데이터로부터 분자 구조를 추론하는 것과 같은 유기화학 과제에서 +10.2퍼센트포인트, 서열 변화가 기능에 미치는 영향을 예측하는 것과 같은 단백질 작업에서 +7.7포인트입니다. Anthropic은 또한 공기역학적, 그리고 의도적으로 비공기역학적인 물체 위의 공기 흐름을 시각화하기 위해 모델이 만든 상호작용형 풍동 시뮬레이션을 포함한 더 강한 시각적 출력도 강조합니다.

Anthropic이 감사한 가장 정렬된 모델

회사의 자동 행동 감사에서 Opus 5는 최근 모델 중 가장 낮은 전반적 부정렬 행동 2.3을 기록했습니다. Anthropic은 이 모델이 Opus 4.8, Sonnet 5, Fable 5보다 Claude's Constitution를 더 잘 준수하고, 기만적 행동 비율이 가장 낮으며, 오용으로 속아 넘어가기 가장 어렵고, 되돌리기 어려운 부작용을 낳는 무모한 행동을 피하는 데 있어 지금까지 가장 안전한 모델이라고 말합니다.

취약점 찾기는 강하지만, 이를 악용하는 능력은 억제됨

Anthropic은 Opus 5가 위험한 이중용도 역량에서 프런티어를 진전시키지 않으며, 민간 부문 및 정부 파트너와 함께 수행한 평가에서도 생물학 연구와 공격적 사이버보안 모두에서 Mythos 5보다 뒤처진다고 말합니다. Opus 4.8과 마찬가지로 회사는 의도적으로 Opus 5를 사이버 작업으로 학습시키지 않았다고 밝히지만, 모델은 더 범용적으로 유능해진 부산물로 그러한 작업에서도 개선됐습니다. 이제는 소프트웨어 취약점의 발견에서 Mythos 5에 근접합니다.

하지만 파이프라인의 후반부에서는 격차가 유지됩니다. OSS-Fuzz에서, 모델이 취약점을 찾아낸 뒤 많은 인간의 안내 없이 이를 악용할 수 있는지 평가하는 내부 평가에서 Opus 5는 식별에서는 Mythos 5와 같지만 익스플로잇 개발에서는 훨씬 뒤처집니다. 이는 버그를 실질적인 사이버 위협으로 바꾸는 단계입니다.

실제 안전장치는 어떻게 작동하나

Opus 5의 사이버 분류기는 소스 코드에서의 취약점 발견은 허용하지만, Anthropic이 악의적 행위자와 더 자주 연관 짓는 방식인 바이너리 기반 취약점 스캐닝과 침투 테스트, 익스플로잇 생성을 차단합니다. 회사는 자체 테스트에 따르면 이런 분류기가 Fable 5보다 약 85% 덜 개입할 것으로 예상합니다. Claude.ai, Claude Code, Claude Cowork에서는 차단된 요청이 기본적으로 Opus 4.8로 되돌아가며, API에서도 같은 폴백을 활성화할 수 있습니다. 이미 Anthropic의 Cyber Verification Program 안에 있는 기업과 연구자들은 제한이 더 적은 빌드에 즉시 접근할 수 있습니다.

생물학에서는 방향이 반대입니다. Opus 5는 Fable 5의 것보다 대체로 Opus 4.8의 안전장치 세트를 탑재하고 있기 때문에, 이제 Anthropic이 제공하는 과학 연구용으로 가장 유능한 일반 공개 모델입니다. 그리고 Fable 5에서 차단되는 생물학 요청은 이제 Opus 4.8이 아니라 Opus 5로 라우팅됩니다. 다만 회사는 장시간 자율 연구에 대한 한계는 여전히 표시하고 있으며, 이를 가장 위험한 영역으로 보고 있고, 그 영역에서는 Mythos 5가 여전히 더 강하다고 말합니다.

개발자가 바꿔야 하는 것

이 모델은 단순한 모델 문자열 교체로 끝나지 않습니다. 두 가지는 깨지는 변경입니다:

  • 적응형 사고가 기본값입니다. Opus 4.8은 요청받지 않으면 사고를 하지 않았지만, Opus 5는 달리 지정하지 않으면 사고합니다. 또한 max_tokens는 사고와 보이는 텍스트를 합친 하드 상한이므로, 기존 예산을 다시 검토해야 합니다.
  • 사고를 끌 수 있는 범위는 high 이하뿐입니다. thinking: {"type": "disabled"}xhigh 또는 max와 함께 쓰면 이제 400 오류가 반환됩니다.

그 밖에 최소 캐시 가능 프롬프트는 1,024개에서 512 토큰으로 내려가, 이전에는 캐시할 수 없었던 짧은 프롬프트도 코드 변경 없이 캐시할 수 있습니다. 두 기능은 베타로 제공됩니다. mid-conversation tool changes는 개발자가 프롬프트 캐시를 무효화하지 않고도 턴 사이에 도구를 추가하거나 폐기할 수 있게 해주며(mid-conversation-tool-changes-2026-07-01 헤더), automatic fallbacks는 안전 플래그가 붙은 요청을 거부 대신 다른 모델로 우회시킵니다(fallbacks: "default", server-side-fallback-2026-07-01 헤더).

두 기능은 이어받지 않습니다. web fetch 도구는 Opus 5에서 사용할 수 없고, Priority Tier도 지원되지 않습니다. Assistant 메시지 prefill과 기본값이 아닌 temperature, top_p, top_k 값도 Opus 4.8과 마찬가지로 여전히 400 오류를 반환합니다. Anthropic은 또한 기본 응답이 Opus 4.8보다 더 길게 진행된다고 경고하며, 노력 수준을 낮춘다고 해서 사고 시간을 줄일 수는 있지만 보이는 출력이 반드시 짧아지지는 않는다고 설명합니다. 따라서 간결함이 필요하면 그에 맞게 프롬프트하라고 권합니다. 노력 설정에 대해서는 Opus 4.8의 설정을 그대로 넘기지 말고 새로 탐색하라고 조언하는데, 이번 세대에서는 lowmedium이 유의미하게 더 강하기 때문입니다.

사양서

Opus 5는 100만 토큰 컨텍스트 창최대 출력 12만8,000토큰을 유지하며, Batch API의 확장 출력 베타를 통해 최대 30만 토큰까지 지원합니다. 또한 low, medium, high(기본값), xhigh, max의 다섯 가지 노력 수준을 모두 지원합니다. 훈련 데이터의 기준 시점은 2026년 5월로, Fable 5의 2026년 1월 기준 시점보다 네 달 더 새롭습니다. Fast mode는 Claude Platform과 Claude Code의 사용 크레딧을 통해 기본 가격의 두 배로 대략 2.5배 속도로 실행됩니다. 개발자는 Claude API에서 이를 claude-opus-5로 호출하며, Amazon Bedrock, AWS의 Claude Platform, Google Cloud, Microsoft Foundry에서도 제공됩니다. 이전 Opus 모델과 마찬가지로 일반 접근에는 데이터 보존 요구사항이 없습니다. Anthropic 문서는 이제 지원 중단된 Claude Opus 4.1 사용자에게도 Opus 5를 마이그레이션 대상이라고 안내하고 있으며, 해당 4.1은 2026년 8월 5일에 종료됩니다.