Anthropic의 서비스는 7월 29일 저녁 전 세계적으로 장애를 겪었습니다. 모든 모델 전반에서 오류가 급증하기 시작한 시각은 19:49 UTC였으며, 이로 인해 claude.ai, Claude API, Claude Code가 동시에 영향을 받았습니다. 완전한 복구는 22:36 UTC에 이뤄졌고, 이는 불과 3시간이 채 되지 않는 시간이었습니다.

사용자에게 보인 현상

요청은 529 Overloaded로 실패했습니다. 이는 서비스가 과부하를 감당할 수 없을 때 반환하는 상태 코드이며, 무언가가 고장 났을 때가 아닙니다. 이러한 구분은 해석에 중요하지만, Anthropic은 용량 문제가 원인인지 확인하지 않았습니다.

타임라인

Anthropic은 19:49에 조사를 시작했고, 20:33에 문제를 식별했다고 밝혔지만, 장애가 진행되는 동안 원인이나 복구 예상 시간을 공개하지 않았습니다. 이후 대변인은 "Claude.ai, Claude Code, Claude API 전반에서 서비스가 완전히 복구됐다"고 확인했습니다. 그러나 장애 이후 설명은 아직 나오지 않았습니다.

API 측면이 더 중요한 이유

챗봇 장애는 불편함에 그칩니다. 그러나 API 장애는 생산 시스템을 멈춰 세우며, Claude Code의 장애는 엔지니어링 팀을 대화 중간이 아니라 작업 도중 오프라인 상태로 만듭니다. 최첨단 모델이 도우미에서 배포된 소프트웨어 내부의 의존성으로 이동함에 따라, 단일 제공업체의 다운타임은 더 이상 소비자용 이야기로만 볼 수 없습니다.

침묵

근본 원인 분석은 공개되지 않았습니다. 점점 더 많은 기업이 생산 워크로드를 단일 API로 라우팅하는 상황에서 기업 시장에 판매하는 회사에게, 사후 보고서가 없다는 사실 자체가 눈에 띄는 부분입니다. 가동 시간 조건을 협상하는 구매자들은 읽을 자료가 없습니다.