Opus 5 출시, 성능은 Fable급인데 가격은 반으로

여러 색과 무늬의 조약돌이 숫자 5 모양을 이루는 Claude Opus 5 공식 이미지
Anthropic이 7월 24일 공개한 Claude Opus 5. 이미지: Anthropic

Anthropic이 7월 24일 Claude Opus 5를 출시했다. Opus 5는 Claude Max의 기본 모델이며 Claude Pro를 포함한 모든 유료 요금제와 API에서 제공된다. API 가격은 이전 Opus 4.8과 같은 입력 100만 토큰당 5달러, 출력 25달러다. Anthropic은 더 비싼 Fable 5에 가까운 성능을 절반 가격에 제공해 일상 업무에 활용할 수 있는 모델로 소개했다.

Opus 5는 100만 토큰 컨텍스트와 최대 12만8천 토큰 출력을 지원한다. 출시 직후 Frontier-Bench와 Artificial Analysis의 평가에서 소프트웨어 작업과 사무 업무 성능이 모두 선두권으로 나타났다. Fable 5의 출시와 중단, GPT-5.6과 중국 모델의 등장까지 이어진 흐름은 2026년 여름 코딩 AI 경쟁 타임라인에서 다뤘다.

가격과 주요 사양

API 모델 ID는 claude-opus-5다. 100만 토큰 컨텍스트가 기본이자 최대이며, 동기 Messages API에서 최대 12만8천 토큰을 출력할 수 있다. 이미지와 텍스트를 입력받고 텍스트를 출력한다. 지식 기준 시점은 2026년 5월이다. Anthropic은 파라미터 수, 학습 토큰 수와 연산량을 공개하지 않았다.

Claude Opus 5의 사양과 가격

Claude Opus 5와 Opus 4.8, Fable 5의 주요 사양과 API 가격 비교
항목Opus 5Opus 4.8Fable 5
입력 가격$5$5$10
출력 가격$25$25$50
컨텍스트100만 토큰100만 토큰100만 토큰
최대 출력12만8천 토큰12만8천 토큰12만8천 토큰
기본 efforthighhighhigh
가격은 API에서 입력과 출력 100만 토큰당 금액이다. Opus 5의 Fast mode는 약 2.5배 빠른 대신 입력 10달러, 출력 50달러다.출처: Anthropic [1], Claude Platform Docs [2]

Opus 5의 가격은 Opus 4.8과 같고 Fable 5의 절반이다. 모든 분야에서 Fable 5보다 강한 모델은 아니지만, 코딩과 지식 업무에서 가격 대비 성능을 높인 모델이라는 것이 Anthropic의 설명이다.

Frontier-Bench에서 Opus 4.8의 두 배

Frontier-Bench v0.1 공개 리더보드에서 max effort의 Opus 5는 해결률 43.5%에 오차 범위 ±1.7%를 기록했다. GPT-5.6 Sol은 34.4%, Fable 5는 33.8%, Opus 4.8은 21.1%였다.

Claude Opus 5, Fable 5, Opus 4.8, GPT-5.6 Sol의 Frontier-Bench v0.1 점수와 작업당 비용을 effort 단계별로 비교한 그래프
Opus 5는 모든 effort 구간에서 Opus 4.8보다 높은 Frontier-Bench 점수를 기록했고, max effort에서 43.5%에 도달했다. 가로축은 시도당 비용의 로그 축이다. 이미지: Anthropic [1]

모델별 실행 조건은 같지 않았다. Opus 5는 mini-SWE-agent, Fable 5와 Opus 4.8은 Claude Code, GPT-5.6 Sol은 Codex를 사용했다. 따라서 43.5%는 모델과 실행 도구를 합친 결과로 보는 것이 정확하다.

사무 업무 평가에서도 1위

모델 평가기관 Artificial Analysis는 44개 직업과 9개 산업에서 가져온 220개 과제로 문서, 프레젠테이션과 스프레드시트 작성 능력을 평가했다. Opus 5 max는 GDPval-AA v2에서 1,861 Elo, xhigh는 1,827로 1위와 2위를 차지했다. Fable 5 max와 Opus 4.8 조합은 1,747, GPT-5.6 Sol max는 1,735였다.

Claude Opus 5, Fable 5, Opus 4.8, GPT-5.6 Sol의 GDPval-AA v2 Elo와 전체 평가 비용을 effort 단계별로 비교한 그래프
GDPval-AA v2에서 Opus 5는 effort를 높일수록 Elo가 상승했다. 가로축은 전체 평가 비용의 로그 축이다. 이미지: Anthropic [1]

Opus 5는 설정에 따라 한 과제에 평균 25분에서 36분을 사용했고 에이전트 턴은 76회에서 103회였다. 분석 품질은 높았지만 표현과 프레젠테이션 품질에서는 GPT-5.6 Sol보다 낮았다. 높은 점수에는 긴 실행 시간과 많은 도구 호출이 함께 따랐다.

API 전환 시 확인할 점

Anthropic의 시스템 카드에서 Opus 5는 이전 모델보다 전반적으로 정확했지만, 사실과 다른 답을 확신 있게 제시하는 비율은 Opus 4.8보다 조금 높았다. 장시간 실행하는 작업에서는 최종 결과와 변경 내역을 함께 검토할 필요가 있다.

Opus 5는 요청에 별도 설정이 없어도 adaptive thinking을 사용하며 API와 Claude Code의 기본 effort는 high다. Opus 4.8에서 모델 ID만 바꿔도 추론 시간과 토큰 사용량이 달라질 수 있다. 응답이 길거나 하위 에이전트 수가 늘어날 수 있으므로 작업 범위와 출력 길이를 명시하는 편이 낫다. thinking을 끈 상태에서 xhighmax effort를 요청하면 오류가 발생한다.

출시 초기 사용기는 엇갈렸다. Claude Code 팀과 초기 사용자는 이전 모델에 맞춘 복잡한 지시를 줄였을 때 결과가 좋아졌다고 평가했다. 장시간 작업을 이어 가는 능력이 나아졌다는 반응이 있었던 반면, 간단한 수정에 과도한 코드와 여러 에이전트를 동원했다는 사례도 나왔다. 출시 직후의 개인 사례라 일반화하기는 어렵다.

출시 의미

Opus 5는 Anthropic의 최고 성능 모델인 Fable 5를 대체하지 않는다. 대신 Opus 4.8과 같은 가격으로 코딩과 사무 업무 성능을 높여, 유료 사용자와 API 고객이 일상 업무에 활용할 수 있도록 한 모델이다. 공개 벤치마크에서는 이전 세대보다 뚜렷한 향상을 보였지만 실행 도구와 설정이 달랐던 만큼, 실제 효과는 사용하는 작업과 비용을 함께 비교해야 한다.

원문 출처