2026년 여름 코딩 AI 경쟁 지도
- : Fable 5 출시
- : Codex 저장형 리셋 기능 공개
- : Fable 5 접근 중단
- : GLM-5.2 정식 공개
- : GPT-5.6 제한 프리뷰
- : Fable 5 조건부 복귀
- : Cursor에서 Grok 4.5 출시
- : GPT-5.6 정식 출시
- : Grok Build 저장 동작 분석 공개
- : xAI의 프라이버시 대응 발표
- : Codex 900만과 리셋, Kimi K3 출시, Grok 4.5 공식 소개
- : Fable 5의 Max 요금제 포함 발표, Codex 리셋
- : Codex 1,000만과 리셋
- : Grok 4.5 소비자 채널 확대
- : Grok 전 채널 제공 발표와 ARC Prize 결과 공개
- : Claude Opus 5 출시
2026년 6월과 7월의 코딩 AI 경쟁은 Anthropic의 Fable 5 출시로 시작됐다. Fable 5는 나흘 만에 접근이 중단됐다. 이어 OpenAI가 GPT-5.6을 공개했고 GLM-5.2, Kimi K3, Grok 4.5도 잇따라 출시됐다. 한국시간 7월 25일에는 Anthropic이 Claude Opus 5를 추가했다. 모델 성능뿐 아니라 요금제, 사용량 리셋, 서비스 용량, 코드 보관 방식까지 경쟁의 변수가 됐다.
Fable 5 출시: Claude Code에 투입된 새 최상위 모델
Anthropic은 6월 9일 Claude Fable 5를 전 세계에 출시했다. 회사는 Fable 5를 일반 사용에 맞춘 Mythos급 모델로 소개했고, Claude 앱과 Claude Code, API에 제공했다. 더 강한 Mythos 5는 사이버 보안 분야의 제한된 파트너에게만 열었지만 Fable 5는 출시일부터 일반 사용자가 쓸 수 있었다.[1][2]
Anthropic의 공식 코딩 평가에서 Fable 5는 SWE-bench Pro 80.3%, FrontierCode 29.3%를 기록했다. 같은 표에서 Claude Opus 4.8은 각각 69.2%와 13.4%, GPT-5.5는 58.6%와 5.7%였다. Fable 5가 해당 두 평가에서 기존 최상위 모델을 크게 앞선 결과였다.[1]
나흘 만의 중단과 GLM-5.2의 등장
6월 13일 Fable 5의 접근이 갑자기 중단됐다. Anthropic은 미국 정부가 국가안보 권한을 근거로 외국 국적자의 Fable 5와 Mythos 5 접근을 막는 수출통제 지침을 내렸다고 밝혔다. 회사는 지침을 준수하기 위해 두 모델을 모든 고객에게서 비활성화했다. 다른 Claude 모델은 계속 제공됐다.[3]
같은 시기 중국 AI 기업 Z.ai는 GLM-5.2를 공개하고 가중치를 MIT 라이선스로 배포했다. Z.ai의 평가에서 GLM-5.2는 FrontierSWE 74.4%, SWE-bench Pro 62.1%, Terminal-Bench 2.1 81.0%를 기록했다. 같은 표의 Claude Opus 4.8은 각각 75.1%, 69.2%, 85.0%였다. "Opus급"이라는 반응은 특히 FrontierSWE에서 두 모델의 점수가 가까웠던 데서 나왔다. SWE-bench Pro와 Terminal-Bench 2.1에서는 Opus 4.8이 더 높았다.[4]
Fable 5 복귀와 Max 요금제 포함
미국 상무부가 6월 30일 통제를 해제한 뒤 Fable 5는 7월 1일 돌아왔다. Anthropic은 사이버 보안 요청을 탐지하는 분류기를 강화했고, 정상적인 코딩 요청이 잘못 분류되면 Opus 4.8이 대신 응답할 수 있다고 설명했다.[5][6][7]
복귀 조건은 계속 바뀌었다. 처음에는 모든 유료 요금제에서 7월 7일까지 제공하고 Fable 5 사용량을 주간 한도의 50%로 제한했다. 종료일은 7일에 12일로, 다시 12일에 19일로 연장됐다. 7월 18일 Claude 공식 X 계정은 20일부터 Fable 5를 Max와 Team Premium에 포함한다고 발표했다.[8][9][10][11]
| 공지일 | Fable 5 제공 방식 | 변경 |
|---|---|---|
| 7월 1일 | 모든 유료 요금제, 7월 7일까지, 주간 한도의 50% | 조건부 복귀 |
| 7월 7일 | 7월 12일까지 | 첫 연장 |
| 7월 12일 | 7월 19일까지 | 두 번째 연장 |
| 7월 18일 발표 | 20일부터 Max와 Team Premium에 포함, 주간 한도의 50% | Max 요금제에 포함 |
Pro와 Team Standard 사용자는 사용 크레딧으로 Fable 5를 계속 이용할 수 있었다. Claude 공식 계정은 이 사용자들에게 일회성 100달러 크레딧을 지급한다고 명시했다. Max와 Team Premium에서도 Fable 5 사용량은 주간 한도의 50%였다.[11]
Anthropic: Fable 5에서 Opus 5까지
GPT-5.6과 Codex의 반격
OpenAI는 6월 26일 GPT-5.6 Sol, Terra, Luna를 제한적으로 공개했고 7월 9일 ChatGPT, Codex, API로 정식 배포했다. 같은 날 여러 앱과 파일을 넘나들며 장시간 작업하는 ChatGPT Work도 발표했다.[12][13][14][15]
7월 14일 샘 올트먼 OpenAI 최고경영자는 GPT-5.6 Sol이 같은 작업에서 Fable 5의 절반 가격이고 토큰 효율은 약 두 배라서 완료 작업당 비용이 4분의 1이라고 밝혔다. Codex와 ChatGPT Work의 사용량이 한 주 사이 2.5배 늘었다는 수치도 같은 날 공개했다.[16][17]
리셋은 서버에서 주간 사용량을 즉시 100%로 복구하는 전역 리셋과 사용자가 원하는 시점에 적용하는 저장형 리셋으로 나뉘었다. OpenAI는 6월 12일 Go, Plus, Pro, Business 사용자에게 저장형 리셋 1회를 지급했다.[18]
공식 전역 리셋이 시작되기 전인 7월 8일에도 일부 사용자는 Codex 한도가 여러 번 초기화됐다가 되돌아오는 동작을 보고했다. Tibo의 전역 리셋 공지는 확인되지 않은 날이어서 아래 공식 횟수에는 포함하지 않았다.[19]
OpenAI의 Codex와 ChatGPT Work 제품 책임자 Tibo는 한국시간 7월 10일부터 22일까지 전역 리셋을 최소 8차례 발표했다. 10일, 11일 두 차례, 13일, 15일, 16일, 18일, 22일에 공지가 나왔다.
| 날짜 | Tibo의 발표 | 사용자 반응 |
|---|---|---|
| 7월 10일 | 1시간 안에 전체 한도 복구[20] | "Codex 사용량이 리셋됐다"[21] |
| 7월 11일 | 한도 복구 완료, 같은 날 추가 리셋 예고[22] | 자동 적용돼 시점을 고를 수 없었다는 반응[23] |
| 7월 11일 | 30분 안에 두 번째 리셋 적용[24] | "또 자동으로 적용됐다"[25] |
| 7월 13일 | 600만 사용자 발표와 리셋[26] | 주간 한도 100% 복구와 5시간 제한 해제 확인[27] |
| 7월 15일 | 800만 사용자 발표와 전체 리셋[28] | 주간 사용량 100% 복구 확인[29] |
| 7월 16일 | 900만 사용자 발표와 전체 리셋[30] | Claude Code와 Codex 한도가 함께 리셋됐다는 반응[31] |
| 7월 18일 | 모든 유료 사용자의 한도 복구[32] | Codex 한도 복구 확인[33] |
| 7월 22일 | 1,000만 사용자 발표와 전체 리셋[34] | 리셋 적용을 확인한 반응[35] |
저장형 리셋도 병행됐다. 7월 12일에는 버튼 오류의 영향을 받은 약 50만 명에게 저장형 리셋을 지급했고, 13일에는 700만 사용자 달성을 기념해 모든 사용자 계정에 1회씩 추가했다. 저장형 리셋은 데스크톱 앱이나 웹에서 직접 적용해야 주간 사용량이 채워졌다.[36][37]
5시간 한도 해제는 별도 정책이었다. Tibo는 7월 12일 Plus, Business, Pro의 5시간 제한을 일시적으로 없앴고, 14일에도 미적용 상태가 계속된다고 밝혔다. 16일에는 Plus와 Pro 사용자에게 며칠째 5시간 한도를 적용하지 않고 있다며 의견을 물었다.[26][28][38]
한국시간으로 7월 10일부터 13일까지 첫 네 차례 리셋이 집행됐고, 11일에는 두 차례 있었다. 이후 15일, 16일, 18일, 22일에도 한도를 다시 채웠다. 급성장기 사용자 반응에는 감사와 함께 자동 리셋이 저장형 쿠폰처럼 원하는 시점에 적용되지 않는다는 불만도 섞였다.[21][23][25][27][29][31][33][35]
7월 18일 Tibo는 Claude의 Fable 5 요금제 발표를 인용하며 "GPT-5.6 Sol이 매우 좋은 모델이라는 사실이 확인됐다"고 썼고, 같은 날 유료 사용자의 사용량을 다시 리셋했다.[39][32]
OpenAI: GPT-5.6 출시와 Codex 리셋
GLM-5.2에 이어 Kimi K3가 합류했다
문샷AI는 7월 16일 Kimi K3를 서비스와 API에 출시했다. 총 2.8조 파라미터, 100만 토큰 컨텍스트, 네이티브 멀티모달, 장기 에이전트 코딩을 주요 사양으로 제시했다. 가중치는 7월 27일까지 공개하겠다고 예고했다. 공식 블로그는 다음 날 게시됐다.[40][41]
Kimi K3 발표 다음 날 상하이에서 WAIC 2026이 개막했다. 문샷AI는 7월 19일 수요가 서비스 용량에 근접했다며 신규 구독을 일시 중단하고 기존 구독자에게 연산 자원을 우선 배정했다.[42][43]
문샷AI가 공개한 Triton 커널 최적화 실험에서 Kimi K3와 Fable 5는 비슷한 최종 성능에 도달했다. 문샷AI는 K3가 반복 과정에서 더 빠르게 성능을 높였다고 설명했다. 별도로 Artificial Analysis는 7월 17일 자사 Intelligence Index 50점을 넘긴 모델을 보유한 연구소가 6곳으로 늘었다고 발표했다.[41][44]
Z.ai와 문샷AI: GLM-5.2에서 Kimi K3까지
Grok 4.5 출시와 Grok Build 프라이버시 사건
Grok 4.5의 최초 출시는 7월 8일이었다. Cursor는 SpaceXAI와 함께 Grok 4.5를 데스크톱, 웹, iOS, CLI, SDK에 제공한다고 발표했다. xAI는 16일 모델의 구조와 평가 결과를 공식 소개했다.[45][46]
출시 직후 Grok Build가 전송하는 데이터의 범위가 공개됐다. 보안 연구자 cereblab은 7월 10일 Grok Build 0.2.93의 통신을 분석한 결과를 발표했다. 연구자의 테스트에서는 에이전트가 읽은 파일뿐 아니라 Git이 추적하는 저장소 전체와 커밋 이력이 xAI 서버로 전송됐다. "Improve the model" 설정을 꺼도 저장소 업로드는 계속됐다.[47]
7월 13일 SpaceXAI는 팀 요금제에서 데이터 무보존 정책을 선택하거나 API 키를 사용하면 코드와 추적 데이터를 저장하지 않는다고 밝혔다. 일반 사용자는 CLI의 /privacy 명령으로 데이터 보존을 중단하고 이전에 동기화된 데이터를 삭제할 수 있다고 덧붙였다. 일론 머스크는 같은 날 그때까지 SpaceXAI에 업로드된 사용자 데이터를 모두 삭제하겠다고 발표했다. 연구자가 이후 다시 확인한 결과 저장소 업로드는 서버 측 변경으로 중단됐지만 /privacy 명령은 데이터 전송이 아니라 보존 여부를 제어했다.[48][49][47]
xAI는 7월 22일 Grok 4.5를 grok.com과 X, iOS, Android에 제공한다고 발표했다. Grok 공식 X 계정은 23일 주요 소비자 채널에서 제공이 시작됐다고 밝혔다.[50][51]
일론 머스크는 Grok 4.5가 Fable 5만큼 뛰어나지는 않지만 빠르고 비용 효율적이라고 평가했다.[52]
성능 측면에서 ARC Prize는 7월 23일 Grok 4.5의 검증 결과를 공개했다. ARC-AGI-1은 85.7%와 과제당 0.33달러, ARC-AGI-2는 52.6%와 과제당 0.78달러, ARC-AGI-3은 0.3%와 총비용 6,900달러였다.[53]
Artificial Analysis는 Grok 4.5 high를 당시 자사 Intelligence Index 선두권에 배치했다. ARC Prize 결과는 강한 성능과 함께 ARC-AGI-3에서 아직 낮은 점수와 높은 비용이 남아 있음을 보여줬다.[44][53]
xAI: Grok 4.5 출시와 프라이버시 대응
Anthropic의 마지막 반격, Claude Opus 5
Claude 공식 X 계정은 한국시간 7월 25일 오전 1시 59분 Claude Opus 5를 출시했다. Anthropic은 Opus 5를 Fable 5의 최상위 성능에 가까우면서 가격은 절반인 모델로 소개했다. 모든 유료 요금제와 Claude API에서 제공되며 Claude Max의 기본 모델, Claude Pro에서 사용할 수 있는 가장 강한 모델이 됐다.[54][55]
API 모델 ID는 claude-opus-5다. 컨텍스트 창은 100만 토큰이고 일반 Messages API의 최대 출력은 12만 8천 토큰이다. 일반 API 가격은 입력 100만 토큰당 5달러, 출력 100만 토큰당 25달러로 Opus 4.8과 같다. API 전용 연구 프리뷰인 Fast 모드는 입력 10달러와 출력 50달러다. Fast 모드는 기본 대비 약 2.5배 빠르지만 가격도 두 배다.[56][57]
Opus 5는 적응형 사고를 기본으로 사용한다. Claude API와 Claude Code의 effort 기본값은 high이며 low, medium, high, xhigh, max를 지원한다. max_tokens는 사고 과정과 최종 답변을 합친 총 출력 한도다. Anthropic은 max가 어려운 작업에서는 성능을 높일 수 있지만 간단한 작업에서는 필요 이상으로 오래 생각할 수 있다고 설명했다. 학습 데이터와 신뢰 가능한 지식의 기준 시점은 모두 2026년 5월이다.[54][56]
Anthropic의 공식 비교표에서 Opus 5는 Frontier-Bench v0.1 43.7%, ARC-AGI-3 30.2%, OSWorld 2.0 70.6%, AutomationBench 26.0%를 기록했다. 같은 표에서 Fable 5는 각각 33.7%, 미측정, 66.1%, 17.4%였다. GPT-5.6 Sol은 각각 34.4%, 7.8%, 62.6%, 18.1%였다. DeepSWE v1.1은 GPT-5.6 Sol이 72.7%로 Opus 5의 68.8%보다 높았고, FrontierCode v1.1 Main은 Fable 5가 53.5%로 Opus 5의 53.4%를 근소하게 앞섰다.[55]
ARC Prize와 Artificial Analysis의 외부 평가
ARC Prize Foundation의 검증에서 Opus 5는 Max reasoning 기준 ARC-AGI-1 97.5%와 ARC-AGI-2 90.4%를 기록했다. 태스크당 비용은 각각 0.70달러와 2.06달러였다. ARC-AGI-3은 High reasoning으로만 평가해 30.16%를 기록했고, 25개 환경 전체 평가비는 2만 657.37달러였다. 이전 Verified 최고였던 GPT-5.6 Sol Max의 7.78%를 크게 넘어선 새 최고 기록이다. Opus 5는 이전 모델이 완료하지 못했던 5개 환경을 새로 풀어 총 6개 환경을 완료했다.[58][59]
Artificial Analysis의 출시 당일 평가에서는 Opus 5 max가 Intelligence Index v4.1에서 61점으로 1위에 올랐다. 같은 설정에서 GDPval-AA v2 1,861 Elo, Terminal-Bench v2.1 89.1%, Coding Index 78.0, Agentic Index 55.3을 기록했다. 모든 세부 평가를 이긴 것은 아니었다. Humanity's Last Exam에서는 Fable 5가 53.3%로 Opus 5의 52.6%보다 높았고, GPQA Diamond에서는 GPT-5.6 Sol이 94.1%로 Opus 5의 93.2%를 앞섰다. Artificial Analysis는 출시 전 Anthropic을 도와 Opus 5를 평가했다고 밝혀, 제공사와 협력해 수행한 외부 측정으로 보는 것이 정확하다.[60][61]
위험한 해킹 요청은 Opus 4.8로 전환
Opus 5에는 심각한 피해로 이어질 수 있는 해킹이나 악성코드 제작 요청을 판별하는 별도 안전 분류기가 적용됐다. Claude.ai와 Claude Code, Claude Cowork에서는 이 분류기에 걸린 요청이 기본적으로 Opus 4.8로 전환된다. 사용자가 직접 입력한 문장뿐 아니라 메모리, 연결 서비스의 내용, 웹 검색 결과, 파일도 검사 대상이어서 사용자가 작성하지 않은 내용으로 전환이 일어날 수 있다.[54][62]
API에서는 자동 전환이 기본값이 아니다. 베타 헤더와 fallbacks: "default"를 명시해야 하며, 분류 항목에 따라 다른 모델로 전환되거나 요청이 거부될 수 있다. 이 기능은 안전 분류기의 거부에만 작동하고 사용량 제한, 과부하, 서버 오류에는 적용되지 않는다.[63]
Opus 5의 가격과 100만 토큰 컨텍스트, effort별 외부 평가와 초기 사용자 반응은 Claude Opus 5 모델 분석에서 더 자세히 다뤘다.
공식 발표와 기관 평가로 비교한 모델별 성능
| 모델 | 공개된 핵심 결과 | 배포 상태 |
|---|---|---|
| Fable 5 | SWE-bench Pro 80.3%, FrontierCode 29.3% | Max와 Team Premium에 주간 한도 50%로 포함 |
| GLM-5.2 | FrontierSWE 74.4%, Terminal-Bench 2.1 81.0% | MIT 라이선스 가중치 공개 |
| GPT-5.6 Sol | OpenAI가 Fable 5 대비 완료 작업당 비용 4분의 1이라고 발표 | ChatGPT, Codex, API |
| Kimi K3 | Artificial Analysis Intelligence Index 50점 이상 그룹 진입 | 서비스와 API 출시, 가중치 공개 예고 |
| Grok 4.5 | ARC-AGI-1 85.7%, ARC-AGI-2 52.6% | Cursor와 주요 소비자 채널 |
| Claude Opus 5 | ARC Prize ARC-AGI-3 30.16%, Artificial Analysis Index 61 | 모든 유료 요금제와 API |
2026년 7월의 결과
Anthropic은 Fable 5를 Max 요금제에 포함시킨 데 이어 Opus 5를 모든 유료 요금제와 API에 출시했다. OpenAI는 GPT-5.6을 출시했고 Tibo는 Codex와 ChatGPT Work의 사용량을 8차례 리셋했다. Z.ai는 GLM-5.2 가중치를 공개했고 문샷AI는 Kimi K3의 서비스와 API를 먼저 열었다. xAI는 Grok 4.5의 배포 범위를 넓히는 동시에 Grok Build의 코드 보관 정책을 수정했다.
한국시간 7월 25일의 Opus 5 출시는 Fable 5로 시작된 경쟁을 다시 Anthropic으로 돌려놓았다. Opus 5는 ARC Prize의 ARC-AGI-3 검증에서 새 최고 기록을 세웠고 Artificial Analysis의 종합 지수에서도 1위에 올랐다. DeepSWE에서는 GPT-5.6 Sol, FrontierCode에서는 Fable 5가 앞섰지만 외부 기관의 출시 당일 결과는 Opus 5가 프론티어 모델군의 선두에 들어섰음을 보여줬다. 가격과 안전 분류에 따른 모델 전환까지 함께 공개되면서 경쟁 기준도 성능, 비용, 사용 조건으로 넓어졌다.