중국 인공지능 기업 딥시크(DeepSeek)가 7월 31일 오후 3시 56분 V4-Flash-0731 API를 공개 베타로 출시했다. 모델 ID는 기존과 같은 deepseek-v4-flash다. 딥시크는 후속 학습으로 에이전트 역량을 크게 높이고 Responses API와 Codex 연동을 추가했다고 밝혔다.[1] 이번 교체는 V4-Flash API에만 적용됐다. V4-Pro API와 딥시크 앱 및 웹 모델은 그대로다.[2][3]
구조는 그대로, API 제공 모델만 0731로 교체
V4-Flash-0731은 기존 프리뷰 모델에 후속 학습을 다시 적용한 버전이다. 딥시크는 프리뷰 버전의 모델 구조와 크기를 그대로 유지했다고 설명했다. 기존 모델 카드에 따르면 전체 매개변수 284B 가운데 추론 시 13B를 활성화하는 희소 전문가 혼합(MoE) 구조다.[2][4]
이번에 바뀐 것은 API가 제공하는 모델이다. 딥시크는 0731 가중치 공개를 발표하지 않았고, 공식 Hugging Face에는 4월 공개한 프리뷰 모델 DeepSeek-V4-Flash가 남아 있다. 따라서 API에서 호출하는 0731 모델과 현재 내려받을 수 있는 프리뷰 모델은 구조는 같지만 후속 학습 상태가 다르다.[2][4]
DeepSeek, 에이전트 평가 9개 항목 개선 발표
딥시크가 공개한 내용에 따르면 V4-Flash-0731은 에이전트 평가 9개 항목에서 모두 V4-Flash Preview와 V4-Pro Preview를 웃돌았다. 회사는 구조와 크기를 바꾸지 않고 후속 학습으로 에이전트 성능을 높였다고 설명했다. 공개한 표에서 상승 폭이 가장 큰 DeepSWE는 7.3점에서 54.4점으로 올랐고, Terminal-Bench 2.1은 61.8점에서 82.7점으로 높아졌다.[1][2]
minimal mode와 max tier, top_p=0.95, temperature=1.0으로 실행해 수치를 산출했다고 밝혔다. DSBench 두 항목은 내부 평가셋이다. 이미지: DeepSeek [1], [3]| 평가 | FlashPrev. | ProPrev. | 0731 | Opus4.8 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 61.8 | 72.1 | 82.7 | 85.0 |
| DeepSWE | 7.3 | 12.8 | 54.4 | 58.0 |
| Toolathlon-Verified | 49.7 | 55.9 | 70.3 | 76.2 |
| Agents' Last Exam | 15.8 | 16.5 | 25.2 | 25.7 |
Artificial Analysis의 독립 평가에서도 지능 지수 v4.1이 이전 V4-Flash의 40점에서 50점으로 올랐다. 평가 하네스와 실행 조건이 다른 독립 결과는 DeepSeek가 공개한 수치와 별도로 봐야 한다.[5]
입력 0.14달러, 출력 0.28달러 유지
가격과 컨텍스트 한도는 기존 V4-Flash와 같다. 캐시되지 않은 입력은 100만 토큰당 0.14달러, 캐시된 입력은 0.0028달러, 출력은 0.28달러다. 컨텍스트는 1,048,576토큰이며 최대 출력은 384,000토큰이다. 텍스트를 입출력하는 모델이며, 추론 수준은 low, high, max 세 단계로 조절할 수 있다.[6][7]
| 모델 ID | deepseek-v4-flash |
|---|---|
| 구조 | 284B MoE, 추론 시 13B 활성화 |
| 입출력 | 텍스트 입력, 텍스트 출력 |
| 컨텍스트 | 1,048,576토큰 |
| 최대 출력 | 384,000토큰 |
| 100만 토큰당 가격 | 캐시되지 않은 입력 $0.14, 캐시 입력 $0.0028, 출력 $0.28 |
Artificial Analysis에서 V4-Flash-0731은 지능 지수 과제당 평균 0.027달러로 비교 모델 가운데 가장 낮은 비용을 기록했다. 그러나 평가 전체에서 생성한 출력 토큰은 약 2억 1천만 개로, 비교 집단 중앙값인 6천2백만 개의 세 배를 넘었다. 토큰 단가가 낮아도 긴 에이전트 작업의 총비용과 지연 시간은 실제 요청을 보내 확인해야 한다.[5]
딥시크는 매일 오전 10시부터 오후 1시까지, 오후 3시부터 7시까지 API 가격을 두 배로 올리는 피크 요금을 곧 도입할 예정이다. 정확한 시행일은 별도로 발표한다.[6]
Responses API와 Codex 지원
V4-Flash-0731은 OpenAI Responses API와 호환되는 요청 및 응답 형식을 기본 지원한다. 다만 상태를 저장하지 않으므로 previous_response_id, 응답 저장, 백그라운드 처리는 지원하지 않는다. 함수 호출과 서버 측 웹 검색, Codex용 apply_patch는 지원하지만, 파일 검색과 코드 실행기, MCP 같은 다른 기본 도구 요청은 무시한다. OpenAI Responses API의 모든 서버 기능을 제공하는 것은 아니다.[8]
Codex 연동의 핵심 값은 base_url의 https://api.deepseek.com/과 모델 ID deepseek-v4-flash다. 이는 핵심 값만 요약한 것으로, 공식 전체 설정에는 모델 제공자와 API 키 인증, model_catalog_json, wire_api = "responses"도 포함된다. 현재 Codex 연동은 V4-Flash만 지원하며 V4-Pro 지원은 8월 초로 예정됐다. 소비자용 앱과 웹에는 0731이 적용되지 않았다. 코딩 에이전트용 저가 API 선택지는 늘었지만, 새 가중치가 발표되지 않아 로컬 실행 모델의 선택지는 그대로다.[7][2]