DeepSeek, V4-Flash-0731 API 공개 베타 출시

밝은 배경에 DeepSeek, V4-Flash-0731 API 공개 베타 출시라는 제목을 크게 배치한 44BITS NEWS 대표 이미지
DeepSeek는 V4-Flash API의 모델 ID를 유지한 채 API 제공 모델을 0731 버전으로 교체했다.

중국 인공지능 기업 딥시크(DeepSeek)가 7월 31일 오후 3시 56분 V4-Flash-0731 API를 공개 베타로 출시했다. 모델 ID는 기존과 같은 deepseek-v4-flash다. 딥시크는 후속 학습으로 에이전트 역량을 크게 높이고 Responses API와 Codex 연동을 추가했다고 밝혔다. 이번 교체는 V4-Flash API에만 적용됐다. V4-Pro API와 딥시크 앱 및 웹 모델은 그대로다.

구조는 그대로, API 제공 모델만 0731로 교체

V4-Flash-0731은 기존 프리뷰 모델에 후속 학습을 다시 적용한 버전이다. 딥시크는 프리뷰 버전의 모델 구조와 크기를 그대로 유지했다고 설명했다. 기존 모델 카드에 따르면 전체 매개변수 284B 가운데 추론 시 13B를 활성화하는 희소 전문가 혼합(MoE) 구조다.

이번에 바뀐 것은 API가 제공하는 모델이다. 딥시크는 0731 가중치 공개를 발표하지 않았고, 공식 Hugging Face에는 4월 공개한 프리뷰 모델 DeepSeek-V4-Flash가 남아 있다. 따라서 API에서 호출하는 0731 모델과 현재 내려받을 수 있는 프리뷰 모델은 구조는 같지만 후속 학습 상태가 다르다.

DeepSeek, 에이전트 평가 9개 항목 개선 발표

딥시크가 공개한 내용에 따르면 V4-Flash-0731은 에이전트 평가 9개 항목에서 모두 V4-Flash Preview와 V4-Pro Preview를 웃돌았다. 회사는 구조와 크기를 바꾸지 않고 후속 학습으로 에이전트 성능을 높였다고 설명했다. 공개한 표에서 상승 폭이 가장 큰 DeepSWE는 7.3점에서 54.4점으로 올랐고, Terminal-Bench 2.1은 61.8점에서 82.7점으로 높아졌다.

DeepSeek V4-Flash-0731과 V4 Preview, GLM-5.2, Claude Opus 4.8의 에이전트 벤치마크 9종을 비교한 표
딥시크는 공개 Code Agent 평가에서 V4-Flash 계열 모델을 앞으로 공개할 DeepSeek Harness의 minimal modemax tier, top_p=0.95, temperature=1.0으로 실행해 수치를 산출했다고 밝혔다. DSBench 두 항목은 내부 평가셋이다. 이미지: DeepSeek [1], [3]
주요 에이전트 벤치마크
V4-Flash-0731과 프리뷰 모델, Claude Opus 4.8의 주요 에이전트 벤치마크 점수
평가FlashPrev.ProPrev.0731Opus4.8
Terminal-Bench 2.161.872.182.785.0
DeepSWE7.312.854.458.0
Toolathlon-Verified49.755.970.376.2
Agents' Last Exam15.816.525.225.7
공식 X 발표에서 주요 비교 수치를 옮겼다.출처: DeepSeek [1]

Artificial Analysis의 독립 평가에서도 지능 지수 v4.1이 이전 V4-Flash의 40점에서 50점으로 올랐다. 평가 하네스와 실행 조건이 다른 독립 결과는 DeepSeek가 공개한 수치와 별도로 봐야 한다.

입력 0.14달러, 출력 0.28달러 유지

가격과 컨텍스트 한도는 기존 V4-Flash와 같다. 캐시되지 않은 입력은 100만 토큰당 0.14달러, 캐시된 입력은 0.0028달러, 출력은 0.28달러다. 컨텍스트는 1,048,576토큰이며 최대 출력은 384,000토큰이다. 텍스트를 입출력하는 모델이며, 추론 수준은 low, high, max 세 단계로 조절할 수 있다.

V4-Flash-0731 주요 사양
DeepSeek V4-Flash-0731의 구조, 컨텍스트, 출력 한도와 API 가격
모델 IDdeepseek-v4-flash
구조284B MoE, 추론 시 13B 활성화
입출력텍스트 입력, 텍스트 출력
컨텍스트1,048,576토큰
최대 출력384,000토큰
100만 토큰당 가격캐시되지 않은 입력 $0.14, 캐시 입력 $0.0028, 출력 $0.28
구조와 가격, API 한도를 정리했다.출처: Hugging Face [4], DeepSeek API Docs [6], [7]

Artificial Analysis에서 V4-Flash-0731은 지능 지수 과제당 평균 0.027달러로 비교 모델 가운데 가장 낮은 비용을 기록했다. 그러나 평가 전체에서 생성한 출력 토큰은 약 2억 1천만 개로, 비교 집단 중앙값인 6천2백만 개의 세 배를 넘었다. 토큰 단가가 낮아도 긴 에이전트 작업의 총비용과 지연 시간은 실제 요청을 보내 확인해야 한다.

딥시크는 매일 오전 10시부터 오후 1시까지, 오후 3시부터 7시까지 API 가격을 두 배로 올리는 피크 요금을 곧 도입할 예정이다. 정확한 시행일은 별도로 발표한다.

Responses API와 Codex 지원

V4-Flash-0731은 OpenAI Responses API와 호환되는 요청 및 응답 형식을 기본 지원한다. 다만 상태를 저장하지 않으므로 previous_response_id, 응답 저장, 백그라운드 처리는 지원하지 않는다. 함수 호출과 서버 측 웹 검색, Codex용 apply_patch는 지원하지만, 파일 검색과 코드 실행기, MCP 같은 다른 기본 도구 요청은 무시한다. OpenAI Responses API의 모든 서버 기능을 제공하는 것은 아니다.

Codex 연동의 핵심 값은 base_urlhttps://api.deepseek.com/과 모델 ID deepseek-v4-flash다. 이는 핵심 값만 요약한 것으로, 공식 전체 설정에는 모델 제공자와 API 키 인증, model_catalog_json, wire_api = "responses"도 포함된다. 현재 Codex 연동은 V4-Flash만 지원하며 V4-Pro 지원은 8월 초로 예정됐다. 소비자용 앱과 웹에는 0731이 적용되지 않았다. 코딩 에이전트용 저가 API 선택지는 늘었지만, 새 가중치가 발표되지 않아 로컬 실행 모델의 선택지는 그대로다.

원문 출처