DeepSeek V4 Flash 0731 가중치 공개, Claude Sonnet 5에 근접한 모델을 로컬에서 실행

DeepSeek V4 Flash 0731 가중치 공개, Claude Sonnet 5에 근접한 모델을 로컬에서 실행이라는 제목을 배치한 44BITS NEWS 대표 이미지
공개 가중치 배포로 284B MoE 모델을 직접 내려받아 실행할 수 있게 됐다.

중국 인공지능 기업 딥시크(DeepSeek)가 7월 31일 DeepSeek V4-Flash-0731의 166.9GB 공식 가중치를 허깅페이스에 공개했다. API 공개 베타를 발표한 날 곧바로 가중치까지 배포했다. Artificial Analysis의 API 평가에서 Claude Sonnet 5에 근접한 성능을 보인 284B MoE 모델을 직접 내려받아 실행할 수 있게 된 것이 이번 공개의 핵심이다.

166.9GB 공식 가중치, MIT 라이선스로 공개

딥시크는 API 공개 베타를 발표한 7월 31일 허깅페이스에 별도 저장소를 열어 공식 가중치를 배포했다. 앞서 API로만 제공하던 모델을 수 시간 만에 직접 내려받아 실행할 수 있게 했다.

공식 Safetensors 가중치의 전체 용량은 166.9GB다. 전문가 가중치는 4비트 형식인 MXFP4로, 나머지 텐서는 FP8 또는 BF16으로 저장했다. 가중치에 따라 서로 다른 수치 형식을 쓴 혼합 정밀도 체크포인트이며 MIT 라이선스로 공개됐다.

Artificial Analysis의 인텔리전스 인덱스 v4.1에서 DeepSeek V4 Flash 0731의 max 설정은 Claude Sonnet 5의 Adaptive Reasoning, Max Effort 설정보다 3.42점 낮았다. 두 설정의 인덱스 점수는 아래 표와 같다. 평가 대상은 API로 제공된 모델이며 로컬 양자화본은 포함되지 않았다.

Artificial Analysis 인텔리전스 인덱스 v4.1
DeepSeek V4 Flash 0731과 Claude Sonnet 5의 인텔리전스 인덱스 점수
모델과 평가 설정인덱스 점수
Claude Sonnet 5, Adaptive Reasoning, Max Effort53.35
DeepSeek V4 Flash 0731 max49.93
2026년 8월 1일 기준이다.출처: Artificial Analysis [1], [2]

284B 모델이지만 토큰당 연산에는 약 13B 매개변수만 참여

V4-Flash-0731은 전체 284B 매개변수를 가진 전문가 혼합(MoE) 모델이다. 요청을 처리할 때 모든 전문가를 동시에 쓰는 대신, 라우터가 토큰마다 필요한 전문가를 고른다. 따라서 전체 규모는 284B이지만 토큰 하나를 처리할 때 계산하는 매개변수는 약 13B로 줄어든다.

줄어드는 것은 토큰당 연산량이지 모델 파일의 크기가 아니다. 토큰마다 선택되는 전문가가 달라 실행하려면 284B 전체 가중치를 저장하고 메모리에서 불러올 수 있어야 한다. 13B 모델을 내려받는 구조가 아니라, 284B 모델을 적재한 뒤 그중 일부만 매번 계산하는 구조다.

Unsloth는 이 모델이 양자화 인식 학습(QAT)을 거쳤다고 설명한다. 공식 설정에서는 전문가 가중치의 FP4 형식과 나머지 가중치의 FP8 또는 BF16 형식을 확인할 수 있다. 공개 체크포인트는 고정밀도 원본을 함께 보존한 가역 압축물이 아니므로, 형식만 FP16이나 BF16으로 넓혀도 양자화 이전 값은 복원되지 않는다. 파일과 메모리 사용량만 늘어날 뿐이다. 아래의 추가 손실 없음도 공식 혼합 정밀도 체크포인트의 정보를 변환 과정에서 더 줄이지 않았다는 뜻이다.

Unsloth, 최소 필요 메모리 92GB인 GGUF 변환본 공개

Unsloth는 딥시크 공식 체크포인트를 GGUF로 변환해 1비트부터 8비트까지 여러 용량으로 공개했다. 딥시크의 공식 배포본이 아니라 제3자인 Unsloth가 공식 체크포인트를 변환한 파일이다. llama.cpp와 Unsloth Studio에서 실행하는 방법과 채팅 템플릿도 제공해 별도 변환 없이 장비에 맞는 파일을 고를 수 있다. 이처럼 모델 파일과 실행 방법을 한데 제공하는 점이 Unsloth 변환본을 로컬 환경에서 선택하기 쉬운 이유다.

Unsloth가 기본 선택으로 권하는 UD-IQ3_XXS는 파일 약 104GB, 실행에 필요한 메모리는 110GB 이상이다. 따라서 권장 3비트는 딥시크의 공식 권장이 아니라 Unsloth가 제시한 양자화본을 뜻한다. 가장 작은 UD-IQ1_S도 파일 82.5GB와 메모리 92GB가 필요하다.

Unsloth GGUF 크기와 필요 메모리
DeepSeek V4 Flash 0731 Unsloth GGUF의 대표 형식별 파일 크기와 필요 메모리
형식파일 크기필요 메모리설명
UD-IQ1_S82.5GB92GB 이상가장 작은 Unsloth 변환본
UD-IQ3_XXS104.2GB110GB 이상Unsloth가 안내한 기본 선택
UD-Q4_K_XL155.1GB162GB 이상MXFP4 전문가 가중치를 그대로 유지
UD-Q8_K_XL161.9GB169GB 이상공식 체크포인트에서 정밀도 추가 축소 없음
파일 크기는 Hugging Face 저장소에 나뉘어 올라온 GGUF 파일을 합산한 값이다. 필요 메모리는 모델을 메모리에 올리고 기본 실행에 필요한 여유 공간까지 포함한 Unsloth의 안내값이다. 모두 제3자인 Unsloth가 만든 변환본이다.출처: Unsloth [6], [5]

표의 필요 메모리는 짧은 입력으로 기본 실행할 때 필요한 기준이다. 최대 100만 토큰의 컨텍스트를 모두 사용하거나 여러 요청을 동시에 처리하려면 KV 캐시와 실행 버퍼가 더 필요하다. UD-Q8_K_XL은 공식 MXFP4 전문가를 그대로 담고 FP8 값을 BF16으로 옮길 때 추가 반올림이 생기지 않도록 변환한 형식이다. Unsloth가 추가 손실이 없다고 설명하는 기준은 공개된 공식 혼합 정밀도 체크포인트이며, 공개되지 않은 FP16 가중치를 복원했다는 뜻은 아니다.

M3 Ultra 한 대와 DGX Spark 두 대에서도 실행

언어 모델의 실행 속도는 크게 두 구간으로 나뉜다. 프리필(prefill)은 답변을 만들기 전에 입력한 문서나 대화 기록을 읽는 과정이고, 디코드(decode)는 첫 토큰 이후 답변을 이어서 생성하는 과정이다. 코드베이스나 긴 문서를 입력할수록 프리필 속도가 첫 응답을 기다리는 시간에 큰 영향을 준다.

M3 Ultra는 최대 512GB 통합 메모리를 지원한다. oMLX 커뮤니티 벤치마크에서는 256GB M3 Ultra가 oMLX에서 4비트로 표기한 DeepSeek-V4-Flash-0731-MXFP4를 16,384토큰 컨텍스트에서 실행해 프리필 352.9 tok/s, 디코드 26.0 tok/s, 최대 메모리 147.1GB를 기록했다. 44bits의 M3 Ultra 측정에서는 Unsloth UD-Q4_K_XLUD-Q8_K_XL의 디코드 속도가 대화 기록이 없을 때 각각 24.2 tok/s와 20.0 tok/s였다. 컨텍스트가 32,768토큰으로 늘면 두 변환본의 디코드 속도는 모두 10.5 tok/s로 낮아졌고, UD-Q4_K_XL의 프리필은 115.9 tok/s였다. 두 결과 모두 단일 M3 Ultra에서 답변을 생성할 수 있었고, 컨텍스트가 길어질수록 속도가 낮아지는 양상을 보였다.

DGX Spark는 한 대당 128GB 통합 시스템 메모리를 제공한다. DGX Spark 두 대에서 공식 FP4와 FP8 혼합 가중치를 실행한 커뮤니티 측정은 vLLM, FP8 KV 캐시, DSpark 7토큰 추측 디코딩을 사용했다. 32,766토큰 입력에서 실효 프리필 1,324 tok/s와 디코드 36.5 tok/s, 65,535토큰 입력에서도 각각 1,107 tok/s와 31.2 tok/s를 기록했다. 이 구성에서는 65K가 넘는 입력에서도 초당 31.2토큰으로 답변을 생성한 셈이다. M3 Ultra와 DGX Spark 측정은 가중치 형식과 런타임, 프리필 계산 방식이 각각 다르다. NVIDIA의 별도 플레이북은 두 장비를 200GbE로 직접 연결해 분산 실행하지만, 이 커뮤니티 측정이 사용한 연결 방식은 게시물에 나오지 않는다.

Artificial Analysis의 API 평가에서 DeepSeek V4 Flash 0731은 Claude Sonnet 5에 근접했다. 딥시크의 공식 혼합 정밀도 가중치와 Unsloth의 GGUF 변환본을 사용하면 API를 거치지 않고 모델을 직접 실행할 수 있다. M3 Ultra 한 대와 DGX Spark 두 대에서도 실제로 동작했다. 공개 가중치를 장비와 용도에 맞춰 직접 운영할 수 있게 됐다는 점이 이번 공개의 의미다.

원문 출처