중국 AI 기업 문샷AI(Moonshot AI)가 한국시간 7월 28일 오전 0시 14분 Kimi K3 공개 가중치(open-weight)와 기술보고서를 공개했다. 허깅페이스에는 모델 카드와 라이선스, 설정 코드뿐 아니라 실제 가중치 파일 96개가 올라왔다. 서비스로만 쓸 수 있었던 K3를 이제 누구나 직접 내려받아 검토하고 운영할 수 있다.[1][2]
Fable 5와 비교되는 첫 3조 파라미터급 공개 모델
문샷AI는 Kimi K3를 세계 최초의 3조 파라미터급 공개 가중치 모델로 소개했다. 중요한 점은 크기보다 비교 대상이다. 공식 모델 카드는 K3를 Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8과 같은 표에 놓았다. 지식, 코딩, 웹 탐색과 컴퓨터 작업 평가에서 K3는 이들 폐쇄형 모델과 비슷한 범위에 들어왔다.[2]
대표 평가 3개
GPT-5.6 Sol 88.8
Fable 5 86.6
GPT-5.6 Sol 90.4
Arena에서도 공개 가중치 1위
가중치 공개 직후 나온 Arena.ai 평가에서도 K3는 공개 가중치 모델 가운데 선두에 올랐다. 한국시간 7월 28일 오전 3시 9분 공개된 Agent Arena 결과에서 Kimi K3 (Max)는 순 개선(net improvement) 9.75% ±1.17%로 전체 3위, 공개 가중치 1위를 기록했다. K3가 참여한 1만 9,240개 세션을 반영한 값으로, 공개 가중치 2위 GLM-5.2 (Max)의 7.12%보다 높았지만 전체 1위 Fable 5 (High)의 12.60%에는 못 미쳤다.[11][12]
Agent Arena는 일대일 선호 투표 대신 실제 사용자 작업에서 확인한 성공, 칭찬과 불만, 수정 지시 대응, Bash 오류 회복, 존재하지 않는 도구 호출 등 다섯 신호를 인과 추적 방식으로 합친다. 따라서 9.75%는 정답률이나 승률이 아니라 Arena의 에이전트 환경에서 주 모델을 K3로 선택했을 때 결과가 평균 모델보다 얼마나 개선됐는지를 추정한 값이다. Arena는 K3가 다섯 신호 모두 공개 가중치 모델 중 1위였으며, 확인된 성공 항목에서는 전체 1위였다고 밝혔다.[13][11]
같은 시점 Kimi K3는 Frontend Code(WebDev)에서 예비 점수 1,682점으로 전체 2위이자 공개 가중치 1위, Text Arena에서는 게시물 집계 기준 1,485점으로 공개 가중치 1위를 기록했다. 이 리더보드들은 투표와 세션이 추가되면서 점수와 순위가 바뀌는 라이브 평가다. 또한 Arena가 제공한 Kimi K3 (Max)와 자체 도구 환경의 결과이므로, 내려받은 가중치를 별도 인프라에서 실행해 같은 성능을 재현했다는 뜻은 아니다.[14][15]
공개 가중치 모델이 단일 평가에서만 폐쇄형 모델에 접근한 것이 아니라 코딩과 에이전트 작업 전반에서 같은 비교표에 들어왔다는 점이 이번 공개의 의미다. 다만 K3가 모든 평가에서 가장 높은 것은 아니며, Fable 5와 GPT-5.6 Sol을 대체한다고 단정할 단계도 아니다.
96개 샤드, 약 1.56TB, 총 2.8조 파라미터
Kimi K3 가중치는 Safetensors 파일 96개로 나뉘며 합계는 약 1.56TB다. 모델 전체는 2.8조 파라미터지만 질문을 처리할 때는 896개 전문가 가운데 16개와 공유 전문가 2개를 골라 약 1,040억 파라미터를 사용한다. 모든 파라미터를 매번 계산하지 않는 전문가 혼합 구조로 연산량을 줄인 것이다.[2][3]
최대 입력 길이는 100만 토큰이며 텍스트와 이미지를 함께 처리한다. 가중치는 주로 MXFP4 형식으로 압축했지만 파일 자체가 1.56TB여서 개인용 GPU나 일반적인 워크스테이션에 올릴 수 있는 모델은 아니다. 공개됐다는 말은 누구나 파일을 받을 수 있다는 뜻이지, 노트북에서 바로 실행할 수 있다는 뜻은 아니다.
vLLM 레시피는 가중치와 실행 프로그램을 올리는 데 필요한 GPU 메모리를 최소 약 1.68TB로 추정한다. H200 8개가 들어간 서버 한 대의 메모리는 약 1.13TB라 모델을 담지 못한다. vLLM이 실제로 검증한 기본 예시는 서버 두 대에 H200 16개를 나눠 배치한 구성으로, GPU 메모리를 합치면 약 2.26TB다. 80GB H100을 쓴다면 용량만 놓고도 21개 이상이 필요하므로 8개 단위 서버 세 대, 약 24개 수준으로 봐야 한다.[5]
이는 모델을 불러오는 데 필요한 대략적인 하한이다. 긴 입력을 처리하거나 여러 요청을 동시에 받으면 KV 캐시가 추가로 필요해 전체 GPU 메모리가 약 2.5TB에서 3.4TB까지 늘어날 수 있다. 여러 서버를 묶을 때는 인피니밴드 같은 고속 네트워크도 필요하다. 실제 규모는 입력 길이와 동시 요청 수, 캐시를 CPU 메모리로 옮기는지에 따라 달라진다.[5]
상업 이용은 허용하지만 대형 모델 서비스에는 별도 조건이 있다
Kimi K3 라이선스는 가중치 사용과 수정, 재배포, 파인튜닝과 상업 이용을 허용한다. 다만 모델 추론이나 파인튜닝 자체를 제3자에게 서비스하는 회사와 계열사의 최근 12개월 합산 매출이 2천만 달러를 넘으면 문샷AI와 별도 계약을 맺어야 한다. 일반적인 사내 사용이나 다른 사업자가 호스팅하는 API를 연결하는 제품은 이 조건에서 제외된다.[4]
모델을 넣은 상용 제품이 월간 활성 이용자 1억 명 또는 월매출 2천만 달러를 넘으면 이용자 화면에 Kimi K3 사용 사실을 표시해야 한다. 개인 개발자와 일반 기업의 내부 활용을 막는 라이선스는 아니지만, 대규모 모델 서비스 사업자는 배포 전에 원문 조건을 확인할 필요가 있다.
가중치와 함께 공개한 세 개의 GitHub 프로젝트
문샷AI는 K3를 만드는 데 사용한 구성요소 세 개도 MIT 라이선스로 공개했다. 이 프로젝트들은 K3 가중치의 일부가 아니다. FlashKDA는 모델을 빠르게 실행하는 연산 코드, AgentENV는 에이전트를 학습시키는 실행 환경, MoonEP는 여러 GPU에 전문가를 나누는 통신 계층을 맡는다.[8][9][10]
FlashKDA
Kimi Delta Attention 연산을 GPU에서 빠르게 실행하는 커널이다. 문샷AI는 H20에서 긴 입력 처리 속도가 기존 구현보다 1.72배에서 2.22배 빨랐다고 밝혔다.
GitHub 저장소AgentENV
K3의 에이전트 강화학습에 사용한 분산 실행 환경이다. 격리된 마이크로VM을 빠르게 시작하고 멈추며 여러 학습 작업에 나눠 쓸 수 있다.
GitHub 저장소MoonEP
전문가 혼합 모델을 여러 GPU에 나눠 실행할 때 통신과 작업량을 조절한다. 특정 전문가로 요청이 몰려 한 GPU만 느려지는 문제를 줄이는 역할이다.
공개 가중치의 의미는 선택권에 있다
Kimi K3 공개의 의미는 개인용 컴퓨터에서 곧바로 실행할 수 있다는 데 있지 않다. 상용 최상위 모델과 비교되는 3조 파라미터급 모델의 가중치가 실제로 공개되면서 누구나 한 회사의 API에만 의존하지 않고 모델을 검토하고 수정하며 자체 환경에 맞춰 배포할 수 있게 됐다.
1.56TB 가중치를 직접 운영하는 일은 여전히 어렵다. vLLM은 다중 GPU 실행 레시피를 공개했지만 MLX-LM 지원은 아직 초안 단계다. 결국 이번 공개가 실용적인 선택지로 자리 잡을지는 추론 엔진과 운영 도구가 얼마나 빠르게 뒤따르느냐에 달렸다.[5][7]
Kimi K3의 서비스 출시와 API 가격은 앞선 기사에서 다뤘다.