중국 AI 기업 문샷AI(Moonshot AI)가 Kimi K3 오픈 가중치를 공개한 날 관리형 추론 지원이 빠르게 늘었다. 현재 공식 모델 페이지나 지원 발표를 확인할 수 있는 서드파티 서비스는 14곳이다. Fireworks, Modal, Baseten, Nebius Token Factory, Together AI, DigitalOcean뿐 아니라 GMI Cloud, SiliconFlow, Ollama Cloud, Venice, Applied Compute, Runpod, Telnyx, Parasail도 K3 지원을 공개했다.[15]
K3의 구조와 성능 평가는 Kimi K3 공개 기사에서, 공개 가중치와 직접 운영 조건은 Kimi K3 공개 가중치 기사에서 다뤘다.
현재 지원 서비스 14곳
문샷AI는 안정적인 생태계 출시를 위해 추론 파트너와 오픈소스 유지관리자들과 기술 세부를 조율하고 있다고 밝혔고, Together AI는 자신을 문샷AI K3의 출시 당일 파트너(Day 0 launch partner)라고 명시했다. 이후 공식 발표와 모델 페이지를 추가로 확인한 결과 지원 서비스는 14곳으로 늘었다.[14][21]
| 서비스 | 제공 방식 | 공개 요금 |
|---|---|---|
| Applied Compute[33] | 문의형 학습 및 추론 플랫폼 | K3 전용 요금 미공개 |
| Baseten[7] | Model APIs, Dedicated Inference | $3 / $0.30 / $15 |
| DigitalOcean[18][19] | 서버리스 API, kimi-k3 | $3 / $0.60 / $15 |
| Fireworks[1] | 서버리스, On-demand, accounts/fireworks/models/kimi-k3 | $3 / $0.30 / $15 |
| GMI Cloud[25][26] | API 키, 구독 플랜 | 플랜별 사용량 포함 |
| Modal[5] | Shared API, Auto Endpoint | $3 / $0.30 / $15 |
| Nebius Token Factory[9] | Shared API, Dedicated Endpoint | $3 / 미공개 / $15 |
| Ollama Cloud[29][30] | 클라우드, kimi-k3:cloud | $3 / $0.30 / $15, Pro 또는 Max 필요 |
| Parasail[10][11] | Elastic, Dedicated, 접근 신청 | $3 / $0.30 / $15 |
| Runpod[34] | OpenAI 호환 API, kimi-k3 | K3 전용 요금 미공개 |
| SiliconFlow[27][28] | 서버리스, moonshotai/Kimi-K3 | $3 / $0.30 / $15 |
| Telnyx[35][36] | OpenAI 호환 Telnyx Inference | K3 전용 요금 미공개 |
| Together AI[16][17] | 서버리스, 전용, moonshotai/Kimi-K3 | $3 / $0.30 / $15 |
| Venice[31][32] | 비공개 채팅, API, kimi-k3 | $4.6875 / $0.46875 / $23.4375 |
요금은 입력, 캐시 입력, 출력 순서로 100만 토큰당 달러 가격을 적었다. ‘미공개’는 K3 전용 공개 가격을 확인하지 못했다는 뜻이다. Applied Compute와 Parasail은 문의 또는 접근 신청이 필요하고, Ollama Cloud는 Pro나 Max 구독과 추가 사용 크레딧이 필요하다. wafer는 K3 Fast 엔드포인트를 이번 주 후반에 열겠다고 예고했으므로 현재 14곳에는 포함하지 않았다.[12]
OpenRouter와 Hugging Face는 별도 접근 경로
OpenRouter는 추론 호스팅 업체가 아니라 여러 공급자를 연결하는 라우터다. moonshotai/kimi-k3라는 공통 모델 ID 아래 문샷AI, Baseten, DigitalOcean, Fireworks, Together AI, Nebius의 6개 공급자를 연결한다. Fireworks가 표준과 Fast 두 경로를 제공해 엔드포인트 변형은 7개다. 기본 표시 가격은 입력 100만 토큰당 3달러, 출력 15달러이며 Fireworks Fast는 4.50달러와 22.50달러다.[20] Hugging Face 모델 페이지에서도 Together AI를 통해 K3를 호출할 수 있다. 두 경로는 기존 공급자를 연결하므로 14개 서비스 수에는 더하지 않았다.[13]
Fireworks API 연결 예시
Fireworks의 OpenAI 호환 API에서는 모델 ID를 accounts/fireworks/models/kimi-k3로 지정해 K3를 호출할 수 있다. 간단한 PoC는 다음과 같다.[3]
curl https://api.fireworks.ai/inference/v1/chat/completions \
-H "Authorization: Bearer $FIREWORKS_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"accounts/fireworks/models/kimi-k3","messages":[{"role":"user","content":"안녕하세요"}]}'
K3 사례는 오픈 가중치 공개와 관리형 API 출시가 사전 조율을 통해 함께 진행되는 추론 생태계를 보여준다. 공개 당일 선택지는 14개 서드파티 서비스로 늘었고, 개발자는 각 공급자의 API를 직접 호출하거나 OpenRouter와 Hugging Face를 통해 기존 공급자에 접근할 수 있다.