H200 8장에 안 들어간다: 2.8조 파라미터 오픈 모델 Kimi K3
요약
Kimi K3는 문샷AI가 2026년 7월 16일 공개한 2조 8,000억(2.8T) 파라미터 오픈웨이트 MoE 모델이다. 전문가 896개 중 16개만 활성화하고 컨텍스트 100만 토큰과 이미지 입력을 지원한다.
가중치는 MXFP4(4bit)로 학습돼 크기가 1.4~1.6TB대로 추산된다. H200 8장 서버(HBM 총 1,128GB)에는 가중치조차 들어가지 않고 문샷은 가속기 64장 이상의 슈퍼노드 배포를 권장했다.
성능은 문샷 자체 평가 기준으로 Claude Fable 5와 GPT 5.6 Sol에 못 미치고 그 외 모델에는 앞선다. API 가격은 100만 토큰당 입력 3달러, 출력 15달러다.
중국 문샷AI(Moonshot AI)가 지난 16일 밤(현지 시간) 파라미터 2조 8,000억개 규모 언어 모델 Kimi K3를 공개했다. 가중치가 공개되면 오픈웨이트 모델 가운데 가장 큰 모델이 된다. 이전 최대였던 DeepSeek V4 Pro(약 1조 6,000억 개)의 1.75배, GLM 5(7,440억 개)의 3.8배 규모다. 챗 서비스와 API는 발표 당일 열렸고 가중치 파일은 7월 27일까지 공개된다.
Spec
K3는 혼합 전문가(MoE, Mixture of Experts) 구조다. 2.8T 파라미터를 전문가 896개에 나눠 담고 토큰마다 그중 16개만 활성화한다. 문샷이 Stable LatentMoE라 부르는 구성이다. 활성 비율로 단순 환산하면 토큰당 계산에 참여하는 파라미터는 50B 안팎이다. 공유 전문가와 어텐션 몫이 빠진 근사치라 공식 활성 파라미터 수는 곧 나올 기술 보고서를 봐야 한다. 어텐션에는 자체 개발한 하이브리드 선형 어텐션 KDA(Kimi Delta Attention)를, 층 사이 정보 전달에는 잔차 연결을 대체하는 AttnRes(Attention Residuals)를 썼다. 문샷은 이 조합으로 전작 K2 대비 스케일링 효율이 약 2.5배가 됐다고 설명했다.
컨텍스트 윈도는 100만 토큰이다. 이미지는 별도 비전 모듈 없이 같은 모델이 직접 읽는다. 추론 모드는 기본으로 켜져 있고 출시 시점에는 최대 강도만 지원한다.
서빙 관점에서는 가중치 형식이 먼저 눈에 들어온다. SFT 단계부터 양자화 인지 학습(QAT)을 적용해 가중치는 MXFP4(4bit), 활성값은 MXFP8로 만들었다. 4bit가 사후 압축본이 아니라 기본 배포 형식이라는 뜻이다. 추론 스택 쪽 준비도 있다. 문샷은 KDA가 기존 prefix 캐시와 충돌하는 문제를 푸는 구현을 vLLM 커뮤니티에 기여했고 가중치와 함께 공개할 예정이다.
항목 | 내용 |
|---|---|
총 파라미터 | 2.8T (MoE, 전문가 896개 중 16개 활성) |
컨텍스트 | 100만 토큰 |
입력 | 텍스트·이미지(네이티브 비전) |
가중치 형식 | MXFP4 가중치 + MXFP8 활성값 (SFT 단계부터 QAT) |
가중치 공개 | 2026년 7월 27일까지, 기술 보고서 동시 공개 예정 |
API 가격 | 입력 $3.00 / 캐시 적중 입력 $0.30 / 출력 $15.00 (100만 토큰당) |
권장 배포 | 가속기 64장 이상 슈퍼노드 |
성능과 가격
문샷 자체 평가에서 K3는 Claude Fable 5와 GPT 5.6 Sol에 전반적으로 뒤지고 그 외 테스트한 모델에는 일관되게 앞섰다. 코딩·에이전트 계열 벤치마크 일부에서는 두 모델과 대등하거나 앞선 수치도 제시했다. 독립 평가 기관 Artificial Analysis 지능 지수에서는 57점으로 전체 3위에 올랐다. AA 집계에서 K3보다 앞선 모델은 Fable 5와 GPT 5.6 Sol뿐이며 Opus 4.8, GPT 5.5와는 대등한 수준이다.
문샷은 발표문에서 한계 세 가지도 짚었다. 생각 이력을 통째로 되돌려주지 않는 에이전트 하네스에서 생성이 불안정해진다는 점, 지시가 모호할 때 사용자 대신 결정해 버리는 경향, 그리고 Fable 5·GPT 5.6 Sol 대비 사용 경험 격차다. (벤치마크 표 옆에 자기 약점을 나란히 적은 출시문은 흔치 않다.)
API 가격은 100만 토큰당 캐시 적중 입력 0.30달러, 미적중 입력 3.00달러, 출력 15.00달러다. 프리필과 디코드를 분리한 자체 서빙 시스템 Mooncake 위에서 코딩 워크로드의 캐시 적중률이 90%를 넘는다는 게 회사 설명이다. 중국 오픈 모델 기준으로는 비싼 축이라는 평가가 나온다(Fortune).
발표가 전해진 17일 뉴욕 증시 개장 전 거래에서 마이크론 등 메모리 반도체주가 급락했고 무어 인사이트 앤 스트래티지의 패트릭 무어헤드 CEO는 CNBC에 "딥시크 사태와 비슷한 과잉 반응"이라고 평가했다.
서빙 단위가 서버에서 랙으로
오픈웨이트 모델의 실질 문턱은 라이선스가 아니라 GPU 메모리다. 1T급인 K2 계열은 INT4 가중치 파일이 594GB라 141GB짜리 H200 8장(총 1,128GB) 서버 한 대에서 서빙이 성립했다. K3는 그 선을 넘는다. MXFP4는 파라미터당 4비트니 2.8T면 가중치만 1.4TB다. 스케일 팩터까지 담기는 실제 파일은 이보다 커진다. 같은 4bit QAT인 K2의 실측 파일 크기를 파라미터 수에 비례해 늘리면 1.6TB 안팎이다.
이 숫자를 8-GPU 서버의 HBM 총량 옆에 놓으면 결론이 나온다. H200 8장은 1,128GB라 가중치조차 못 담는다. B200 8장은 총 1,440GB(DGX B200 기준)로 추산 하한을 간신히 담지만 KV 캐시와 활성값을 놓을 자리가 없다. 문샷도 이를 전제한다. 발표문에 "가속기 64개 이상으로 구성한 슈퍼노드 배포를 권장한다"고 적었다. 추론 효율이 대역폭 큰 통신 도메인에서 나온다는 이유다.
우리가 이번 발표에서 성능 표보다 눈여겨본 대목이 이 권장 사양 한 줄이다. 가속기 64장은 서버 몇 대를 케이블로 묶는 수준이 아니라 NVIDIA GB200 NVL72(GPU 72장) 같은 랙스케일 시스템의 영역이다. 이런 랙은 캐비닛 하나가 약 120kW를 쓰고(공개 스펙 기준) 수랭이 전제다. 프론티어급 오픈 모델의 도입 검토가 서버 견적에서 랙 설계로 넘어갔다는 뜻이다. 이제는 오픈웨이트 모델을 고르기 전에 전력 계약과 냉각 용량부터 정해야 한다.
필요한 모델이 1T급이면 계산이 다르다. K2 계열 594GB는 여전히 8-GPU 서버 한 대 영역이고 4bit 기준 750B급까지는 단일 서버 서빙이 성립한다. 정리하면 이렇다. 1T급 오픈 모델이 목표면 서버 한 대와 그 냉각을, 2.8T급 프론티어가 목표면 랙 단위 전력·냉각 설계를 먼저 계산해야 한다.
가중치와 기술 보고서는 7월 27일에 나온다.
Reference
Moonshot AI, Kimi K3 Tech Blog: Open Frontier Intelligence (2026.7)
SCMP, Moonshot AI unveils world's largest open-source AI model (2026.7)
Fortune, Moonshot's Kimi K3 pushes Chinese AI into Fable-level territory (2026.7)
CNBC, China's Moonshot AI unveils Kimi K3 that rivals OpenAI, Anthropic (2026.7)
뉴시스, 중국 문샷, 개방형 AI 키미 K3 출시 (2026.7)
Artificial Analysis, Kimi K3 achieves #3 in the Artificial Analysis Intelligence Index (2026.7)
Kimi Team, Kimi K2: Open Agentic Intelligence (기술 보고서, 2025)
Hugging Face, moonshotai/Kimi-K2-Thinking 모델 카드 (native INT4)
NVIDIA 파트너 스펙시트, DGX B200: 8x Blackwell, 1,440GB HBM3e
VentureBeat, China's Moonshot AI releases Kimi K3 (2026.7)