Kimi K3 là mô hình ngôn ngữ lớn (LLM) đa phương thức quy mô 2,8 nghìn tỷ (2.8T) tham số do Moonshot AI phát hành vào tháng 7/2026.
Đây là thực thể đầu tiên thuộc phân lớp 3T được cam kết mở mã nguồn (open weights), thiết lập ngưỡng mới về quy mô cho cộng đồng AI công khai. Dựa trên kiến trúc Mixture of Experts (MoE) thưa và các cải tiến về cơ chế Attention, Kimi K3 được tối ưu hóa để xử lý các luồng công việc tự trị (agentic) dài hơi, giải quyết bài toán suy luận phức tạp thay vì chỉ phản hồi các câu hỏi ngắn.
Hệ thống này thu hẹp khoảng cách hiệu suất với các mô hình đóng hàng đầu như Claude Fable 5 và GPT-5.6 Sol, dù vẫn xếp sau về chất lượng trình bày. Moonshot AI dự kiến công bố toàn bộ trọng số mô hình vào ngày 27/07/2026, cho phép triển khai cục bộ (on-premise) trên hạ tầng riêng. Với một kỹ sư hệ thống, K3 không chỉ là một cột mốc về tham số mà còn là bằng chứng cho việc tối ưu hóa thông lượng và phá vỡ các rào cản tính toán trong xử lý ngữ cảnh dài.

Kimi K3 là gì và có gì đáng chú ý?
Phát hành chính thức vào giữa tháng 7/2026 bởi Moonshot AI, Kimi K3 đại diện cho nỗ lực của các lab AI Trung Quốc trong việc duy trì ưu thế tại mặt trận mã nguồn mở. Việc xác nhận công bố trọng số vào ngày 27/07/2026 là tín hiệu quan trọng cho các doanh nghiệp muốn sở hữu trí tuệ cấp độ frontier mà không phụ thuộc vào API đóng của phương Tây.
Về thông số kỹ thuật, K3 hỗ trợ cửa sổ ngữ cảnh 1 triệu token (tương đương ~1.573 trang A4) và hỗ trợ đa phương thức nguyên bản. So với dòng K2.6 (1T tham số), bước nhảy vọt lên 2.8T vừa tăng dung lượng lưu trữ kiến thức, vừa giúp duy trì sự tập trung (attention focus) tốt hơn trong các chuỗi suy luận dài. Kimi K3 hiện có sẵn trên API/Web và đang được căn chỉnh kỹ thuật với các maintainer mã nguồn mở để chuẩn bị cho đợt rollout toàn diện.
Kiến trúc bên trong mô hình mở lớn nhất thế giới
Kimi K3 sử dụng cấu trúc Mixture of Experts cực thưa, kích hoạt 16 trong số 896 chuyên gia (experts). Để đạt được hiệu quả này, Moonshot AI triển khai khung Stable LatentMoE, giúp mô hình đạt hiệu suất tỷ lệ (scaling efficiency) gấp 2,5 lần so với thế hệ K2.6, cho phép chuyển hóa tài nguyên tính toán thành trí thông minh một cách tối ưu.

Hai công nghệ lõi củng cố khả năng xử lý của K3 bao gồm:
- Kimi Delta Attention (KDA): Cải tiến kiến trúc attention giúp tăng tốc độ giải mã (decoding) gấp 6,3 lần cho ngữ cảnh dài, triệt tiêu hiện tượng nghẽn cổ chai (bottleneck) khi xử lý các kho mã nguồn khổng lồ.
- Attention Residuals (AttnRes): Tăng hiệu suất huấn luyện thêm 25% với chi phí tính toán tăng thêm dưới 2%, giúp cải thiện luồng thông tin qua độ sâu của mô hình.
Bảng so sánh cấu trúc các mô hình lớn:
| Thông số | Kimi K3 | DeepSeek V4 Pro | GLM-5 |
|---|---|---|---|
| Tổng tham số | 2,8T | 1,6T | ~1T+ |
| Cơ chế hoạt động | Stable LatentMoE (16/896) | MoE | MoE |
| Ngữ cảnh (Context) | 1M Tokens | 128k - 512k | 128k - 256k |
| Công nghệ lõi | KDA / AttnRes | MLA | N/A |
K3 mạnh đến đâu? Điểm chuẩn và so sánh
Dựa trên dữ liệu từ Artificial Analysis, Kimi K3 đã xác lập vị thế trong nhóm dẫn đầu toàn cầu:

- Intelligence Index: Với 57 điểm, K3 xếp thứ 4 toàn cầu, sau Claude Fable 5 (60), GPT-5.6 Sol (59) và suýt soát Claude Opus 4.8 (56). Mặc dù chất lượng phân tích (analytical quality) ngang ngửa Fable 5, nhưng K3 vẫn thua Sol về khả năng trình bày (presentation quality).
- Hiệu suất agent: Trên bảng xếp hạng Arena.ai, K3 đứng đầu về Frontend Coding, vượt qua cả Fable 5. Elo cho các tác vụ tri thức dài (long-horizon) đạt 1547, một bước nhảy vọt so với K2.6.
- Phân tích rủi ro hệ thống: K3 rất "lắm lời" (verbose) với lượng output token trung bình 130M (so với 63M của các mô hình khác). Tuy nhiên, tỷ lệ ảo giác (hallucination) đã tăng lên mức 51% (so với 39% ở bản cũ). Từ góc độ kiến trúc, điều này cảnh báo chúng ta không nên sử dụng K3 cho các tác vụ zero-shot đòi hỏi sự chính xác tuyệt đối mà không có quy trình xác thực (verification loops).
Khả năng agent: từ thiết kế chip đến nén nghiên cứu
Khả năng tự trị của Kimi K3 được minh chứng qua 3 trường hợp điển hình:
- Thiết kế Chip: Trong 48 giờ, K3 tự thiết kế con chip diện tích 4mm² trên thư viện Nangate 45nm. Chip gồm 1,46 triệu standard cells, 0,277 MB SRAM, đạt xung nhịp 100 MHz và thông lượng giải mã 8.700 token/s trong môi trường mô phỏng.
- Tối ưu GPU Kernel: K3 tự viết lại thuật toán AttnRes và KDA, giảm thời gian xử lý từ 283,6ms xuống còn 114,4ms, tốc độ tối ưu hóa nhanh hơn Fable 5 trên mỗi lượt lặp.
- Nghiên cứu khoa học: Tái lập các quan hệ phổ quát I-Love-Q trong vật lý thiên văn chỉ trong 2 giờ (con người mất 2 tuần). Hệ thống xử lý hơn 20 bài báo, thực thi 3.000+ dòng code Python và tạo dashboard HTML tương tác.

Cơ chế "Vision in the Loop" cho phép K3 quan sát screenshot để sửa lỗi trực tiếp trong quá trình làm game hoặc thiết kế UI mà không cần can thiệp thủ công.
Giá cả và cách tiếp cận: hồi kết của "AI Trung Quốc giá rẻ"?
Bảng giá API của Kimi K3 phản ánh định vị cao cấp: $3/triệu token input và $15/triệu token output.

Phân tích kinh tế: Mức giá này ngang bằng Claude Sonnet 5 nhưng đắt gấp nhiều lần so với DeepSeek V4 Pro hay GLM-5.2. Điểm đáng chú ý nhất là mức giá Cache Hit ($0,30/1M token) — giảm 90% cho các tiền tố dài. Đây là chiến lược của Moonshot AI nhằm khuyến khích xây dựng các agent phức tạp dựa trên kho ngữ cảnh có sẵn.
Triển khai cục bộ (Local hosting): Để chạy bản 4-bit của mô hình 2.8T này, bạn sẽ đối mặt với chi phí hạ tầng khổng lồ:
- Yêu cầu bộ nhớ: ~1,4TB VRAM để nạp mô hình (chưa tính KV cache).
- Cấu hình đề xuất: 2 node AMD Instinct MI300X (tổng 16 GPU, ~3TB VRAM).
- Chi phí: Khoảng $500.000 - $600.000, tiêu thụ điện năng liên tục ~20kW.
Khoảnh khắc DeepSeek thứ hai? Cuộc đua Mỹ – Trung
Sự ra đời của K3 được giới chuyên gia ví như "khoảnh khắc DeepSeek thứ hai", gây áp lực lớn lên các lab AI Mỹ. David Sacks nhận định Trung Quốc hiện chỉ chậm hơn phương Tây khoảng 6 ngày về mặt công nghệ phát hành. Tin tức về K3 kết hợp với bài phát biểu của Tập Cận Bình tại WAIC đã khiến chỉ số Nasdaq giảm 1% và cổ phiếu Nvidia bị bán tháo.
Trong khi một số chuyên gia như Dean Ball lo ngại về rủi ro an ninh và "backdoor" trong các mô hình mã nguồn mở từ Trung Quốc, nhiều người lại cho rằng đây là cú hích lành mạnh buộc các lab Mỹ phải bỏ bớt các rào cản an toàn quá mức (safety guardrails) đang kìm hãm năng lực thực tế của mô hình.
Khi nào Kimi K3 là lựa chọn đúng?
Kimi K3 không phải là công cụ tối ưu cho các hội thoại thông thường do độ trễ (62 tokens/s) và chi phí cao. Tuy nhiên, bạn nên triển khai K3 khi:
- Cần phân tích và tái cấu trúc các kho mã nguồn khổng lồ hoặc dự án phần mềm kéo dài nhiều bước.
- Xây dựng các agent tự trị phức tạp yêu cầu khả năng sử dụng công cụ terminal và quan sát thị giác (Vision in the Loop).
- Doanh nghiệp yêu cầu một mô hình mạnh ngang tầm Fable 5 nhưng cần quyền kiểm soát hoàn toàn trên hạ tầng on-premise để bảo mật dữ liệu sau khi Moonshot mở mã nguồn vào cuối tháng 7.
Tài liệu tham khảo
- Kimi K3 Tech Blog: The Open Frontier Intelligence — Moonshot AI
- China's Moonshot AI releases Kimi K3, the largest open-source model ever — VentureBeat
- Kimi K3, and what we can still learn from the pelican benchmark — Simon Willison
- Kimi K3 — Intelligence, Performance & Price Analysis — Artificial Analysis
- China's Moonshot AI unveils Kimi K3 that rivals OpenAI, Anthropic — CNBC
- Kimi: Threat or menace? — TechCrunch
- Kimi's open model K3 nears GPT-5.6 Sol and Fable 5 — The Decoder
- Kimi K3 beats Claude Fable and GPT 5.6 Sol in arena.ai — r/LocalLLaMA