Cách sử dụng Kimi K3: Mô hình trọng số mở 2.8T của Moonshot AI
Mua gói Thành viên QuanTriMang Pro để trải nghiệm website không quảng cáo và sử dụng các tiện ích AI trên QuanTriMang.
Kimi K3 của Moonshot AI là mô hình trọng số mở với 2,8 nghìn tỷ tham số, được xây dựng dựa trên kiến trúc Mixture-of-Experts. Mô hình này chỉ kích hoạt một phần nhỏ tham số cho mỗi token, giúp giảm chi phí suy luận mà vẫn mang lại hiệu suất mạnh mẽ trong các tác vụ lập trình và agentic.
K3 kết hợp các khả năng tiệm cận trình độ tiên tiến nhất, trọng số mở và mức giá API thấp hơn, tạo nên một giải pháp thay thế hấp dẫn cho các mô hình độc quyền. Trong bài viết này, chúng ta sẽ tìm hiểu cơ chế hoạt động của K3 và khám phá hai cách đơn giản để sử dụng mô hình này: Thông qua ứng dụng Kimi hoặc Fireworks AI API.
Mục lục bài viết
Điều gì tạo nên sự khác biệt của K3?
| Thông số kỹ thuật | Chi tiết |
|---|---|
| Tổng tham số | 2,8 nghìn tỷ |
| Số lượng expert hoạt động trên mỗi token | 16 trong số 896 (~1,8% tổng số expert) |
| Cửa sổ ngữ cảnh | 1,048,576 token (1M) |
| Phương thức | Văn bản gốc + hình ảnh |
| Giấy phép | Trọng số mở, mô hình đầu tiên thuộc phân khúc 3T |
Có hai điểm đáng chú ý trong kiến trúc của mô hình này:
- Kimi Delta Attention (KDA): Một kỹ thuật attention tuyến tính lai, được tạo ra để biến việc xử lý cửa sổ ngữ cảnh 1 triệu token thành khả thi thay vì tốn kém tài nguyên theo cấp số nhân (bình phương).
- Attention Residuals: Một giải pháp thay thế hoàn toàn cho các kết nối tắt (residual connections) tiêu chuẩn; Moonshot khẳng định rằng cơ chế này mang lại kết quả ổn định hơn khi quy mô mô hình tăng lên.
K3 sử dụng kiến trúc "Mixture-of-Experts'', chỉ kích hoạt một phần nhỏ tham số cho mỗi token. Điều này giúp mô hình sở hữu số lượng tham số khổng lồ nhưng vẫn duy trì hiệu suất suy luận tương đối cao so với các mô hình có quy mô hàng nghìn tỷ tham số khác. Các kết quả đánh giá ban đầu cho thấy K3 có khả năng cạnh tranh với những mô hình thương mại tiên tiến trong các tác vụ lập trình và tác vụ agentic, đặc biệt thể hiện hiệu suất mạnh mẽ trong việc xử lý code với ngữ cảnh dài và các bài kiểm tra lập trình blind test.
Cách truy cập K3 và chi phí sử dụng
Có hai cách để truy cập K3, mỗi cách phù hợp với một nhu cầu sử dụng khác nhau.
- Ứng dụng Kimi: Có sẵn trên iOS và Android thông qua Kimi.com, cũng như thông qua ứng dụng desktop Kimi Work. Bạn không cần tài khoản nhà phát triển và có thể bắt đầu với gói miễn phí (có giới hạn mức sử dụng). Đây là lựa chọn phù hợp nếu bạn chỉ muốn khám phá mô hình và trải nghiệm hiệu suất của nó.
- Truy cập qua API: Có sẵn thông qua nền tảng web của Kimi và Fireworks AI. Tùy chọn này áp dụng cơ chế tính phí theo số lượng token và phù hợp hơn với những nhà phát triển muốn tích hợp K3 vào ứng dụng hoặc quy trình làm việc của riêng họ.
Fireworks cung cấp 3 phương thức triển khai dịch vụ, tùy thuộc vào cách bạn muốn cân bằng giữa độ trễ và chi phí:
| Mức | Đầu vào không được lưu cache | Đầu vào được lưu cache | Đầu ra |
|---|---|---|---|
| Standard | $3.00 / 1 triệu token | $0.30 / 1 triệu token | $15.00 / 1 triệu token |
| Priority | $3.75 / 1 triệu token | $0.375 / 1 triệu token | $18.75 / 1 triệu token |
| Fast | $4.50 / 1 triệu token | $0.45 / 1 triệu token | $22.50 / 1 triệu token |
Chi phí cho dữ liệu đầu vào được lưu cache chỉ bằng khoảng 1/10 so với dữ liệu không được lưu cache. Do đó, khi triển khai ở quy mô lớn, việc tổ chức lại các câu lệnh (prompt) - bao gồm cả prompt hệ thống và ngữ cảnh có thể tái sử dụng - để tận dụng cơ chế lưu cache là rất đáng giá.
Đối với hầu hết các trường hợp sử dụng, mức Standard là điểm khởi đầu tốt nhất. Hãy chọn mức Fast khi độ trễ là yếu tố then chốt, hoặc mức Priority khi bạn cần độ tin cậy cao hơn.
Nếu bạn muốn tự host K3, Moonshot khuyến nghị sử dụng một supernode với ít nhất 64 accelerator để tạo ra môi trường tốc độ cao, nơi các expert có thể vận hành trong cùng một domain. Đây là yêu cầu về cơ sở hạ tầng lớn hơn nhiều so với việc tự triển khai các mô hình có quy mô tham số từ 700 tỷ đến 1,6 nghìn tỷ (700B–1.6T).
Giờ thì chúng ta đã nắm rõ thông tin về mô hình, hãy cùng thử nghiệm nó:
Nhiệm vụ 1: Tương tác trực tiếp với K3 (không cần API key)
Cách nhanh nhất để trải nghiệm K3 là thông qua giao diện người dùng của Kimi. Bạn có thể sử dụng ứng dụng Kimi trên iOS và Android, truy cập qua kimi.com hoặc dùng ứng dụng Kimi trên desktop cho công việc. Không cần tài khoản nhà phát triển hay thông tin thanh toán. Bạn chỉ cần mở giao diện trò chuyện và bắt đầu thử nghiệm.
Để có bài kiểm tra ý nghĩa hơn, đừng chỉ hỏi K3 những câu hỏi về kiến thức chung. Thay vào đó, hãy giao cho nó một dự án nhỏ hoặc yêu cầu nó xây dựng một hệ thống đơn giản. Đó chính là lúc khả năng lập trình và khả năng agentic của K3 thực sự phát huy tác dụng.
Câu lệnh đầu vào:
Hãy tạo một trang HTML duy nhất để kiểm tra tốc độ gõ phím - trang này cần hiển thị một câu ngẫu nhiên, bắt đầu đếm giờ ngay khi nhấn phím đầu tiên, và hiển thị tốc độ gõ (từ/phút) cũng như độ chính xác khi tôi gõ xong. Hãy thiết kế giao diện gọn gàng, đẹp mắt, tránh dùng kiểu mặc định của Bootstrap. Sau đó, hãy giải thích phần logic phức tạp nhất trong hai câu.
Kết quả đầu ra:
Quan sát:
- Liệu nó có đang sử dụng các kỹ năng tư duy nhận thức không? K3 luôn hoạt động trong "trạng thái tư duy", nghĩa là bạn có thể thấy nó lập kế hoạch cho code trước khi thực sự "xuất ra" code HTML đó.
- Tính trung thực tuyệt đối (100%) là yếu tố cần thiết để xác định xem phần diễn giải bằng lời nói có khớp với code hay không. Nhờ đó, chúng ta có thể chắc chắn rằng nó không chỉ đang lặp lại một cụm từ đã được nghe trước đó.
- Chỉ cần sử dụng đầu vào hình ảnh để gửi cho Geek. Hãy chụp ảnh màn hình trang web đã được phát triển và yêu cầu Geek phân tích lề hoặc độ tương phản của nó. Việc này sẽ giúp bạn hiểu rõ những lợi ích chính của hệ thống.
Toàn bộ quy trình có thể được thực hiện trong chưa đầy 5 phút, qua đó giúp bạn nắm bắt được khả năng của hệ thống trong việc lập trình và xử lý hình ảnh trực quan.
Nhiệm vụ 2: Gọi K3 thông qua API của Fireworks
Để xây dựng bất kỳ thứ gì - dù là script, pipeline hay agent - bạn đều cần khả năng truy cập bằng lập trình. Trong trường hợp này, Fireworks AI cung cấp dịch vụ K3 serverless tương thích với OpenAI thông qua đường dẫn accounts/fireworks/models/kimi-k3.
Bước 1: Tạo API key. Hãy thực hiện việc này trong phần cài đặt API key của Fireworks và xuất khóa đó ra biến môi trường:
export FIREWORKS_API_KEY="api-key-của-bạn"
Bước 2: Thay vì dùng hàm "hello world" đơn điệu để yêu cầu K3 tạo ra kết quả trong một lần chạy với cửa sổ ngữ cảnh khổng lồ lên tới 1 triệu token, hãy cung cấp cho nó một hình ảnh. Sau đó, yêu cầu nó phân tích hình ảnh này và tạo ra một sản phẩm hoàn chỉnh, mạch lạc dựa trên sự phân tích đó - tất cả chỉ trong một lần thực hiện duy nhất. Đây là cách mô phỏng hợp lý về cơ chế hoạt động của một agent thực thụ: Tiếp nhận thông tin (sense) → tư duy (think) → tạo ra sản phẩm (create product).
import requests
import json
url = "https://api.fireworks.ai/inference/v1/chat/completions"
payload = {
"model": "accounts/fireworks/models/kimi-k3",
"max_tokens": 4096,
"top_k": 40,
"presence_penalty": 0,
"frequency_penalty": 0,
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": (
"Look at this image. First describe what's in it in one paragraph. "
"Then write a 4-line haiku inspired by it. "
"Return your answer as JSON with keys 'description' and 'haiku'."
)
},
{
"type": "image_url",
"image_url": {
"url": "https://images.unsplash.com/photo-1582538885592-e70a5d7ab3d3?ixlib=rb-4.0.3&ixid=M3wxMjA3fDB8MHxwaG90by1wYWdlfHx8fGVufDB8fHx8fA%3D%3D&auto=format&fit=crop&w=1770&q=80"
}
}
]
}
]
}
headers = {
"Accept": "application/json",
"Content-Type": "application/json",
"Authorization": f"Bearer <FIREWORKS_API_KEY>"
}
response = requests.post(
url,
headers=headers,
data=json.dumps(payload)
)
result = response.json()
print(result["choices"][0]["message"]["content"])
Kết quả đầu ra:

Quan sát
- Định dạng JSON có gọn gàng không, hay K3 ẩn nó trong các phần chú thích? (Bạn cần nắm rõ điều này trước khi quyết định xây dựng quy trình xử lý dữ liệu đầu ra).
- Chất lượng của bài thơ haiku so với phần mô tả thực tế như thế nào – liệu phần "sáng tạo" có tốt ngang bằng phần về "nhận thức" hay không?
- Hãy thay thế tham số `max_tokens` và URL hình ảnh bằng ảnh chụp màn hình bảng điều khiển hoặc bản phác thảo của riêng bạn, rồi yêu cầu hệ thống tạo ra bản đặc tả kỹ thuật.
K3 thể hiện như thế nào so với các mô hình AI khác?
Hiệu suất của K3 chỉ có thể được đánh giá khi đặt trong bối cảnh so sánh với các mô hình khác cùng lĩnh vực:
- Trên Artificial Intelligence Analysis Index, K3 xếp ngay sau GPT-5.6 Sol Max và Claude Fable 5; khoảng cách về điểm số là rất nhỏ chứ không hề bị bỏ xa.
- Trong bài đánh giá blind assessment về lập trình front-end, K3 đã giành vị trí dẫn đầu, vượt qua Claude Fable 5 trong thử nghiệm dành cho các nhà phát triển độc lập.
- Theo bộ công cụ đánh giá lập trình và tiêu chuẩn đo lường hiệu năng agentic của Moonshot, K3 vượt trội hơn Claude Opus 4.8 và GPT-5.5, nhưng vẫn xếp sau Fable 5 và GPT-5.6 Sol.
- Xét về quy mô mô hình, K3 lớn hơn khoảng 75% so với mô hình V4 Pro của DeepSeek – vốn là mô hình mã nguồn mở phổ biến trước khi K3 ra mắt. Điều này có nghĩa là K3 trở thành mô hình trọng số mở lớn nhất trong lịch sử, chứ không chỉ là mô hình lớn nhất của riêng Moonshot.
Bài học rút ra là cần lưu ý rằng K3 vượt trội chủ yếu ở mảng lập trình và các tác vụ agentic đòi hỏi tầm nhìn dài hạn, chứ không phải xuất sắc trong mọi lĩnh vực. Do đó, bạn nên tự chạy bộ công cụ đánh giá riêng nhắm vào tác vụ cụ thể của mình thay vì chỉ dựa vào thứ hạng trên bảng xếp hạng chung.
Kết luận
K3 là một trong những mô hình đầu tiên thuộc phân khúc này cho phép bạn tải xuống và tự host. Tuy nhiên, xét về khía cạnh hạ tầng, Moonshot khuyến nghị cần có ít nhất 64 accelerator để vận hành mô hình một cách hiệu quả.
Nếu muốn trải nghiệm K3 mà không cần đầu tư hạ tầng như vậy, ứng dụng Kimi và Fireworks API là những phương thức tiếp cận dễ dàng nhất. Ứng dụng này cho phép bạn thử nghiệm các khả năng của mô hình, trong khi API giúp việc tích hợp K3 vào các ứng dụng thực tế trở nên khả thi.
Việc thiết lập cả hai tùy chọn đều tốn chưa đầy 10 phút và mang lại kết quả nhất quán. K3 thể hiện khả năng suy luận mạnh mẽ trước khi thực hiện hành động, đồng thời xử lý hình ảnh tự nhiên không kém gì các dạng dữ liệu đầu vào khác.
Bạn nên đọc
-
Kimi K3 có được đào tạo trên Claude không?
-
Cách sử dụng lệnh /goal trong Claude Code cho các workflow hoàn toàn tự động
-
TOP mô hình AI mã nguồn mở nổi bật nhất
-
Claude Code hay Cursor là công cụ lập trình AI phù hợp với bạn?
-
Cách tạo file CLAUDE.md cho Claude Code: Hướng dẫn và template
-
So sánh 5 mô hình AI mới ra mắt trong tháng 7/2026: Grok 4.5, GPT-5.6, Muse Spark 1.1, Inkling và Kimi K3
-
Agent Harness là gì? Vì sao AI agent cần một “bộ khung” để hoạt động?
-
Tài liệu tham khảo toàn diện về các lệnh Codex
Theo Nghị định 147/2024/ND-CP, bạn cần xác thực tài khoản trước khi sử dụng tính năng này. Chúng tôi sẽ gửi mã xác thực qua SMS hoặc Zalo tới số điện thoại mà bạn nhập dưới đây:
Hướng dẫn AI
AI Tools
Học IT




Hàm Excel