Các LLM mã nguồn mở là một trong những xu hướng AI quan trọng nhất năm 2026. Và điều này hoàn toàn có lý: Các mô hình mã nguồn mở từ lâu đã yếu hơn đáng kể so với những mô hình độc quyền.
DeepSeek V4 Pro (phát hành ngày 24 tháng 4 năm 2026), GLM-5.1 từ Z.ai, Kimi K2.6 từ Moonshot AI và Qwen3.5 từ Alibaba có thể cạnh tranh với các mô hình LLM độc quyền tốt nhất như Claude Opus 4.8, GPT-5.5 hoặc Gemini 3.1 Pro, và thậm chí còn vượt trội hơn chúng trên những tiêu chuẩn cụ thể như SWE-Bench Pro và HumanEval. Điểm tham chiếu độc quyền mới cho Terminal-Bench 2.1 là GPT-5.6 Sol (được cung cấp rộng rãi từ ngày 9 tháng 7 năm 2026, mô hình mặc định trong OpenAI Codex) ở mức 88,8%, Sol Ultra ở mức 91,9%. Sol đạt 64,6% trên SWE-Bench Pro (thấp hơn khoảng 15 điểm so với Claude Mythos 5 và Fable 5). Điểm số tương đương của các phần mềm mã nguồn mở khác trên Terminal-Bench 2.1 vẫn chưa được công bố.
Trong bài viết này, bạn sẽ tìm thấy một danh mục gồm hơn 120 LLM mã nguồn mở, bao gồm benchmark, giấy phép, giá API, cửa sổ ngữ cảnh và khả năng của chúng.
Tổng quan về tất cả các mô hình LLM mã nguồn mở
Phần này chứa mọi mô hình trọng số mở từ danh mục models.dev cùng với các mô hình kinh điển được tuyển chọn, sắp xếp theo ngày phát hành theo mặc định, hiển thị thêm dữ liệu, chẳng hạn như phương thức, ngưỡng kiến thức, đầu ra tối đa hoặc số lượng nhà cung cấp API:
| Mô hình | Nhà phát triển | Tham số | Ngữ cảnh | MMLU | Toán học | Code | Suy luận | Công cụ | Giấy phép | Giá input | Giá output | Ngày phát hành |
|---|---|---|---|---|---|---|---|---|---|---|---|---|
|
Laguna XS 2.1
|
Poolside | 33B (3B hoạt động) | 256K | – | – | 70.9% SWE-Bench Verified | OpenMDW-1.1 | $0.060 | $0.12 | Tháng 7 năm 2026 | ||
|
Ornith 1.0 31B
|
DeepReinforce | 31B | 256K | – | – | – | MIT | – | – | Tháng 6 năm 2026 | ||
|
Ornith 1.0 35B
|
DeepReinforce | 35B | 256K | – | – | 75.6% SWE-Bench Verified | MIT | – | – | Tháng 6 năm 2026 | ||
|
Ornith 1.0 397B
|
DeepReinforce | 397B | 256K | – | – | 82.4% SWE-Bench Verified | MIT | – | – | Tháng 6 năm 2026 | ||
|
Ornith 1.0 9B
|
DeepReinforce | 9B | 256K | – | – | 69.4% SWE-Bench Verified | MIT | – | – | Tháng 6 năm 2026 | ||
|
GLM-5.2
|
Z.ai | – | 1M | – | 91.2% GPQA | 62.1% SWE-Bench Pro | MIT | $0.42 | $1.32 | Tháng 6 năm 2026 | ||
|
Kimi K2.7 Code
|
Moonshot AI | 1T (32B hoạt động) | 256K | – | 89.6% GPQA | 67.4% Terminal-Bench | MIT đã được sửa đổi | $0.28 | $1.10 | Tháng 6 năm 2026 | ||
|
Kimi K2.7 Code Highspeed
|
Moonshot AI | 1T (32B hoạt động) | 256K | – | 89.6% GPQA | 67.4% Terminal-Bench | MIT đã được sửa đổi | $1.90 | $8.00 | Tháng 6 năm 2026 | ||
|
North Mini Code
|
Cohere | – | 250K | – | – | 61% SWE-Bench Verified | – | – | – | Tháng 6 năm 2026 | ||
|
MiMo-V2.5-Pro-UltraSpeed
|
Xiaomi | – | 1M | – | – | – | MIT | $1.31 | $2.61 | Tháng 6 năm 2026 | ||
|
Nemotron 3 Ultra 550B A55B
|
NVIDIA | 550B (55B hoạt động) | 1M | 86.8% MMLU-Pro | 87% GPQA | 89% LiveCodeBench | Giấy phép mô hình mở NVIDIA | $0.10 | $0.10 | Tháng 6 năm 2026 | ||
|
MiniMax-M3
|
MiniMax | – | 500K | – | 92.9% GPQA | 80.5% SWE-Bench Verified | MIT | $0.28 | $1.10 | Tháng 6 năm 2026 | ||
|
Step 3.7 Flash
|
StepFun | – | 250K | – | – | 76.5% SWE-Bench Verified | Apache 2.0 | $0.20 | $1.15 | Tháng 5 năm 2026 | ||
|
Command A Plus
|
Cohere | – | 125K | – | – | – | CC BY-NC-4.0 | $2.50 | $10.00 | Tháng 5 năm 2026 | ||
|
Mistral Medium 3.5
|
Mistral AI | 128B | 256K | – | – | 77.6% SWE-Bench Verified | – | $1.50 | $6.90 | Tháng 4 năm 2026 | ||
|
Nemotron 3 Nano Omni 30B A3B Reasoning
|
NVIDIA | 30B (3B hoạt động) | 250K | 77.3% MMLU-Pro | 72.2% GPQA | 63.2% LiveCodeBench | Giấy phép mô hình mở NVIDIA | $0.11 | $0.42 | Tháng 4 năm 2026 | ||
|
Laguna M.1
|
Poolside | 225B (23B hoạt động) | 256K | – | – | 74.6% SWE-Bench Verified | Apache 2.0 | $0.20 | $0.40 | Tháng 4 năm 2026 | ||
|
Laguna XS.2
|
Poolside | 33B (3B hoạt động) | 256K | – | – | 69.9% SWE-Bench Verified | Apache 2.0 | $0.20 | $0.40 | Tháng 4 năm 2026 | ||
|
DeepSeek V4 Flash
|
DeepSeek | 284B (13B hoạt động) | 1M | 83% MMLU-Pro | 85% GPQA | 88% LiveCodeBench | MIT | $0.084 | $0.17 | Tháng 4 năm 2026 | ||
|
DeepSeek V4 Pro
|
DeepSeek | 1.6T (49B hoạt động) | 1M | 87.5% MMLU-Pro | 90.1% GPQA | 93.5% LiveCodeBench | MIT | $0.35 | $0.70 | Tháng 4 năm 2026 | ||
|
Qwen3.6 27B
|
Alibaba | 27B | 256K | 86.2% MMLU-Pro | 87.8% GPQA | 77.2% SWE-Bench Verified | Apache 2.0 | $0.20 | $0.76 | Tháng 4 năm 2026 | ||
|
MiMo-V2.5
|
Xiaomi | – | 1M | 86.3% MMLU | – | 56.1% SWE-Bench Pro | MIT | $0.11 | $0.28 | Tháng 4 năm 2026 | ||
|
MiMo-V2.5-Pro
|
Xiaomi | – | 1M | 89.4% MMLU | – | 78.9% SWE-Bench Verified | MIT | $0.40 | $0.80 | Tháng 4 năm 2026 | ||
|
Kimi K2.6
|
Moonshot AI | 1T (32B hoạt động) | 256K | 84.6% MMLU-Pro | 90.5% GPQA | 92% HumanEval | MIT đã được sửa đổi | $0.28 | $1.10 | Tháng 4 năm 2026 | ||
|
Hy3 preview
|
Tencent | – | 250K | 87.4% MMLU | 87.2% GPQA | 74.4% SWE-Bench Verified | Tencent Hunyuan Community | $0.063 | $0.21 | Tháng 4 năm 2026 | ||
|
Qwen3.6 35B-A3B
|
Alibaba | 35B (3B hoạt động) | 256K | 85.2% MMLU-Pro | 86% GPQA | 73.4% SWE-Bench Verified | Apache 2.0 | $0.11 | $0.48 | Tháng 4 năm 2026 | ||
|
GLM-5.1
|
Z.ai | 754B | 200K | 91.7% MMLU | 85.7% GPQA | 58.4% SWE-Bench Pro | MIT | $0.30 | $2.15 | Tháng 4 năm 2026 | ||
|
Gemma 4 26B A4B IT
|
26B (4B hoạt động) | 256K | 82.6% MMLU-Pro | 82.3% GPQA | 77.1% LiveCodeBench | Điều khoản sử dụng của Gemma | $0.060 | $0.30 | Tháng 4 năm 2026 | |||
|
Gemma 4 31B IT
|
31B | 256K | 85.2% MMLU-Pro | 84.3% GPQA | 80% LiveCodeBench | Điều khoản sử dụng của Gemma | $0.10 | $0.30 | Tháng 4 năm 2026 | |||
|
Gemma 4 E2B IT
|
– | 128K | 60% MMLU-Pro | 43.4% GPQA | 44% LiveCodeBench | Điều khoản sử dụng của Gemma | – | – | Tháng 4 năm 2026 | |||
|
Gemma 4 E4B IT
|
– | 128K | 69.4% MMLU-Pro | 58.6% GPQA | 52% LiveCodeBench | Điều khoản sử dụng của Gemma | – | – | Tháng 4 năm 2026 | |||
|
Step 3.5 Flash 2603
|
StepFun | – | 250K | – | – | 32.6% Terminal-Bench Hard | Apache 2.0 | $0.10 | $0.30 | Tháng 4 năm 2026 | ||
|
Nemotron Cascade 2 30B A3B
|
NVIDIA | 30B (3B hoạt động) | 250K | 79.8% MMLU-Pro | 76.1% GPQA | 87.2% LiveCodeBench | Giấy phép mô hình mở NVIDIA | $0.14 | $0.60 | Tháng 3 năm 2026 | ||
|
MiniMax-M2.7
|
MiniMax | – | 200K | 81.8% MMLU-Pro | 89.8% GPQA | 79.9% SWE-Bench Verified | MIT | $0.24 | $0.96 | Tháng 3 năm 2026 | ||
|
MiniMax-M2.7-highspeed
|
MiniMax | – | 200K | 81.8% MMLU-Pro | 89.8% GPQA | 79.9% SWE-Bench Verified | MIT | $0.60 | $2.40 | Tháng 3 năm 2026 | ||
|
Mistral Small 4
|
Mistral AI | 119B | 250K | – | 71.2% GPQA | 17.4% Terminal-Bench Hard | Apache 2.0 | $0.15 | $0.60 | Tháng 3 năm 2026 | ||
|
Nemotron VoiceChat
|
NVIDIA | – | 125K | – | – | – | Giấy phép mô hình mở NVIDIA | – | – | Tháng 3 năm 2026 | ||
|
Nemotron 3 Super 120B A12B
|
NVIDIA | 120B (12B hoạt động) | 256K | 83.7% MMLU-Pro | 79.2% GPQA | 81.2% LiveCodeBench | Giấy phép mô hình mở NVIDIA | $0.050 | $0.25 | Tháng 3 năm 2026 | ||
|
Qwen3.5 122B-A10B
|
Alibaba | 122B (10B hoạt động) | 256K | 86.7% MMLU-Pro | 86.6% GPQA | 72% SWE-Bench Verified | Apache 2.0 | $0.12 | $0.92 | Tháng 2 năm 2026 | ||
|
Qwen3.5 27B
|
Alibaba | 27B | 256K | 86.1% MMLU-Pro | 85.5% GPQA | 72.4% SWE-Bench Verified | Apache 2.0 | $0.086 | $0.69 | Tháng 2 năm 2026 | ||
|
Qwen3.5 35B-A3B
|
Alibaba | 35B (3B hoạt động) | 256K | 85.3% MMLU-Pro | 84.2% GPQA | 74.6% LiveCodeBench | Apache 2.0 | $0.057 | $0.46 | Tháng 2 năm 2026 | ||
|
Qwen3.5 9B
|
Alibaba | 9B | 256K | 82.5% MMLU-Pro | 81.7% GPQA | 65.6% LiveCodeBench | Apache 2.0 | $0.040 | $0.15 | Tháng 2 năm 2026 | ||
|
Sarvam 30B
|
Sarvam AI | 30B | 125K | 85.1% MMLU | 66.5% GPQA | 70% LiveCodeBench | – | $0.020 | $0.10 | Tháng 2 năm 2026 | ||
|
Qwen3.5 397B-A17B
|
Alibaba | 397B (17B hoạt động) | 256K | 87.8% MMLU-Pro | 88.4% GPQA | 76.4% SWE-Bench Verified | Apache 2.0 | $0.17 | $1.03 | Tháng 2 năm 2026 | ||
|
MiniMax-M2.5-highspeed
|
MiniMax | – | 200K | 85.2% MMLU-Pro | 85.2% GPQA | 75.8% SWE-Bench Verified | MIT | $0.60 | $2.40 | Tháng 2 năm 2026 | ||
|
MiniMax-M2.5
|
MiniMax | – | 200K | 85.2% MMLU-Pro | 85.2% GPQA | 75.8% SWE-Bench Verified | MIT | $0.11 | $0.88 | Tháng 2 năm 2026 | ||
|
GLM-5
|
Z.ai | 744B | 200K | 96% MMLU | 94% GPQA | 94.2% HumanEval | MIT | $0.30 | $1.90 | Tháng 2 năm 2026 | ||
|
Step 3.5 Flash
|
StepFun | – | 250K | 84.4% MMLU-Pro | 83.5% GPQA | 74.4% SWE-Bench Verified | Apache 2.0 | $0.090 | $0.30 | Tháng 1 năm 2026 | ||
|
GLM-4.7-Flash
|
Z.ai | – | 200K | – | 75.2% GPQA | 59.2% SWE-Bench Verified | MIT | $0.040 | $0.30 | Tháng 1 năm 2026 | ||
|
GLM-4.7-FlashX
|
Z.ai | – | 200K | – | 75.2% GPQA | 59.2% SWE-Bench Verified | MIT | $0.060 | $0.40 | Tháng 1 năm 2026 | ||
|
Kimi K2.5
|
Moonshot AI | 1T (32B hoạt động) | 256K | 92% MMLU | 87.6% GPQA | 99% HumanEval | MIT đã được sửa đổi | $0.30 | $1.50 | Tháng 1 năm 2026 | ||
|
MiniMax-M2.1
|
MiniMax | 230B (10B hoạt động) | 200K | 88% MMLU-Pro | 83% GPQA | 74% SWE-Bench Verified | MIT | $0.27 | $0.95 | Tháng 12 năm 2025 | ||
|
GLM-4.7
|
Z.ai | – | 200K | 84.3% MMLU-Pro | 85.7% GPQA | 73.8% SWE-Bench Verified | MIT | $0.15 | $0.80 | Tháng 12 năm 2025 | ||
|
MiMo-V2-Flash
|
Xiaomi | – | 256K | 84.9% MMLU-Pro | 83.7% GPQA | 80.6% LiveCodeBench | MIT | $0.090 | $0.28 | Tháng 12 năm 2025 | ||
|
Nemotron 3 Nano 30B A3B
|
NVIDIA | 30B (3B hoạt động) | 256K | 78.3% MMLU-Pro | 73% GPQA | 68.3% LiveCodeBench | Giấy phép mô hình mở NVIDIA | $0.050 | $0.20 | Tháng 12 năm 2025 | ||
|
Devstral 2
|
Mistral AI | 123B | 256K | – | – | 18.9% Terminal-Bench Hard | – | $0.40 | $2.00 | Tháng 12 năm 2025 | ||
|
GLM-4.6V
|
Z.ai | – | 125K | – | – | – | MIT | $0.14 | $0.42 | Tháng 12 năm 2025 | ||
|
DeepSeek V3.2
|
DeepSeek | 685B (37B hoạt động) | 1M | 85% MMLU-Pro | 79.9% GPQA | 70.2% Aider Polyglot | MIT | $0.14 | $0.28 | Tháng 12 năm 2025 | ||
|
Kimi K2 Thinking
|
Moonshot AI | 1T (32B hoạt động) | 256K | 84.6% MMLU-Pro | 84.5% GPQA | 71.3% SWE-Bench Verified | MIT đã được sửa đổi | $0.30 | $1.20 | Tháng 11 năm 2025 | ||
|
Kimi K2 Thinking Turbo
|
Moonshot AI | 1T (32B hoạt động) | 256K | 84.6% MMLU-Pro | 84.5% GPQA | 71.3% SWE-Bench Verified | MIT đã được sửa đổi | $1.15 | $8.00 | Tháng 11 năm 2025 | ||
|
Nemotron Nano 12B v2 VL
|
NVIDIA | 12B | 125K | 77.1% MMLU-Pro | 64.1% GPQA | 69.4% LiveCodeBench | Giấy phép mô hình mở NVIDIA | $0.20 | $0.60 | Tháng 10 năm 2025 | ||
|
MiniMax-M2
|
MiniMax | 230B (10B hoạt động) | 192K | 82% MMLU-Pro | 78% GPQA | 69.4% SWE-Bench Verified | MIT | $0.17 | $1.00 | Tháng 10 năm 2025 | ||
|
GLM-4.6
|
Z.ai | 355B (32B hoạt động) | 200K | 83.2% MMLU-Pro | 81% GPQA | 9.7% SWE-Bench Pro | MIT | $0.29 | $1.14 | Tháng 9 năm 2025 | ||
|
Sarvam 105B
|
Sarvam AI | 105B | 128K | 90.6% MMLU | 78.7% GPQA | 71.7% LiveCodeBench | – | $0.040 | $0.16 | Tháng 9 năm 2025 | ||
|
Qwen3-Next 80B-A3B Instruct
|
Alibaba | 80B (3B hoạt động) | 128K | 80.6% MMLU-Pro | 72.9% GPQA | 56.6% LiveCodeBench | Apache 2.0 | $0.090 | $0.57 | Tháng 9 năm 2025 | ||
|
Qwen3-Next 80B-A3B (Thinking)
|
Alibaba | 80B (3B hoạt động) | 128K | 82.7% MMLU-Pro | 77.2% GPQA | 68.7% LiveCodeBench | Apache 2.0 | $0.098 | $0.65 | Tháng 9 năm 2025 | ||
|
Nemotron Nano 9B v2
|
NVIDIA | 9B | 128K | – | 64% GPQA | 71.1% LiveCodeBench | Giấy phép mô hình mở NVIDIA | $0.040 | $0.16 | Tháng 8 năm 2025 | ||
|
GLM-4.5V
|
Z.ai | 106B (12B hoạt động) | 64K | – | – | 5.3% Terminal-Bench Hard | MIT | $0.29 | $0.86 | Tháng 8 năm 2025 | ||
|
GPT OSS 120B
|
OpenAI | 117B (5.1B hoạt động) | 128K | 90% MMLU | 80.1% GPQA | 62.4% SWE-Bench Verified | Apache 2.0 | $0.036 | $0.10 | Tháng 8 năm 2025 | ||
|
GPT OSS 20B
|
OpenAI | 21B (3.6B hoạt động) | 128K | 85.3% MMLU | 96% AIME | 69% LiveCodeBench | Apache 2.0 | $0.029 | $0.13 | Tháng 8 năm 2025 | ||
|
GLM-4.5
|
Z.ai | 355B (32B hoạt động) | 128K | 90% MMLU | 79.1% GPQA | 22% Terminal-Bench Hard | MIT | $0.29 | $1.14 | Tháng 7 năm 2025 | ||
|
GLM-4.5-Air
|
Z.ai | 106B (12B hoạt động) | 128K | 87.4% MMLU | 75% GPQA | 20.5% Terminal-Bench Hard | MIT | $0.10 | $0.29 | Tháng 7 năm 2025 | ||
|
Llama 3.3 Nemotron Super 49B v1.5
|
NVIDIA | 49B | 128K | 79.5% MMLU-Pro | 72% GPQA | 73.6% LiveCodeBench | Giấy phép mô hình mở NVIDIA | $0.10 | $0.40 | Tháng 7 năm 2025 | ||
|
Devstral Small
|
Mistral AI | – | 125K | – | – | 53.6% SWE-Bench Verified | Apache 2.0 | $0.10 | $0.30 | Tháng 7 năm 2025 | ||
|
Kimi K2
|
Moonshot AI | 1T (32B hoạt động) | 128K | 89.5% MMLU | 97.4% MATH | 71.6% SWE-Bench | MIT đã được sửa đổi | $0.10 | $1.90 | Tháng 7 năm 2025 | ||
|
Mistral Small 3.2
|
Mistral AI | 24B | 125K | 80.5% MMLU | 46.1% GPQA | – | Apache 2.0 | $0.075 | $0.20 | Tháng 6 năm 2025 | ||
|
Mistral Nemotron
|
NVIDIA | – | 125K | – | – | – | Giấy phép mô hình mở NVIDIA | – | – | Tháng 6 năm 2025 | ||
|
Llama 3.1 Nemotron 70B Instruct
|
NVIDIA | 70B | 125K | – | – | – | Llama 3.1 Community | – | – | Tháng 4 năm 2025 | ||
|
Llama 3.1 Nemotron Ultra 253B
|
NVIDIA | 253B | 125K | – | 76% GPQA | 66.3% LiveCodeBench | Giấy phép mô hình mở NVIDIA | $0.60 | $1.80 | Tháng 4 năm 2025 | ||
|
Llama 3.3 Nemotron Super 49B v1
|
NVIDIA | 49B | 128K | – | 66.7% GPQA | 45.5% LiveCodeBench | Giấy phép mô hình mở NVIDIA | $0.15 | $0.15 | Tháng 4 năm 2025 | ||
|
Llama 4 Maverick 17B Instruct
|
Meta | 400B (17B hoạt động) | 1M | 80.5% MMLU-Pro | 69.8% GPQA | 43.4% LiveCodeBench | Llama 4 Community | $0.12 | $0.59 | Tháng 4 năm 2025 | ||
|
Llama 4 Scout 17B Instruct
|
Meta | 109B (17B hoạt động) | 3.5M | 74.3% MMLU-Pro | 57.2% GPQA | 32.8% LiveCodeBench | Llama 4 Community | $0.17 | $0.59 | Tháng 4 năm 2025 | ||
|
Qwen3 235B-A22B
|
Alibaba | 235B (22B hoạt động) | 128K | 87% MMLU | 92.3% AIME | 74.1% LiveCodeBench | Apache 2.0 | $0.20 | $0.50 | Tháng 4 năm 2025 | ||
|
Qwen3 32B
|
Alibaba | 32B | 128K | 83.5% MMLU | 77% MATH | 78% HumanEval | Apache 2.0 | $0.080 | $0.24 | Tháng 4 năm 2025 | ||
|
Qwen3-Coder 30B-A3B Instruct
|
Alibaba | 30B (3B hoạt động) | 256K | – | – | 15.2% Terminal-Bench Hard | Apache 2.0 | $0.053 | $0.22 | Tháng 4 năm 2025 | ||
|
Qwen3-Coder 480B-A35B Instruct
|
Alibaba | 480B (35B hoạt động) | 256K | – | – | 38.7% SWE-Bench Pro | Apache 2.0 | $0.20 | $0.80 | Tháng 4 năm 2025 | ||
|
Command A
|
Cohere | 111B | 250K | 85.5% MMLU | 50.8% GPQA | 12% Aider Polyglot | CC BY-NC-4.0 | $2.50 | $10.00 | Tháng 3 năm 2025 | ||
|
Gemma 3 27B
|
27B | 128K | 67.5% MMLU-Pro | 42.4% GPQA | 39% LiveCodeBench | – | Điều khoản sử dụng của Gemma | $0.030 | $0.11 | Tháng 3 năm 2025 | ||
|
OLMo 2 32B
|
Allen Institute | 32B | 4K | 74% MMLU | 78.6% GSM8K | – | – | Apache 2.0 | – | – | Tháng 3 năm 2025 | |
|
DeepSeek-R1
|
DeepSeek | 671B (37B hoạt động) | 125K | 90.8% MMLU | 97.3% MATH | 6.1% Terminal-Bench Hard | MIT | $0.40 | $1.70 | Tháng 1 năm 2025 | ||
|
InternLM3 8B-Instruct
|
Shanghai AI Lab | 8B | 32K | 72.3% MMLU | 75% GSM8K | 75.6% HumanEval | – | Apache 2.0 | – | – | Tháng 1 năm 2025 | |
|
Llama-3.3-70B-Instruct
|
Meta | 70B | 125K | 86% MMLU | 83% MATH | 3% Terminal-Bench Hard | Llama 3.3 Community | $0.050 | $0.23 | Tháng 12 năm 2024 | ||
|
Command R7B
|
Cohere | 7B | 125K | 65.2% MMLU | 26.3% GPQA | 9% LiveCodeBench | CC BY-NC-4.0 | $0.038 | $0.15 | Tháng 12 năm 2024 | ||
|
DeepSeek-V3
|
DeepSeek | 671B (37B hoạt động) | 128K | 88.5% MMLU | 90.2% MATH | 85% HumanEval | MIT | $0.25 | $1.00 | Tháng 12 năm 2024 | ||
|
Falcon 3 10B
|
TII | 10B | 32K | 73.1% MMLU | 58% MATH | – | – | Giấy phép Falcon | – | – | Tháng 12 năm 2024 | |
|
Falcon 3 7B
|
TII | 7B | 32K | 67.4% MMLU | 70.8% GSM8K | – | – | Giấy phép Falcon | – | – | Tháng 12 năm 2024 | |
|
Phi-4
|
Microsoft | 14B | 16K | 84.8% MMLU | 56.1% GPQA | 82.6% HumanEval | – | MIT | $0.060 | $0.14 | Tháng 12 năm 2024 | |
|
Mistral Large 2.1
|
Mistral AI | 123B | 128K | 84% MMLU | 76.9% MATH | 82% HumanEval | Giấy phép nghiên cứu Mistral | $2.00 | $6.00 | Tháng 11 năm 2024 | ||
|
Mistral Large 3
|
Mistral AI | 675B (41B hoạt động) | 256K | – | 67.2% GPQA | 15.9% Terminal-Bench Hard | – | $0.50 | $1.50 | Tháng 11 năm 2024 | ||
|
Pixtral Large (latest)
|
Mistral AI | – | 125K | – | – | – | Giấy phép nghiên cứu Mistral | $2.00 | $6.00 | Tháng 11 năm 2024 | ||
|
OLMo 2 13B
|
Allen Institute | 13B | 4K | 68.2% MMLU | 71.4% GSM8K | – | – | Apache 2.0 | – | – | Tháng 11 năm 2024 | |
|
Pixtral 12B
|
Mistral AI | 12B | 125K | 69.2% MMLU | 48.1% MATH | 72% HumanEval | Apache 2.0 | $0.15 | $0.15 | Tháng 9 năm 2024 | ||
|
Qwen2.5-VL 72B Instruct
|
Alibaba | 72B | 128K | 71.2% MMLU-Pro | 49% GPQA | 87.8% HumanEval | Giấy phép Qwen | $0.13 | $0.40 | Tháng 9 năm 2024 | ||
|
Qwen2.5-32B-Instruct
|
Alibaba | 32B | 128K | 83.1% MMLU | 75.5% MATH | 78.9% HumanEval | Apache 2.0 | $0.29 | $0.86 | Tháng 9 năm 2024 | ||
|
Qwen2.5-72B-Instruct
|
Alibaba | 72B | 128K | 85.3% MMLU | 82.3% MATH | 82% HumanEval | Giấy phép Qwen | $0.062 | $0.23 | Tháng 9 năm 2024 | ||
|
Command R
|
Cohere | 32B | 125K | – | 26.8% GPQA | 11% LiveCodeBench | CC BY-NC-4.0 | $0.15 | $0.60 | Tháng 8 năm 2024 | ||
|
Command R+
|
Cohere | 104B | 125K | – | 34.3% GPQA | 14.4% LiveCodeBench | CC BY-NC-4.0 | $0.15 | $0.60 | Tháng 8 năm 2024 | ||
|
Nemotron Mini 4B Instruct
|
NVIDIA | 4B | 125K | – | – | – | Giấy phép mô hình mở NVIDIA | – | – | Tháng 8 năm 2024 | ||
|
Mistral Nemo
|
Mistral AI | – | 125K | 68% MMLU | – | – | Apache 2.0 | $0.020 | $0.030 | Tháng 7 năm 2024 | ||
|
Llama 3.1 405B Instruct
|
Meta | 405B | 128K | 88.6% MMLU | 73.8% MATH | 89% HumanEval | Llama 3.1 Community | – | – | Tháng 7 năm 2024 | ||
|
Llama 3.1 70B Instruct
|
Meta | 70B | 128K | 79.3% MMLU | 68% MATH | 80.5% HumanEval | Llama 3.1 Community | $0.40 | $0.40 | Tháng 7 năm 2024 | ||
|
Llama 3.1 8B Instruct
|
Meta | 8B | 128K | 68.4% MMLU | 84.5% GSM8K | 72.6% HumanEval | Llama 3.1 Community | $0.020 | $0.025 | Tháng 7 năm 2024 | ||
|
DeepSeek Coder V2
|
DeepSeek | 236B (21B hoạt động) | 128K | 78.5% MMLU | 75.7% MATH | 90.2% HumanEval | – | MIT | – | – | Tháng 6 năm 2024 | |
|
Qwen2-72B-Instruct
|
Alibaba | 72B | 128K | 84.2% MMLU | 89.5% GSM8K | 64.6% HumanEval | – | Giấy phép Qwen | – | – | Tháng 6 năm 2024 | |
|
Codestral (latest)
|
Mistral AI | 22B | 250K | – | – | 11.1% Aider Polyglot | Giấy phép phi sản xuất Mistral | $0.30 | $0.90 | Tháng 5 năm 2024 | ||
|
Granite Code 34B
|
IBM | 34B | 8K | 75.4% MMLU | – | 68.3% HumanEval | – | Apache 2.0 | – | – | Tháng 5 năm 2024 | |
|
Mistral 7B v0.3
|
Mistral AI | 7B | 32K | 62.5% MMLU | 52.2% GSM8K | – | – | Apache 2.0 | $0.25 | $0.25 | Tháng 5 năm 2024 | |
|
Phi-3 Medium (14B)
|
Microsoft | 14B | 128K | 78% MMLU | 91% GSM8K | 62.2% HumanEval | – | MIT | – | – | Tháng 5 năm 2024 | |
|
Yi-1.5 34B
|
01.AI | 34B | 4K | 76.8% MMLU | 80.1% GSM8K | 75% HumanEval | – | Apache 2.0 | – | – | Tháng 5 năm 2024 | |
|
Mixtral 8x22B
|
Mistral AI | 141B (39B hoạt động) | 64K | 77.8% MMLU | 68% MATH | 75% HumanEval | Apache 2.0 | $0.90 | $0.90 | Tháng 4 năm 2024 | ||
|
WizardLM-2 8x22B
|
Microsoft | 141B (39B hoạt động) | 64K | 77.2% MMLU | 83% GSM8K | 73.2% HumanEval | – | Apache 2.0 | $0.49 | $0.49 | Tháng 4 năm 2024 | |
|
DBRX
|
Databricks | 132B (36B hoạt động) | 32K | 73.7% MMLU | 66.9% GSM8K | 70.1% HumanEval | – | Databricks Open Model | – | – | Tháng 3 năm 2024 | |
|
StarCoder2 15B
|
BigCode | 15B | 16K | 46% MMLU | 65.1% GSM8K | 36.6% HumanEval | – | BigCode Open RAIL-M v1 | – | – | Tháng 2 năm 2024 | |
|
Code Llama 70B Instruct
|
Meta | 70B | – | 62% MMLU | 46.2% GSM8K | 67.8% HumanEval | – | Llama 2 Community | – | – | Tháng 1 năm 2024 | |
|
InternLM2-Chat-20B
|
Shanghai AI Lab | 20B | – | 67% MMLU | 79.6% GSM8K | 67.1% HumanEval | – | Apache 2.0 | – | – | Tháng 1 năm 2024 | |
|
Mixtral 8x7B
|
Mistral AI | 46.7B (12.9B hoạt động) | 32K | 70.6% MMLU | 74.4% GSM8K | 40.2% HumanEval | – | Apache 2.0 | $0.27 | $0.27 | Tháng 12 năm 2023 | |
|
SOLAR 10.7B v1.0
|
Upstage | 10.7B | 4K | 66% MMLU | 69.9% GSM8K | – | – | Apache 2.0 | – | – | Tháng 12 năm 2023 | |
|
DeepSeek LLM 67B
|
DeepSeek | 67B | 4K | 71.3% MMLU | 63.4% GSM8K | 40% HumanEval | – | DeepSeek License | – | – | Tháng 11 năm 2023 | |
|
Yi-34B
|
01.AI | 34B | 4K | 76.3% MMLU | 67.6% GSM8K | 23.2% HumanEval | – | Apache 2.0 | – | – | Tháng 11 năm 2023 | |
|
Falcon 180B
|
TII | 180B | 2K | 70.4% MMLU | 54.4% GSM8K | 35.4% HumanEval | – | Giấy phép Falcon | – | – | Tháng 9 năm 2023 |
Những mô hình LLM mã nguồn mở tốt nhất năm 2026
Trước tiên, hãy cùng nhìn về phía trước: Vào ngày 16 tháng 7 năm 2026, Moonshot AI đã ra mắt Kimi K3, một mô hình MoE với 2,8 nghìn tỷ tham số (896 expert, 16 hoạt động trên mỗi token) cùng cửa sổ ngữ cảnh 1 triệu token, khả năng nhận diện hình ảnh gốc và đạt 93,5% trên GPQA Diamond. Hiện tại, K3 chỉ có sẵn thông qua ứng dụng và API (3 USD/15 USD cho mỗi triệu token, cũng có trên OpenRouter); trọng số dự kiến sẽ được đưa lên Hugging Face vào ngày 27 tháng 7 năm 2026 (Moonshot sẽ công bố giấy phép chính xác khi phát hành; các mô hình trước đó sử dụng giấy phép MIT sửa đổi). Điều đó sẽ khiến K3 trở thành mô hình có trọng số mở lớn nhất từ trước đến nay. Sau khi trọng số được công bố, nó sẽ được chuyển vào danh mục bên dưới. Cho đến lúc đó, bảng xếp hạng tháng 4 vẫn được áp dụng:
DeepSeek V4 Pro (phát hành ngày 24 tháng 4 năm 2026) là mô hình dẫn đầu mới. Mô hình MoE với 1,6 nghìn tỷ tham số chỉ kích hoạt 49 tỷ token, đạt điểm 87,5% trên MMLU-Pro, 90,1% trên GPQA Diamond và 93,5% trên LiveCodeBench. Sử dụng cùng giấy phép MIT như các sản phẩm khác trong dòng DeepSeek, và được tích hợp sẵn ngữ cảnh 1 triệu token với hiệu năng suy luận chỉ bằng khoảng 27% so với phiên bản 3.2.
Kimi K2.6 từ Moonshot AI là mô hình có hiệu năng mở tốt thứ hai: Đạt 92% trên HumanEval, 90,5% trên GPQA Diamond, 96,4% trên AIME 2026, với cửa sổ ngữ cảnh 256K và đầu vào video gốc. Sử dụng giấy phép MIT đã được sửa đổi, mô hình MoE với 1 nghìn tỷ tham số.
GLM-5.1 từ Z.ai (trước đây là Zhipu) dẫn đầu SWE-Bench Pro với 58,4%, vượt trội hơn GPT-5.4 (57,7%) và Claude Opus 4.6 (57,3%). Mô hình MoE với 754 tỷ tham số được huấn luyện hoàn toàn trên chip Huawei Ascend và được phát hành theo giấy phép MIT. Mô hình cùng loại về suy luận, GLM-5, đạt 96% trên MMLU và 94% trên GPQA, điểm số kiến thức cao nhất trong không gian mã nguồn mở.
Kimi K2.5 vẫn đạt điểm HumanEval cao nhất trên mọi bảng xếp hạng (99,0) và dẫn đầu trên MATH-500 (98,0). Đây là mô hình mã nguồn mở tốt nhất dành riêng cho việc tạo mã khi độ trễ ít quan trọng hơn chất lượng tối ưu.
DeepSeek V4 Flash (284B / 13B hoạt động) là phiên bản tiết kiệm chi phí hơn của V4 Pro và là lựa chọn thiết thực nhất khi bạn muốn chất lượng hàng đầu trên một GPU cao cấp duy nhất.
Thế hệ trước vẫn rất hữu dụng: GPT-OSS-120B (mô hình có trọng số mở đầu tiên của OpenAI kể từ GPT-2), DeepSeek R1, Qwen3-235B-A22B-Thinking và Llama 4 Maverick đều vẫn mạnh mẽ, chỉ là không còn là những mô hình tiên tiến nhất nữa.
Dưới đây là so sánh 5 mô hình hàng đầu:
| Tính năng | DeepSeek V4 Pro | Kimi K2.6 | GLM-5.1 | Kimi K2.5 | DeepSeek V4 Flash |
|---|---|---|---|---|---|
| Nhà phát triển | DeepSeek | Moonshot AI | Z.ai | Moonshot AI | DeepSeek |
| Giấy phép cho tất cả mọi người | MIT | MIT đã được sửa đổi | MIT | MIT đã được sửa đổi | MIT |
| Tất cả các tham số Mixture-of-Experts | 1.6T (49B hoạt động) | 1T | 754B | 1T | 284B (13B hoạt động) |
| Chạy cục bộ, ví dụ như với Ollama hoặc LM Studio | Có | Có | Có | Có | Có |
| Nhu cầu phần cứng cục bộ | Nhiều GPU hoặc lượng tử hóa | Nhiều GPU hoặc lượng tử hóa | Nhiều GPU hoặc lượng tử hóa | Nhiều GPU hoặc lượng tử hóa | Một GPU cao cấp |
| Tính năng nổi bật | Cửa sổ ngữ cảnh gốc 1 triệu token | Ngữ cảnh 256K, đầu vào video gốc | Được đào tạo hoàn toàn trên chip Huawei Ascend | Dẫn đầu MATH-500 với điểm số 98.0 | Phiên bản tiết kiệm chi phí hơn của V4 Pro |
Hướng dẫn AI
Học IT
AI
Hàm Excel