15 mô hình trải dài qua 4 thế hệ. Một số miễn phí. Một số thực sự xuất sắc. Và một số đã ngừng phát triển.
Dòng sản phẩm Gemini đã trở nên khá phức tạp kể từ khi Google ra mắt phiên bản đầu tiên vào tháng 12 năm 2023. Pro, Flash, Flash-Lite, Nano, Ultra. Mỗi loại có chức năng gì? Bạn nên sử dụng mô hình nào?
Mọi người thường xuyên sử dụng các mô hình Gemini (chủ yếu thông qua API và Antigravity CLI). Dưới đây là tất cả những gì bạn cần biết về các tính năng, giá cả và tính khả dụng của tất cả các mô hình cạnh tranh với ChatGPT và Claude từ Google.
So sánh tất cả các mô hình Gemini
Dưới đây là tổng quan chi tiết về tất cả các mô hình Gemini cùng với những đặc điểm chính của chúng:
| Mô hình | Ngày phát hành | Trạng thái | Input | Output | Cache input |
| Gemini 2.0 Flash | 12/2024 | Ngừng phát triển | $0.1 | $0.4 | $0.03 |
| Gemini 2.5 Flash-Lite | 06/2025 | Hoạt động | $0.1 | $0.4 | $0.01 |
| Gemini 2.5 Flash | 04/2025 | Hoạt động | $0.3 | $2.5 | $0.03 |
| Gemini 2.5 Pro | 03/2025 | Hoạt động | $1.25 ≤200K / $2.5 >200K | $10 ≤200K / $15 >200K | $0.13 ≤200K / $0.25 >200K |
| Gemini 3 Flash | 12/2025 | Hoạt động | $0.5 | $3 | $0.05 |
| Gemini 3 Pro | 11/2025 | Ngừng phát triển | $2 ≤200K / $4 >200K | $12 ≤200K / $18 >200K | $0.2 ≤200K / $0.4 >200K |
| Gemini 3.1 Pro | 02/2026 | Hoạt động | $2 ≤200K / $4 >200K | $12 ≤200K / $18 >200K | $0.2 ≤200K / $0.4 >200K |
| Gemini 3.5 Flash | 05/2026 | Hoạt động | $1.5 | $9 | $0.15 |
| Gemini 3.6 Flash | 07/2026 | Hoạt động | $1.5 | $7.5 | $0.15 |
| Gemini 3.5 Flash-Lite | 07/2026 | Hoạt động | $0.3 | $2.5 | $0.03 |
| Gemini Nano-1 | 12/2023 | Hoạt động | — | — | — |
| Gemini Nano-2 | 05/2024 | Hoạt động | — | — | — |
Gemini 3.6 Flash
Ngày phát hành: Tháng 7 năm 2026
Gemini 3.6 Flash là thế hệ Flash mới nhất của Google, được công bố vào ngày 21 tháng 7 năm 2026. Nó không thay thế Gemini 3.5 Flash (cả hai phiên bản vẫn có sẵn song song), nhưng được tinh chỉnh để tiết kiệm token hơn: Ít hơn 17% token đầu ra theo Artificial Analysis Index, cùng với ít bước suy luận và lệnh gọi công cụ hơn trong quy trình làm việc nhiều bước.
Điều đó cũng thể hiện ở giá cả: Chi phí đầu ra là 7,50 USD thay vì 9 USD cho 3.5 Flash, trong khi chi phí đầu vào vẫn là 1,50 USD. Thời điểm cắt giảm kiến thức cũng được đẩy nhanh đáng kể, từ tháng 1 năm 2025 lên tháng 3 năm 2026.
Các tính năng chính:
- Hiệu quả sử dụng token hơn: Ít hơn 17% token đầu ra so với 3.5 Flash, ít bước suy luận và gọi công cụ hơn
- Lập trình agentic: 58,7% trên SWE-Bench Pro (3.5 Flash 55,1%, 3.1 Pro 54,2%)
- Computer Use: 83% trên OSWorld-Verified (tăng từ 78,4%)
- DeepSWE: 49% (tăng từ 37%), MLE-Bench: 63,9%
- Ngữ cảnh 1 triệu token, thời điểm dừng của nguồn kiến thức là tháng 3 năm 2026 (trước đây là tháng 1 năm 2025)
- Giá: 1,50 USD mỗi triệu token đầu vào / 7,50 USD mỗi triệu token đầu ra (đầu ra rẻ hơn 3.5 Flash)
- Lưu cache ngữ cảnh: 0,15 USD cho đầu vào được lưu cache
- Chuỗi API: gemini-3.6-flash
Gemini 3.5 Flash-Lite
Ngày phát hành: Tháng 7 năm 2026
Gemini 3.5 Flash-Lite là phiên bản Lite mới nhất của Google, được công bố vào ngày 21 tháng 7 năm 2026 và là một bước nâng cấp so với phiên bản tiền nhiệm 3.1 Flash-Lite (tháng 2 năm 2026) cũng như phiên bản cũ hơn 2.5 Flash-Lite. Nó được xây dựng cho các tác vụ có thông lượng cao, độ trễ thấp như tìm kiếm tự động và xử lý tài liệu.
Sự cải thiện về chất lượng so với 3.1 Flash-Lite là đáng kể: trên Terminal-Bench 2.1, mô hình này đạt 54% thay vì 31%, tăng 23 điểm. Nó cũng vượt trội hơn một số mô hình tiền nhiệm lớn hơn trong các tác vụ lập trình và Computer Use.
Các tính năng chính:
- Terminal-Bench 2.1: 54% (3.1 Flash-Lite: 31%)
- Lập trình agentic: 54,2% trên SWE-Bench Pro (Gemini 3 Flash: 49,6%)
- Computer Use: 74,0% trên OSWorld-Verified (tăng từ 65,1%)
- Ngữ cảnh dài: 72,2% trên GDM-MRCR v2
- Ngữ cảnh 1 triệu token
- Giá: $0,30 cho mỗi triệu token đầu vào / $2,50 cho mỗi triệu token đầu ra
- Lưu cache ngữ cảnh: $0,03 cho các đầu vào được lưu cache
- Chuỗi API: gemini-3.5-flash-lite
Gemini 3.5 Flash
Ngày phát hành: Tháng 5 năm 2026
Gemini 3.5 Flash là thế hệ Flash agentic của Google, được giới thiệu tại Google I/O 2026 (ngày 19 tháng 5 năm 2026). Gemini 3.6 Flash đã được ra mắt sau đó với hiệu suất sử dụng token cao hơn, nhưng 3.5 Flash vẫn hoàn toàn khả dụng. Nó mang lại hiệu năng vượt trội trong các tác vụ agentic và đánh bại Gemini 3.1 Pro trên một số bài kiểm tra lập trình và agent, trong khi chi phí chỉ bằng một phần nhỏ.
Những tính năng chính:
- Lập trình agentic: 76,2% trên Terminal-Bench 2.1 (vượt trội hơn 70,3% của 3.1 Pro)
- Sử dụng công cụ: 83,6% trên MCP Atlas
- Suy luận đa phương thức: 84,2% trên CharXiv Reasoning
- Nhanh hơn khoảng 4 lần về số lượng token đầu ra so với các mô hình tiên tiến tương đương
- Đầu vào 1 triệu token, đầu ra tối đa 64.000 token
- Đa phương thức: văn bản, hình ảnh, âm thanh, video và PDF
- Giá: 1,50 USD cho mỗi triệu token đầu vào / 9 USD cho trên mỗi triệu token đầu ra
- Lưu cache ngữ cảnh: 0,15 USD cho đầu vào được lưu vào cache (giảm giá 90%)
- Chuỗi API: gemini-3.5-flash
Gemini 3.1 Pro
Ngày phát hành: Tháng 2 năm 2026
Gemini 3.1 Pro là mô hình suy luận thuần túy mạnh nhất của Google và đánh dấu một bước tiến vượt bậc so với tất cả các phiên bản tiền nhiệm. Từ tháng 2 năm 2026, nó đã được cung cấp rộng rãi thông qua API Gemini, Google AI Studio và Vertex AI.
Các tính năng chính:
- Khả năng suy luận gấp đôi so với Gemini 3 Pro trong các tác vụ phức tạp
- Đạt 94,3% trên GPQA Diamond (khả năng suy luận cấp độ PhD), điểm số cao nhất từ trước đến nay
- Đạt 80,6% trên SWE-bench Verified (lập trình agentic)
- Đầu vào 1 triệu token, đầu ra tối đa 64.000 token
- Đa phương thức: Văn bản, hình ảnh, âm thanh, video và PDF
- Giá API theo bậc: 2,00 USD / 12,00 USD cho mỗi triệu token (dưới 200.000 ngữ cảnh), 4,00 USD / 18,00 USD (trên 200.000 ngữ cảnh)
- Lưu cache ngữ cảnh: Giảm giá 90% cho các token đầu vào được lưu trong cache (0,20 USD / 0,40 USD)
- Chuỗi API: gemini-3.1-pro
Tính khả dụng: Gemini 3.1 Pro hiện đã có sẵn từ tháng 2 năm 2026 thông qua API Gemini trong Google AI Studio, Vertex AI và Gemini Enterprise. Nó được định vị là phiên bản cao cấp dành cho các tác vụ nghiên cứu, lập trình và phân tích đòi hỏi khắt khe.
Gemini 3 Flash
Ngày phát hành: Tháng 12 năm 2025
Gemini 3 Flash là mô hình cân bằng của Google, kết hợp trí tuệ tiên tiến với tốc độ cao và chi phí thấp. Được cung cấp rộng rãi từ tháng 12 năm 2025, đây là mô hình mặc định trong ứng dụng Gemini.
Các tính năng chính:
- Hiệu suất vượt trội: 90,4% trên GPQA Diamond, 81,2% trên MMMU Pro
- Lập trình agentic: 78% trên SWE-bench Verified
- Nhanh hơn gấp 3 lần so với Gemini 2.5 Pro ở chất lượng tương đương
- Độ chính xác tổng thể tốt hơn 15% so với Gemini 2.5 Flash
- Đầu vào 1 triệu token, đầu ra tối đa 64.000 token
- Đa phương thức: Văn bản, hình ảnh, âm thanh, video và PDF
- Giá: 0,50 USD đầu vào / 3,00 USD cho mỗi triệu token đầu ra
- Lưu cache ngữ cảnh: Giảm 90% chi phí cho các token được lưu vào cache (0,05 USD đầu vào)
- Chuỗi API: gemini-3-flash
Tính khả dụng: Gemini 3 Flash hiện có sẵn thông qua API Gemini trong Google AI Studio, Vertex AI và Gemini Enterprise. Đây là mô hình mặc định trong ứng dụng Gemini và AI Mode trong Google Search. Các công ty như JetBrains, Bridgewater Associates và Figma sử dụng nó trong môi trường sản xuất.
Gemini 3 Pro
Ngày phát hành: Tháng 11 năm 2025
Gemini 3 Pro là thế hệ thứ ba của mô hình AI cao cấp của Google với trí tuệ tiên tiến, Deep Research và hiệu năng vượt trội. Có sẵn rộng rãi từ tháng 11 năm 2025 đến tháng 3 năm 2026.
Các tính năng chính:
- Trí tuệ tiên tiến từ Google DeepMind
- Khả năng suy luận được cải thiện so với Gemini 2.5 Pro
- Deep Research cho các phân tích phức tạp, nhiều bước
- Cải tiến đa phương thức, đặc biệt là trong hiểu video
- Cửa sổ ngữ cảnh 1 triệu token (đầu vào), tối đa 64.000 token đầu ra
- Giá API theo bậc: 2,00 USD / 12,00 USD cho mỗi triệu token (dưới 200.000 ngữ cảnh), 4,00 USD / 18,00 USD (trên 200.000 ngữ cảnh)
- Chuỗi API: gemini-3-pro
Tình trạng sẵn có: Gemini 3 Pro đã được thay thế bởi Gemini 3.1 Pro và ngừng hoạt động vào tháng 3 năm 2026. Nếu bạn cần hiệu năng cao cấp ngay hôm nay, hãy sử dụng trực tiếp Gemini 3.1 Pro.
Gemini 2.5 Pro
Ngày phát hành: Tháng 3 năm 2025
Gemini 2.5 Pro là phiên bản cao cấp của Google cho đến cuối năm 2025 và vẫn là lựa chọn đáng tin cậy cho các tác vụ đòi hỏi cao.
Cụ thể phiên bản Pro cung cấp những gì?
- Hiệu suất hàng đầu cho các tác vụ suy luận và lập trình phức tạp
- Cửa sổ ngữ cảnh 1 triệu token (thử nghiệm cũng có thể lên đến 2 triệu)
- Giá theo bậc: $1.25 / $10 cho các prompt tiêu chuẩn (≤ 200K token), $2.50 / $15 cho các prompt dài hơn
- Đa phương thức tích hợp (xử lý văn bản, hình ảnh, âm thanh, video cùng nhau)
- Prompt caching với mức giảm giá 90% cho các đầu vào được lưu trong cache ($0.125 / $0.25 thay vì $1.25-2.50)
- Chuỗi mô hình API: gemini-2.5-pro
Gemini 2.5 Flash
Ngày phát hành: Tháng 4 năm 2025
Gemini 2.5 Flash là phiên bản cân bằng, mô hình "bất hủ" của dòng 2.5. Nó cung cấp 90% hiệu năng của phiên bản Pro nhưng giá thành chỉ bằng một phần nhỏ và tốc độ nhanh hơn đáng kể.
Thông số kỹ thuật chính:
- 90% hiệu năng của phiên bản Pro với chi phí thấp hơn nhiều
- Nhanh hơn 2-3 lần so với phiên bản Pro (tốc độ suy luận)
- Ngữ cảnh 1 triệu token
- $0.30 cho mỗi triệu token đầu vào / $2.50 cho mỗi triệu token đầu ra
- Prompt caching: $0.03 cho các đầu vào được lưu vào cache
- Đa phương thức: Văn bản, hình ảnh, âm thanh, video
- Chuỗi API: gemini-2.5-flash
Gemini 2.5 Flash-Lite
Ngày phát hành: Tháng 6 năm 2025
Gemini 2.5 Flash-Lite đúng như tên gọi: LLM rẻ nhất và dễ sử dụng trên thị trường, đồng thời cực kỳ nhanh.
Các thông số chính:
- 0,10 USD cho mỗi triệu token đầu vào / 0,40 USD cho mỗi triệu token đầu ra (rẻ nhất trên thị trường)
- Nhanh hơn gấp 5 lần so với các phiên bản Pro
- Vẫn đạt 70-80% hiệu năng của Flash
- Ngữ cảnh 1 triệu token
- Prompt caching: 0,01 USD cho các đầu vào được lưu vào cache
- Đa phương thức: Văn bản, hình ảnh, âm thanh, video
- Chuỗi API: gemini-2.5-flash-lite
Gemini 2.0 Flash
Ngày phát hành: Tháng 12 năm 2024
Gemini 2.0 Flash là phiên bản cũ hơn của Flash và đã bị ngừng hỗ trợ vào tháng 6 năm 2026. Ưu điểm lớn của nó là gói API miễn phí với giới hạn số lượng yêu cầu.
Thông tin nhanh (tính đến thời điểm ngừng hỗ trợ):
- Gói miễn phí (giới hạn số lượng yêu cầu: 15 yêu cầu/phút, 1.500 yêu cầu/ngày, 1 triệu yêu cầu/tháng) hoặc gói trả phí: 0,10 USD / 0,40 USD cho mỗi triệu token
- ~80% hiệu năng của Flash 2.5
- Ngữ cảnh 1 triệu token
- Đa phương thức: Văn bản, hình ảnh, âm thanh
- Chuỗi API: gemini-2.0-flash
Nếu bạn vẫn đang sử dụng Flash 2.0 trong các dự án cũ, hãy chuyển sang Flash 2.5. Để tạo prototype miễn phí, gói miễn phí trong Google AI Studio vẫn khả dụng.
Gemini 1.5 Pro
Ngày phát hành: Tháng 2 năm 2024
Gemini 1.5 Pro là một bước tiến lớn vào năm 2024: Mô hình đầu tiên với ngữ cảnh 2 triệu token. Đó là một kỷ lục thế giới vào thời điểm đó.
Hiện tại, nó đã ngừng hoạt động vào ngày 30 tháng 4 năm 2025. Nếu bạn vẫn đang sử dụng 1.5 Pro, hãy chuyển sang 2.5 Pro hoặc phiên bản mới hơn. Hiệu suất sẽ tốt hơn, ít rắc rối hơn.
Những gì Gemini 1.5 Pro có:
- 2 triệu token (ấn tượng vào thời điểm đó).
- Đa phương thức tích hợp.
- Phân tích video và tài liệu mạnh mẽ vào năm 2024.
Gemini 1.5 Flash
Ngày phát hành: Tháng 5 năm 2024
Gemini 1.5 Flash về cơ bản là phiên bản rẻ hơn, nhanh hơn của 1.5 Pro, cũng đã bị ngừng hỗ trợ.
Ưu điểm chính:
- Ngữ cảnh 1 triệu token.
- Nhanh, chi phí thấp.
- Đa phương thức.
Nhưng nó đã ngừng hoạt động vào ngày 30 tháng 4 năm 2025. Người dùng nên chuyển sang 2.5 Flash hoặc phiên bản mới hơn.
Gemini 1.0 Pro và Ultra
Ngày phát hành: Tháng 12 năm 2023
Gemini 1.0 là nỗ lực đầu tiên. Hiện nay, không còn phù hợp.
Những tính năng chính:
- Ngữ cảnh 32.000 token.
- Chỉ văn bản, không có hình ảnh/video.
- Phiên bản Pro là tiêu chuẩn, Ultra là cao cấp.
Cả hai đều đã lỗi thời. Google nhanh chóng thay thế chúng bằng 1.5 và 2.x, những phiên bản tốt hơn nhiều.
Gemini Nano
Ngày phát hành: Tháng 12 năm 2023 / Tháng 5 năm 2024
Gemini Nano khác biệt ở chỗ nó là Trí tuệ nhân tạo (AI) trên thiết bị dành cho điện thoại thông minh, chạy cục bộ, không cần đám mây.
Những điểm quan trọng:
- Chạy trên thiết bị: Trực tiếp trên điện thoại thông minh, không cần gọi đám mây
- Hai phiên bản: Nano-1 (chỉ văn bản) và Nano-2 (đa phương thức)
- 4.000 từ ngữ cảnh (ít, nhưng đủ cho các tác vụ trên điện thoại thông minh)
- Quyền riêng tư: Mọi thứ đều được lưu trữ cục bộ
- Phần cứng: Điện thoại thông minh Pixel, Samsung Galaxy S24+, các thiết bị Android khác
- Trường hợp sử dụng: Trả lời thông minh, phiên âm trực tiếp, dịch ngoại tuyến, chỉnh sửa ảnh
- Khả dụng: Đã được tích hợp trên nhiều điện thoại Android. Google triển khai thông qua các bản cập nhật hệ thống. Các nhà phát triển có thể sử dụng API AICore.
Hướng dẫn AI
Học IT
AI
Hàm Excel