Google vừa ra mắt Gemini 3.7 Flash – mô hình thuộc dòng Flash mạnh mẽ nhất từ trước đến nay của hãng – với trọng tâm là lập trình và agentic workflows. Sự kiện ra mắt này diễn ra trong bối cảnh mô hình chủ lực Gemini 3.5 Pro vẫn bị trì hoãn; Reuters nhận định đây là phép thử quan trọng để xem liệu DeepMind có thể bắt kịp Anthropic và OpenAI hay không.
Các thông số kỹ thuật chủ chốt rất ấn tượng. Gemini 3.7 Flash đạt điểm số 43,6% trên bài kiểm tra FrontierCode 1.1 Main (tăng so với mức 34,4% của bản 3.6 Flash), đạt 1588 điểm Elo trên bảng xếp hạng Code Arena ở mảng phát triển web, đồng thời ra mắt với mức giá khởi điểm 0,75 USD cho mỗi 1 triệu token đầu vào và 3,75 USD cho mỗi 1 triệu token đầu ra – chỉ bằng một nửa chi phí của bản 3.6 Flash trước đó.
Bài viết này sẽ trình bày chi tiết về những điểm mới của Gemini 3.7 Flash, bao gồm các tính năng, kết quả kiểm thử hiệu năng (benchmark) và hướng dẫn cách tự thực hiện những bài kiểm tra thực tế. Để tìm hiểu sâu hơn về các mô hình đối thủ cạnh tranh, bạn có thể tham khảo bài viết so sánh GPT-5.6 Terra với Claude Sonnet 5 cũng như hướng dẫn cách sử dụng Claude của Quantrimang.com.
Gemini 3.7 Flash là gì?
Gemini 3.7 Flash là mô hình chủ lực thuộc phân khúc tầm trung của Google, được định vị là mô hình dòng Flash mạnh mẽ nhất của hãng dành cho các tác vụ lập trình phức tạp, agentic workflow và khả năng thực thi đa bước đáng tin cậy. Mô hình này kế nhiệm Gemini 3.6 Flash (vốn ra mắt trước đó ba tuần); Google cho biết sự cải thiện về chất lượng này có được nhờ vào phản hồi từ các nhà phát triển và những thay đổi trong thuật toán.
Mô hình hiện đã được phát hành rộng rãi thông qua Gemini API với cửa sổ ngữ cảnh 1 triệu token (1.048.576 token đầu vào) và giới hạn 65.536 token đầu ra. Nó chấp nhận dữ liệu đầu vào đa dạng bao gồm văn bản, hình ảnh, video, âm thanh và file PDF, nhưng chỉ trả về kết quả dưới dạng văn bản. Google cung cấp các mức độ tư duy có thể tùy chỉnh (thấp, trung bình và cao), tuy nhiên API sẽ báo lỗi nếu người dùng yêu cầu mức "tối thiểu" vốn không được hỗ trợ.
Kết quả kiểm thử (benchmark) đáng chú ý nhất đến từ DeepSWE v1.1 – một bài đánh giá năng lực kỹ thuật phần mềm dài hạn. Trong bài kiểm thử này, Gemini 3.7 Flash đạt điểm số 65,3% (so với 34,4% của phiên bản tiền nhiệm trên FrontierCode và 48,6% của bản 3.6 Flash trên chính DeepSWE). Đây là bước tiến lớn chỉ trong một thế hệ đối với một mô hình có mức giá giảm – một điều hiếm thấy.

Có gì mới trong Gemini 3.7 Flash?
Điểm đáng chú ý ở đây là một mô hình Flash mạnh mẽ hơn với chi phí thấp hơn, khả năng tuân thủ chỉ dẫn tốt hơn và ít cần sự can sát thủ công hơn trong các quy trình làm việc của agent (agent loop). Dưới đây là những thay đổi quan trọng nhất đối với người dùng chuyên môn.
Khả năng lập trình và giải quyết vấn đề mạnh mẽ hơn
Bạn có thể giao cho Gemini 3.7 Flash các tác vụ gỡ lỗi và tái cấu trúc code phức tạp hơn với kỳ vọng độ chính xác cao ngay từ lần thực hiện đầu tiên. Google ghi nhận tỷ lệ thành công 43,6% trên bộ dữ liệu FrontierCode 1.1 Main về chất lượng code thực tế (tăng từ mức 34,4% của bản 3.6 Flash) và 65,3% trên DeepSWE v1.1 đối với các tác vụ kỹ thuật phần mềm dài hạn.
Đối với các kỹ sư, lợi ích thực tế là giảm thiểu số lần phải thực hiện lại tác vụ. Google cho biết mô hình này thích ứng tốt hơn với những trở ngại và tuân thủ chỉ dẫn chính xác hơn, từ đó giảm bớt sự giám sát thủ công – yếu tố thường khiến các mô hình giá rẻ trở nên tốn kém về mặt thời gian thực tế triển khai.
Tạo ứng dụng web và giao diện người dùng (UI) nhanh hơn
Gemini 3.7 Flash có thể tạo ra các bố cục hoạt động tốt và ứng dụng web đầy đủ tính năng với ít câu lệnh (prompt) hơn so với bản 3.6 Flash. Trên bảng xếp hạng phát triển web của Code Arena, mô hình này đạt 1588 điểm Elo, so với 1538 điểm của bản 3.6 Flash và 1541 điểm của Claude Sonnet 5.
Mô hình cũng có khả năng tái tạo chính xác dựa trên dữ liệu tham chiếu khi tạo giao diện người dùng, bất kể dữ liệu đó là ảnh chụp màn hình, hình ảnh hay một hệ thống thiết kế hoàn chỉnh. Nếu bạn cung cấp bản phác thảo (mockup) của trang báo giá, mô hình sẽ tập trung tái tạo thiết kế đó thay vì tự ý tạo ra một bố cục chung chung.
Khả năng thực thi tác vụ đa bước tốt hơn
Mô hình chú trọng hơn vào khâu lập kế hoạch và gọi công cụ – những khâu mà các mô hình giá rẻ thường gặp khó khăn. Trên AutomationBench (một bộ đánh giá nội bộ dành cho quy trình nghiệp vụ thực tế), bản 3.7 Flash đạt tỷ lệ 30,4%, so với 17,0% của bản 3.6 Flash và 10,7% của Claude Sonnet 5.
Các công cụ tích hợp sẵn có thể sử dụng qua API bao gồm: Lưu cache, thực thi code, tìm kiếm file, gọi hàm, đối chiếu thông tin thực tế với dữ liệu tìm kiếm và Google Maps, xuất dữ liệu có cấu trúc và ngữ cảnh URL. Tính năng Computer Use cũng đã có sẵn nhưng đang ở giai đoạn thử nghiệm (preview), vì vậy bạn chưa nên xây dựng các agent phục vụ môi trường thực tế (production) dựa trên tính năng này.
Cải thiện khả năng xử lý tài liệu và tri thức
Gemini 3.7 Flash xử lý hiệu quả các lĩnh vực đòi hỏi kiến thức chuyên sâu như tài chính, luật và khoa học sinh học nhờ khả năng suy luận và hiểu tài liệu tốt hơn. Trên bộ dữ liệu chuẩn GDP.pdf (dùng để đánh giá khả năng hiểu tài liệu PDF ở cấp độ chuyên gia), mô hình đạt 34,0% so với mức 22,0% của bản 3.6 Flash; còn với Harvey LAB-AA (dành cho các quy trình pháp lý phức tạp), con số này lên tới 90,7%.
Nếu công việc của bạn đòi hỏi phải trích xuất các câu trả lời có cấu trúc từ những bản báo cáo thường niên hoặc hợp đồng dày đặc thông tin, thì đây là phiên bản rất đáng để thử nghiệm. Mô hình hiện chỉ xuất văn bản, nghĩa là nó sẽ không tự tạo ra các biểu đồ mà nó đọc được, thay vào đó chỉ mô tả hoặc tóm tắt chúng.
Chi phí thấp hơn để mở rộng quy mô các agent
Mức giá ưu đãi ban đầu giúp giảm một nửa chi phí vận hành các agent dựa trên nền tảng Flash so với mức giá khi ra mắt bản 3.6 Flash. Từ nay đến hết ngày 31 tháng 12 năm 2026, mức phí áp dụng là 0,75 USD cho mỗi 1 triệu token đầu vào và 3,75 USD cho mỗi 1 triệu token đầu ra.
- Đầu vào: 0,75 USD/1 triệu token (giá ưu đãi); tăng lên 1,50 USD/1 triệu token từ ngày 1 tháng 1 năm 2027
- Đầu ra: 3,75 USD/1 triệu token (giá ưu đãi); tăng lên 7,50 USD/1 triệu token từ ngày 1 tháng 1 năm 2027
Để so sánh, theo bảng dữ liệu chuẩn của chính Google, Claude Sonnet 5 có mức giá 2,00 USD cho đầu vào và 10,00 USD cho đầu ra, còn GPT-5.6 Terra là 2,00 USD cho đầu vào và 12,00 USD cho đầu ra. Xét về giá token thuần túy, 3.7 Flash có mức giá thấp hơn hẳn so với cả hai mô hình này.
Kết quả đánh giá hiệu năng Gemini 3.7 Flash
Bảng đánh giá của Google so sánh Gemini 3.7 Flash với các mô hình Gemini 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra và Muse Spark 1.2. Kết quả cho thấy một xu hướng nhất quán: Gemini 3.7 Flash vượt trội hơn phiên bản tiền nhiệm ở hầu hết các bài kiểm tra và cạnh tranh ngang ngửa với những đối thủ có chi phí cao hơn, mặc dù GPT-5.6 Terra vẫn nhỉnh hơn một chút ở một số bài kiểm tra về khả năng lập trình agentic.
Tổng quan so sánh Gemini 3.7 Flash với các đối thủ
Dưới đây là các chỉ số chính của 4 mô hình trong bảng đánh giá hiệu năng của Google.
| Số liệu đo lường | Gemini 3.7 Flash | Claude Sonnet 5 | GPT-5.6 Terra |
|---|---|---|---|
| Giá input / 1M | $0.75 | $2.00 | $2.00 |
| Giá output / 1M | $3.75 | $10.00 | $12.00 |
| FrontierCode 1.1 Main | 43.6% | 42.7% | 41.3% |
| DeepSWE v1.1 | 65.3% | 53.8% | 69.6% |
| Terminal-bench 2.1 | 85.8% | 80.4% | 87.4% |
| GDP.pdf | 34.0% | 28.0% | 24.7% |
| GDM-MRCR v2 (128k) | 97.0% | 81.5% | 93.5% |
FrontierCode 1.1 Main
FrontierCode 1.1 Main đo lường chất lượng code thực tế, do đó, nó thưởng cho code đúng và sẵn sàng gửi đi thay vì chỉ hợp lệ về mặt cú pháp.
Gemini 3.7 Flash đạt 43,6%, trước Claude Sonnet 5 ở mức 42,7%, GPT-5.6 Terra ở mức 41,3% và phiên bản tiền nhiệm 3.6 Flash của nó ở mức 34,4%.
Để một mô hình cấp Flash vượt qua cả hai đối thủ cạnh tranh hàng đầu về chất lượng code thực tế là kết quả nổi bật của bản phát hành này, đặc biệt là với chi phí bằng 1/3 chi phí token.
DeepSWE v1.1
DeepSWE v1.1 kiểm tra công nghệ phần mềm có tầm nhìn dài, nghĩa là các tác vụ nhiều file yêu cầu ngữ cảnh được duy trì qua nhiều bước.
Ở đây, 3,7 Flash đạt 65,3%, một bước nhảy vọt so với 48,6% của 3,6 Flash, nhưng GPT-5.6 Terra dẫn đầu với 69,6% và Claude Sonnet 5 dẫn đầu với 53,8%.
Bài học rút ra: 3.7 Flash đã thu hẹp phần lớn khoảng cách với Terra về lập trình tầm xa nhưng không vượt qua được. Nếu bạn cần mức trần tuyệt đối cho lập trình agentic đa file, Terra vẫn giành chiến thắng trong đánh giá cụ thể đó.
Terminal-bench 2.1 và 3.0
Terminal-bench đo lường lập trình terminal agentic, trong đó mô hình điều khiển dòng lệnh để hoàn thành các tác vụ.
Trên Terminal-bench 2.1, 3.7 Flash đạt điểm 85,8% so với 78,0% của 3.6 Flash và 80,4% của Claude Sonnet 5, mặc dù GPT-5.6 Terra dẫn đầu với 87,4%.
Terminal-bench 3.0 mới hơn dành cho các khả năng của agent khó hơn trên bảng: 3,7 Flash đạt 14,9%, cao hơn nhiều so với 3,6 Flash ở mức 5,4%, gần bằng với Claude Sonnet 5 ở mức 14,6% và xếp sau Terra ở mức 20,8%.
Những con số tuyệt đối thấp này là một kiểm tra thực tế hữu ích về việc độ tin cậy của agent vẫn còn phải đi bao xa.
GDP.pdf và Harvey LAB-AA
GDP.pdf kiểm tra khả năng hiểu tài liệu PDF của chuyên gia và Harvey LAB-AA kiểm tra các quy trình pháp lý phức tạp.
Gemini 3.7 Flash dẫn đầu cả hai: 34,0% trên GDP.pdf so với 28,0% đối với Claude Sonnet 5 và 24,7% đối với GPT-5.6 Terra và 90,7% đối với Harvey LAB-AA so với 90,1% đối với Sonnet 5 và 85,2% đối với Terra.
Nếu khối lượng công việc của bạn là phân tích tài chính hoặc pháp lý nặng về tài liệu, thì đây là lúc mô hình rẻ nhất trên bảng cũng chính xác nhất, đây là một sự kết hợp hiếm có.
Ngữ cảnh dài của GDM-MRCR v2
GDM-MRCR v2 (8-needle) đo lường khả năng truy xuất ngữ cảnh dài, kiểm tra xem liệu mô hình có thể tìm thấy nhiều mẩu thông tin bị chôn vùi trong một đầu vào dài hay không.
Ở mức trung bình 128k, 3,7 Flash đạt 97,0%, trước 3,6 Flash ở mức 91,8%, Claude Sonnet 5 ở mức 81,5% và GPT-5.6 Terra ở mức 93,5%.
Với cửa sổ ngữ cảnh token 1M và khả năng truy xuất 8-needle mạnh nhất trên bảng, 3.7 Flash là một lựa chọn mạnh mẽ cho các đường dẫn chứa những tài liệu lớn hoặc bản ghi dài vào một lệnh gọi.
Khi so sánh Terra và Sonnet 5, việc truy xuất ngữ cảnh dài là một trong những điểm khác biệt rõ ràng hơn giữa chúng và 3.7 Flash hiện đứng trên cả hai ở dải này.
GPT-5.6 Terra vẫn dẫn đầu ở khía cạnh nào?
GPT-5.6 Terra đánh bại Gemini 3.7 Flash trên DeepSWE v1.1 (69,6% so với 65,3%), Terminal-bench 2.1 (87,4% so với 85,8%), Terminal-bench 3.0 (20,8% so với 14,9%) và OSWorld-2.0 Agentic Computer Use (50,2% so với 47,9%).
Mô hình là Terra có lợi thế nhỏ trong các cuộc đánh giá lập trình terminal và agent khó nhất, trong khi 3.7 Flash giành chiến thắng về chất lượng code thực tế, khả năng hiểu tài liệu và truy xuất ngữ cảnh dài. Cái nào thắng cho bạn tùy thuộc vào việc nút thắt của bạn là độ tin cậy của agent hay chi phí.

Thông tin về giá và tính khả dụng của Gemini 3.7 Flash
Gemini 3.7 Flash hiện đã được phát hành rộng rãi trên nhiều nền tảng của Google.
ID mô hình API là `gemini-3.7-flash`, và bạn có thể bắt đầu phát triển ứng dụng trên Google AI Studio, Android Studio hoặc môi trường Google Antigravity (nền tảng ưu tiên AI agent).
- Nhà phát triển: Gemini API thông qua Google AI Studio và Android Studio; agent workflow trong Google Antigravity.
- Doanh nghiệp: Nền tảng Gemini Enterprise Agent và ứng dụng Gemini Enterprise.
- Cá nhân: Gemini Spark – AI agent cá nhân hoạt động 24/7 trong ứng dụng Gemini – dành cho người đăng ký gói Google AI Pro và Ultra tại hơn 160 quốc gia.
Mức giá áp dụng là 0,75 USD cho mỗi 1 triệu token đầu vào và 3,75 USD cho mỗi 1 triệu token đầu ra, có hiệu lực đến hết ngày 31 tháng 12 năm 2026. Từ ngày 1 tháng 1 năm 2027, mức giá tiêu chuẩn sẽ là 1,50 USD cho đầu vào và 7,50 USD cho đầu ra. Lưu ý rằng mô hình này không hỗ trợ tạo âm thanh, tạo hình ảnh hay Live API, và tính năng Computer Use hiện chỉ ở giai đoạn preview.
Kết luận
Việc ra mắt Gemini 3.7 Flash cho thấy Google đang đẩy nhanh tiến độ và giảm giá thành trong bối cảnh mô hình chủ lực Gemini 3.5 Pro vẫn bị trì hoãn.
Việc phát hành một phiên bản Flash cải tiến chỉ ba tuần sau bản 3.6 Flash với chi phí token chỉ bằng một nửa cho thấy nỗ lực của công ty nhằm chiếm ưu thế ở phân khúc tầm trung – nơi tập trung phần lớn khối lượng công việc thực tế.
Thành thật mà nói, đây là mô hình đáng cân nhắc nếu công việc của bạn liên quan đến đọc hiểu tài liệu, viết code cho web và ứng dụng thực tế, hoặc truy xuất dữ liệu từ ngữ cảnh dài; ở các khía cạnh này, nó vượt trội hoàn toàn so với Claude Sonnet 5 và GPT-5.6 Terra trong khi chi phí lại thấp hơn nhiều.
Nếu thách thức lớn nhất của bạn nằm ở việc lập trình dòng lệnh phức tạp đòi hỏi khả năng tự hành cao của AI agent, thì Terra vẫn nhỉnh hơn một chút trong các bài kiểm tra DeepSWE và Terminal-bench, nhưng bạn sẽ phải trả chi phí cao hơn để đạt được hiệu năng đỉnh cao đó.
Trong bối cảnh thay đổi nhân sự lãnh đạo tại DeepMind và sự chậm trễ của mô hình Pro, Google đang dựa vào dòng Flash để chứng minh năng lực cạnh tranh của mình. Dựa trên bảng kết quả đánh giá hiệu năng (benchmark) vừa được công bố, lập luận này hoàn toàn hợp lý đối với một mô hình thuộc phân khúc tầm trung. Nếu muốn trực tiếp trải nghiệm các mô hình như thế này, bạn nên bắt đầu với kiến thức nền tảng về AI để xây dựng nền tảng vững chắc trước khi tích hợp Gemini 3.7 Flash vào các quy trình xử lý của agent do chính bạn xây dựng.
Hướng dẫn AI
AI Tools
Học IT
AI
Hàm Excel