Tổng quan về Grok 4.6: Tính năng, benchmark, giá cả và so sánh
Mua gói Thành viên QuanTriMang Pro để trải nghiệm website không quảng cáo và sử dụng các tiện ích AI trên QuanTriMang.
Hầu hết độc giả vẫn biết đến phòng thí nghiệm đứng sau Grok với tên gọi xAI. SpaceXAI đã phát hành Grok 4.6 vào ngày 12 tháng 8 năm 2026 - chỉ hơn một tháng sau phiên bản Grok 4.5 - với trọng tâm cải thiện khả năng lập trình, xử lý giao diện web trực quan và thực hiện các tác vụ agent kéo dài.
Dữ liệu khi ra mắt không cho thấy một bảng xếp hạng đơn giản duy nhất. Grok dẫn đầu ở một số bài kiểm tra do SpaceXAI lựa chọn, trong khi GPT-5.6 Sol và Claude Fable 5 lại chiếm ưu thế ở các bài kiểm tra khác. Artificial Analysis xếp Grok ngang hàng với Sol ở mức giá tổng hợp thấp hơn, nhưng phiên bản nâng cấp này lại có độ trễ phản hồi cao hơn và chi phí cho mỗi tác vụ đo lường cũng đắt hơn so với Grok 4.5.
Bài viết này sẽ phân tích sự đánh đổi đó thông qua các thông số kỹ thuật, giá cả, khả năng truy cập và so sánh trực tiếp giữa Grok với Sol và Claude. Trước đây, Grok 4.5 tập trung vào việc sử dụng ít token; còn lần này, vấn đề đặt ra là liệu điểm số cao hơn có làm thay đổi chi phí thực tế hay không khi tính đến dữ liệu đầu vào được lưu cache, các token suy luận và phần dữ liệu đầu ra bổ sung.
Mục lục bài viết
Grok 4.6 là gì?
Grok 4.6 là mô hình suy luận độc quyền của SpaceXAI. API và Cursor không có cùng giới hạn ngữ cảnh, và mức giới hạn cao hơn dành cho ngữ cảnh dài bắt đầu áp dụng từ rất sớm so với giới hạn của API. Bảng dưới đây liệt kê các giới hạn này cùng với các loại dữ liệu đầu vào, công cụ và mốc thời gian cập nhật kiến thức.
|
Thông số |
Grok 4.6 |
|
500,000 token (API); 256,000 token trong Cursor |
|
|
Input / output |
Nhập văn bản và hình ảnh; xuất văn bản |
|
Nỗ lực tư duy |
Thấp, trung bình, cao (mặc định), rất cao |
|
Mốc thời gian cập nhật kiến thức |
Ngày 1 tháng 2 năm 2026 |
|
Công cụ |
Gọi hàm, tìm kiếm web, tìm kiếm trên X, thực thi code, tìm kiếm trong tập dữ liệu (RAG), MCP từ xa |
|
Giá tiêu chuẩn |
2 USD/triệu token đầu vào, 0,50 USD cho dữ liệu đã lưu cache, 6 USD/triệu token đầu ra |
|
Giá cho ngữ cảnh dài |
$4 / $1 / $12 khi một câu lệnh (prompt) đạt mức 200.000 token; mức giá này áp dụng cho toàn bộ yêu cầu |
SpaceXAI vẫn chưa công bố số lượng tham số cho bất kỳ mô hình nào. Con số 1,5 nghìn tỷ xuất hiện trong một số báo cáo không phải do SpaceXAI đưa ra, vì vậy đây không phải là thông số kỹ thuật đã được xác nhận.
Có gì mới ở Grok 4.6?
SpaceXAI cho biết đây không phải là một mô hình mới được huấn luyện lại từ đầu. Thay vào đó, họ đã huấn luyện thêm cho Grok 4.5, với sự chú trọng đặc biệt vào các tác vụ của AI agent. Những thay đổi được ghi nhận bao gồm khả năng thực hiện tác vụ agent kéo dài hơn, xây dựng giao diện trực quan và quy trình hậu huấn luyện.
Các tác vụ agent kéo dài hơn
SpaceXAI cho biết Grok 4.6 duy trì được sự ổn định trong các tác vụ dài hơi gồm nhiều bước, chẳng hạn như nghiên cứu, làm việc trên codebase và xây dựng ứng dụng. Mô hình được cho là sẽ kiểm tra lại công việc thường xuyên hơn thay vì thực hiện mọi thứ trong một lần duy nhất.
Điều này phù hợp với một xu hướng thay đổi rộng hơn trong việc thử nghiệm mô hình. Câu trả lời ban đầu tốt sẽ trở nên kém quan trọng nếu mô hình quên đi các quyết định trước đó sau khi thực hiện nhiều lệnh gọi công cụ. Các thử nghiệm nội bộ của GitHub cũng cho thấy Grok 4.6 duy trì được khả năng suy luận và sử dụng công cụ xuyên suốt những tác vụ dài hơn.
API của hệ thống cũng có các tính năng hỗ trợ cho tuyên bố này. Grok 4.6 có thể stream những bản tóm tắt quá trình suy luận – tính năng mà Grok 4.5 không cung cấp – và xAI khuyến nghị sử dụng cơ chế nén ngữ cảnh kết hợp với khóa `prompt_cache_key` cố định cho các vòng lặp agent kéo dài. Việc nén giúp rút gọn lịch sử trước đó thành một mục duy nhất, nhưng vẫn tiêu tốn token, và yêu cầu phải nằm trong giới hạn cửa sổ ngữ cảnh trước khi quá trình nén diễn ra.
Phát triển web trực quan và có tính tương tác
Cả SpaceXAI và Cursor đều ghi nhận kết quả tốt hơn ngay từ lần thử đầu tiên đối với các dự án thiên về giao diện trực quan. Trong một thử nghiệm độc lập bên ngoài, Grok 4.6 đã xây dựng lại trang sản phẩm iPod Mini cũ thành một trang web 3D với vòng tròn chọn màu và hiệu ứng cuộn trang hoạt động trơn tru. Bản demo này hoạt động tốt, tuy nhiên một thử nghiệm đơn lẻ chưa đủ để chứng minh cho tuyên bố tổng thể.
Quy trình hậu huấn luyện của Grok 4.6
Nếu bạn chỉ quan tâm đến các chỉ số đánh giá hiệu năng (benchmark) và giá cả, hãy bỏ qua phần này. Phần dưới đây giải thích lý giải của SpaceXAI về nguồn gốc của những cải tiến đạt được.
SpaceXAI đã thực hiện quy trình huấn luyện kỹ lưỡng hơn so với Grok 4.5. Họ sử dụng các ví dụ về suy luận và kỹ thuật do chính AI tạo ra, loại bỏ những ví dụ kém chất lượng thông qua các bước kiểm tra dựa trên mô hình, và sau đó áp dụng học tăng cường cho các lĩnh vực: Lập trình, tác vụ văn phòng, phát triển web, tinh chỉnh kernel và thiết kế máy tính. SpaceXAI cũng cho biết Grok 4.5 đã tạo ra các mẫu huấn luyện mới trên nhiều bối cảnh suy luận và lĩnh vực kiến thức khác nhau. Công ty cho rằng sự cải thiện này đến từ quá trình huấn luyện mở rộng và quy trình chọn lọc dữ liệu nghiêm ngặt hơn, chứ không phải nhờ kiến trúc mới.
Các nhóm nghiên cứu bên ngoài không thể kiểm chứng những chi tiết này, và SpaceXAI cũng chưa cung cấp đủ thông tin để tái lập quy trình huấn luyện. Đây là thông tin do chính công ty đưa ra về những thay đổi đã thực hiện, chứ không phải kết quả đã được bên thứ ba kiểm chứng.
Các chỉ số đánh giá hiệu năng (benchmark) của Grok 4.6: Kết quả chính thức và kết quả độc lập
Bảng dữ liệu công bố của SpaceXAI cho thấy những hạng mục có điểm số tăng lên, tuy nhiên điểm số của các đối thủ cạnh tranh lại được lấy từ "kết quả tốt nhất do chính họ tự công bố hoặc những kết quả có sẵn công khai". Không có một nhóm nghiên cứu duy nhất nào thực hiện chạy thử tất cả các mô hình trong cùng một điều kiện thiết lập. Thông tin về nỗ lực suy luận cũng được đề cập dưới đây vì yếu tố này có ảnh hưởng đến điểm số.
|
Benchmark |
Grok 4.6 (cao) |
Grok 4.5 (cao) |
GPT-5.6 Sol (tối đa) |
Claude Fable 5 (tối đa) |
|---|---|---|---|---|
|
AA Intelligence Index |
61 |
56 |
61 |
62 |
|
GDPVal-AA v2 (Elo) |
1,753 |
1,526 |
1,728 |
1,741 |
|
DeepSWE 1.1 |
65.9% |
54.0% |
73.0% |
70.0% |
|
Terminal-Bench 3.0 |
26.0% |
15.7% |
34.6% |
34.1% |
|
APEX-Agents |
57.5% |
47.1% |
56.7% |
59.2% |
|
CursorBench v3.2 |
69.9% |
66.7% |
67.2% |
70.5% |
Grok 4.6 thể hiện sự vượt trội so với Grok 4.5 trên toàn bộ bảng so sánh. Sol cho thấy khoảng cách lớn nhất ở các bài kiểm tra DeepSWE và Terminal-Bench, trong khi Fable dẫn đầu ở 3 hạng mục. Ngay cả bảng dữ liệu của chính SpaceXAI cũng không chỉ ra một người chiến thắng duy nhất.
So sánh Grok 4.6 với các đối thủ cạnh tranh
Sau khi đã so sánh với phiên bản tiền nhiệm, hãy cùng xem Grok 4.6 thể hiện như thế nào so với các mô hình tiên tiến khác từ OpenAI và Anthropic.
Grok 4.6 so với GPT-5.6 Sol
Kết quả hòa về chỉ số tổng thể che giấu một sự khác biệt rõ rệt. Sol vượt trội hơn Grok 7,1 điểm ở bài kiểm tra DeepSWE và 8,6 điểm ở Terminal-Bench, cho thấy thế mạnh lớn nhất của nó là các tác vụ lập trình đòi hỏi thao tác nhiều trên dòng lệnh (terminal). Trong khi đó, Grok đạt điểm cao hơn ở ba hạng mục tác vụ còn lại.
Các thử nghiệm của chính OpenAI mở rộng kết quả về hiệu suất dòng lệnh sang cả những tác vụ duyệt web và sử dụng máy tính. Dù đây vẫn là dữ liệu do nhà cung cấp tự công bố thay vì một cuộc so sánh có kiểm soát độc lập, chúng đều chỉ ra cùng một xu hướng: Thế mạnh của Sol nằm ở các công việc phụ thuộc vào dòng lệnh, trình duyệt hoặc việc gọi công cụ nhiều lần.
OpenAI cũng đã giới thiệu trước chế độ "Ultrafast" (siêu nhanh) cho Sol, với tốc độ được cho là nhanh gấp 14 lần. Do chưa có giá niêm yết chính thức, chế độ này không được đưa vào phần so sánh chi phí.
Grok 4.6 có mức giá khởi điểm là 2 USD cho mỗi triệu token đầu vào (input) và 6 USD cho mỗi triệu token đầu ra (output). Mức giá tiêu chuẩn của Sol là 5 USD cho đầu vào và 30 USD cho đầu ra – cao gấp 5 lần giá đầu ra của Grok. Khi vượt ngưỡng 272.000 token, Sol sẽ tăng gấp đôi giá đầu vào và nâng giá đầu ra lên 45 USD.
Tuy nhiên, điều này không có nghĩa là mọi tác vụ của Grok đều rẻ hơn gấp 5 lần. Chi phí cuối cùng còn phụ thuộc vào lượng token dùng cho suy luận, tỷ lệ dùng đến cache và số lượt tương tác. Lợi thế về giá của Grok thể hiện rõ nhất khi lượng token sử dụng có thể dự đoán được. Đối với các công việc đòi hỏi thao tác nhiều trên dòng lệnh, điểm số benchmark cao hơn của Sol có thể quan trọng hơn so với chênh lệch về giá niêm yết.
Grok 4.6 so với Claude Sonnet 5
Cả Sonnet 5 và Grok 4.6 đều có mức giá khởi điểm là 2 USD cho mỗi triệu token đầu vào, giúp việc so sánh giá trở nên dễ dàng. Sonnet 5 có cửa sổ ngữ cảnh mặc định là 1 triệu token – gấp đôi mức 500.000 token của Grok – và không áp dụng mức giá cao hơn cho các câu lệnh (prompt) dài. Chi phí đầu ra của Sonnet 5 là 10 USD mỗi triệu token, so với mức 6 USD của Grok. Hai ngày trước khi Grok 4.6 ra mắt, Anthropic đã quyết định giữ nguyên mức giá 2 USD/10 USD thay vì tăng lên mức 3 USD/15 USD như dự kiến ban đầu. Chi tiết này rất quan trọng khi so sánh với các bảng giá cũ.
Trên bảng xếp hạng của Artificial Analysis, Sonnet 5 đạt 55 điểm ở mức hiệu năng tối đa, thấp hơn Grok 4.6 đạt 6 điểm. Mô hình này sử dụng 300 triệu token đầu ra cho các bài kiểm tra (so với 72 triệu của Grok), dẫn đến chi phí mỗi tác vụ là 1,72 USD. Tokenizer của nó tạo ra lượng token nhiều hơn khoảng 30% so với Sonnet 4.6 khi xử lý cùng một văn bản. Điều này khiến việc so sánh giá giữa hai phiên bản Sonnet trở nên phức tạp hơn. Ngoài ra, Sonnet 5 cũng không phải là mô hình mạnh nhất của Anthropic.
Grok 4.6 so với Claude Opus 5 và Fable 5
Opus 5, với mức giá 5 USD cho đầu vào và 25 USD cho đầu ra, đứng đầu bảng xếp hạng với 63 điểm. Fable 5, với mức giá 10 USD cho đầu vào và 50 USD cho đầu ra, đạt 62 điểm. Điểm số của Fable cũng cần được lưu ý kỹ: Artificial Analysis ghi nhận các cơ chế dự phòng an toàn khi xử lý một số câu lệnh (prompt) phức tạp, do đó điểm số phản ánh hiệu năng thực tế khi người dùng sử dụng mô hình, chứ không phải phiên bản không bị giới hạn vốn không được Anthropic cung cấp.
Trong bài kiểm tra AA-Briefcase của Artificial Analysis dành cho các tác vụ agent dài hơi, Grok 4.6 hoàn thành trong khoảng 53 lượt tương tác và sử dụng 0,5 tỷ token đầu vào. Trong khi đó, Opus 5 cần khoảng 103 lượt và 2 tỷ token. Kết quả này không chứng minh Grok là mô hình mạnh hơn xét về tổng thể; nó chỉ cho thấy Grok sử dụng ít bước và ít token đầu vào hơn trong bộ kiểm tra cụ thể này, trong khi Claude lại chiếm ưu thế ở các bài kiểm tra khác đã đề cập ở trên.
Giá của Grok 4.6
Ngưỡng 200.000 token cho câu lệnh (prompt) là điểm cần đặc biệt lưu ý: Nó khiến toàn bộ token trong yêu cầu bị tính theo mức giá cao hơn. Bảng giá cũng bao gồm các khoản phí cho quyền ưu tiên và việc sử dụng công cụ.
|
Mục |
Giá |
|
Token đầu vào, prompt dưới 200 nghìn token |
$2.00 / triệu |
|
Dữ liệu đầu vào đã lưu cache, độ dài prompt dưới 200K |
$0.50 / triệu |
|
Token đầu ra, với prompt dưới 200 nghìn token |
$6.00 / triệu |
|
Đầu vào / đã lưu cache / đầu ra (với prompt hơn 200.000 token) |
$4.00 / $1.00 / $12.00 |
|
Xử lý nhanh hoặc ưu tiên |
Gấp đôi mức giá tiêu chuẩn |
|
Tìm kiếm web, tìm kiếm trên X, thực thi code |
$5 trên mỗi 1.000 lần gọi |
Chi phí sử dụng công cụ được tính riêng biệt với chi phí sử dụng token. Một yêu cầu vừa tìm kiếm trên web vừa chạy code có thể phát sinh phí cho cả hai công cụ trước khi văn bản phản hồi cuối cùng được tính tiền. Không có tên mô hình riêng biệt nào là "grok-4.6-fast". API trực tiếp có tùy chọn ưu tiên với mức phí gấp đôi (2x) khi phản hồi xác nhận việc sử dụng chế độ ưu tiên. Cursor hiển thị một tùy chọn riêng là "Grok 4.6 (Fast)" với cùng mức phí gấp đôi này.
Làm thế nào để truy cập Grok 4.6?
Grok 4.6 có sẵn thông qua các kênh chính thức của nhà cung cấp:
- SpaceXAI API
- Cursor
- Grok Build
- Các gateway của bên thứ ba (OpenRouter, Vercel, Cloudflare, Google Cloud Vertex AI)
- Các công cụ lập trình khác (GitHub Copilot, VS Code, JetBrains, Xcode và Eclipse)
Việc triển khai áp dụng cho các gói Pro, Pro+, Max, Business và Enterprise. Quản trị viên của gói Business và Enterprise cần kích hoạt mô hình này vì nó bị tắt theo mặc định. Grok 4.6 không được hỗ trợ trên Batch API của SpaceXAI, do đó không có tùy chọn xử lý hàng loạt với mức giá ưu đãi.
Có một chi tiết dành cho doanh nghiệp nằm ngoài phạm vi khả dụng của mô hình. Theo mặc định, các phản hồi có tính duy trì trạng thái và SpaceXAI cho biết lịch sử phản hồi được lưu trữ trong 30 ngày. Với chế độ Zero Data Retention (ZDR), các nhóm không thể sử dụng chuỗi phản hồi đã lưu hoặc tính năng hoàn thiện phản hồi bị trì hoãn; thay vào đó, xAI khuyến nghị sử dụng tính năng phát lại suy luận đã mã hóa và phản hồi qua WebSocket. Mỗi phản hồi đều bao gồm một phần tiêu đề cho biết liệu chế độ ZDR có đang được kích hoạt hay không.
Khi nào nên sử dụng Grok 4.6?
Grok 4.6 phù hợp với các công việc mà giá API và các tác vụ agent kéo dài quan trọng hơn độ trễ phản hồi token đầu tiên. Nó ít phù hợp hơn khi điểm số Terminal cao hơn của Sol hoặc cửa sổ ngữ cảnh lớn hơn của Sonnet 5 đáp ứng tốt hơn yêu cầu của tác vụ.
Grok 4.6 là lựa chọn phù hợp khi:
- Giá API là yếu tố hạn chế chính. Nó có mức giá niêm yết và chi phí trên mỗi tác vụ thấp hơn so với Sol, Opus 5 và Fable 5.
Công việc diễn ra dưới dạng các tác vụ agent dài hơi, gồm nhiều bước, nơi hiệu suất theo lượt (ít lượt tương tác và ít token đầu vào hơn so với Opus 5 trong bài kiểm tra AA-Briefcase) mang lại lợi ích. - Tác vụ liên quan đến công việc tri thức hoặc suy luận pháp lý, lĩnh vực mà nó đang dẫn đầu bảng xếp hạng.
- Độ trễ token đầu tiên không phải là vấn đề quan trọng. Khởi động chậm chỉ là yếu tố nhỏ trong quá trình xử lý dài hơi, so với trải nghiệm tổng thể trong cuộc trò chuyện tương tác.
Có thể có những lựa chọn thay thế tốt hơn khi:
- Công việc đòi hỏi nhiều thao tác lập trình trên terminal → GPT-5.6 Sol (điểm DeepSWE và Terminal-Bench cao hơn).
- Tác vụ cần cửa sổ ngữ cảnh lớn → Claude Sonnet 5 (ngữ cảnh 1 triệu token, không tính thêm phí cho prompt dài).
- Bạn muốn độ trễ thấp nhất cho nhu cầu tương tác → Gemini 3.7 Flash.
- Bạn ưu tiên trí tuệ nhân tạo ở mức cao nhất → Opus 5 (63) hoặc Fable 5 (62) đang dẫn đầu chỉ số đánh giá.
Đánh giá chung về Grok 4.6
Grok 4.6 nằm ở một vị trí trung gian khá lấp lửng. Nó tăng 5 điểm trên chỉ số đánh giá và có giá niêm yết thấp hơn Sol và Opus 5, nhưng lại khởi động chậm hơn và tốn kém hơn cho mỗi tác vụ được đo lường so với Grok 4.5. Nhận định "giá không đổi, mô hình tốt hơn" chưa phản ánh đầy đủ bản chất của đợt phát hành này.
Điều nhiều người vẫn muốn thấy là một quy trình vận hành kéo dài hàng giờ, nơi codebase, công cụ và hướng dẫn liên tục thay đổi. Cursor và GitHub Copilot hiện đã cung cấp môi trường như vậy. Nếu tỷ lệ sửa lỗi và thất bại vẫn ở mức thấp trong môi trường đó, thì tuyên bố về khả năng huấn luyện agent sẽ có bằng chứng xác thực hơn là chỉ dựa vào các bài kiểm tra cố định; nếu không, mức tăng 5 điểm kia cũng chỉ dừng lại ở con số đó mà thôi.
Bạn nên đọc
-
So sánh Grok 4.5 và GPT-5.6 Sol: Chi phí, tốc độ và hiệu năng Agentic Coding
-
Lý do nhiều người vẫn sử dụng Grok thay vì ChatGPT hay Claude
-
Grok là gì? Tìm hiểu về chatbot AI từ xAI
-
Cách dùng Grok Automation tự động hóa nghiên cứu hàng ngày
-
Tìm hiểu về Grok Bot: Trợ lý Multi-Agent của xAI
-
Hướng dẫn sử dụng Grok AI dành cho người mới bắt đầu
-
So sánh Grok 4.5 và Claude Opus 4.8: Chi phí, tốc độ và kết quả lập trình thực tế
-
Hướng dẫn toàn diện về các phương pháp sử dụng Grok hay nhất
Theo Nghị định 147/2024/ND-CP, bạn cần xác thực tài khoản trước khi sử dụng tính năng này. Chúng tôi sẽ gửi mã xác thực qua SMS hoặc Zalo tới số điện thoại mà bạn nhập dưới đây:
Hướng dẫn AI
AI Tools
Học IT
Hàm Excel