Cứ mỗi ngày, hàng nghìn tỷ token được xử lý qua lại giữa các nhà phát triển phần mềm và những mô hình ngôn ngữ lớn thông qua OpenRouter, một nền tảng trung gian cho phép lập trình viên gọi cùng lúc hàng chục mô hình AI khác nhau chỉ bằng một đoạn mã duy nhất.
Con số token, đơn vị nhỏ nhất mà một mô hình ngôn ngữ dùng để đọc và sinh ra văn bản, đang trở thành một loại thước đo mới, phản ánh không phải mô hình nào thông minh nhất, mà mô hình nào đang thực sự được thế giới lập trình lựa chọn để vận hành sản phẩm của họ.
Nhìn vào bảng xếp hạng theo từng khung thời gian khác nhau, cho đến nhóm đang tăng trưởng nhanh nhất, một bức tranh thú vị dần hiện ra. Nó không đơn giản là câu chuyện mô hình nào tốt hơn mô hình nào, mà là câu chuyện về cách thế giới công nghệ đang thực sự dùng AI, đằng sau những con số hàng nghìn tỷ token ấy là gì, và vì sao có những cái tên ít được nhắc đến trên truyền thông đại chúng lại đang âm thầm dẫn đầu về khối lượng xử lý.
Như ở dưới hình này bạn có thể thấy, chỉ trong vòng một ngày, mô hình V4 Flash 0731 của công ty Trung Quốc DeepSeek đã xử lý khoảng 1,44 nghìn tỷ token, tăng 14% so với trước đó, đứng đầu toàn bộ bảng xếp hạng. Xếp ngay sau là Hy3 của Tencent với 949 tỷ token, tiếp theo là Gemini 3.6 Flash của Google với 909 tỷ token, tăng tới 22%. DeepSeek tiếp tục góp mặt ở vị trí thứ tư với phiên bản Flash 0423, đạt 870 tỷ token.

Điều đáng chú ý không nằm ở việc DeepSeek dẫn đầu, mà nằm ở việc vì sao một mô hình đến từ một công ty vốn ít được nhắc tên trên các mặt báo công nghệ phương Tây lại có thể xử lý khối lượng dữ liệu khổng lồ đến vậy, vượt xa cả những cái tên quen thuộc như Claude của Anthropic hay ChatGPT của OpenAI. Câu trả lời nằm ở công việc thực tế của các nhà phát triển phần mềm, những người xây dựng ứng dụng, chatbot, hệ thống tự động hóa, hay các sản phẩm AI thương mại khác.
Dòng mô hình mang tên Flash, hay các biến thể tốc độ cao tương tự, thường được thiết kế để xử lý nhanh, chi phí thấp trên mỗi token, phù hợp cho những tác vụ cần lặp lại hàng triệu lần mỗi ngày, chẳng hạn tóm tắt văn bản hàng loạt, phân loại nội dung, hay trả lời các câu hỏi đơn giản trong một chatbot chăm sóc khách hàng.
Khi một nhà phát triển xây dựng một sản phẩm cần gọi mô hình AI hàng triệu lượt mỗi ngày, khoản chênh lệch chi phí dù chỉ vài phần nghìn đô la trên mỗi nghìn token cũng cộng dồn thành một con số khổng lồ theo thời gian. Đây chính là lý do vì sao những mô hình có giá rẻ và tốc độ nhanh lại chiếm ưu thế tuyệt đối về khối lượng token, dù chúng chưa chắc là mô hình có năng lực suy luận mạnh nhất trên thị trường.
Ở một góc nhìn khác, câu hỏi đặt ra là vì sao Claude Opus 5 của Anthropic, một trong những mô hình được giới chuyên môn đánh giá cao về khả năng suy luận và viết mã, lại chỉ đứng ở vị trí thứ mười ba trong ngày, với 191 tỷ token, thấp hơn nhiều lần so với nhóm dẫn đầu. Câu trả lời không nằm ở chất lượng, mà nằm ở cách các mô hình thuộc phân khúc cao cấp được sử dụng.
Các mô hình như Opus thường có chi phí trên mỗi token cao hơn đáng kể, nên phần lớn nhà phát triển chỉ gọi đến chúng cho những tác vụ thực sự đòi hỏi độ chính xác cao, chẳng hạn phân tích dữ liệu phức tạp, viết mã cho hệ thống quan trọng, hay xử lý các yêu cầu cần suy luận nhiều bước. Số lượng token vì thế thấp hơn hẳn so với nhóm mô hình giá rẻ, dù giá trị công việc mà mỗi token đó tạo ra có thể lớn hơn nhiều lần.

Những cú nhảy vọt bất thường
Chuyển sang khung thời gian một tuần, bức tranh trở nên phức tạp hơn với những biến động rất lớn. DeepSeek V4 Flash 0423 dẫn đầu với 6,31 nghìn tỷ token, nhưng đã giảm 17% so với tuần trước. Ngay phía sau, phiên bản Flash 0731 mới hơn của cùng công ty đạt 6,15 nghìn tỷ token, được đánh dấu là mô hình hoàn toàn mới trên bảng xếp hạng.
Điều gây chú ý nhất trong tuần này là mức tăng trưởng 900% của mô hình GPT-5.6 Luna từ OpenAI, đạt 4,15 nghìn tỷ token, và mức tăng 466% của cả Gemini 3.6 Flash lẫn Laguna S 2.1, một mô hình miễn phí đến từ công ty Poolside. Những con số phần trăm tăng trưởng khổng lồ như vậy đặt ra một câu hỏi thực tế rất đáng suy nghĩ: Liệu đây có thực sự là dấu hiệu một mô hình đang bùng nổ về mức độ phổ biến, hay chỉ đơn giản là hệ quả của một điểm khởi đầu quá thấp.

Về mặt logic thống kê, khi một mô hình mới ra mắt hoặc mới được nhiều nhà phát triển biết đến, mức sử dụng ban đầu của nó gần như bằng không. Chỉ cần tăng từ một con số rất nhỏ lên một con số vừa phải, tỷ lệ phần trăm tăng trưởng đã có thể lên tới hàng trăm phần trăm, dù giá trị tuyệt đối vẫn còn khá khiêm tốn so với những mô hình đã ở vị trí dẫn đầu từ trước. Đây là điều mà bất kỳ ai đọc các bảng xếp hạng tăng trưởng đều cần lưu ý, tránh nhầm lẫn giữa tốc độ tăng trưởng phần trăm với quy mô sử dụng thực tế.
Một câu hỏi khác cũng đáng đặt ra: Vì sao một mô hình miễn phí như Laguna S 2.1 lại có thể lọt vào nhóm mười mô hình được xử lý nhiều token nhất trong tuần, đạt tới 1,82 nghìn tỷ token. Việc một mô hình được cung cấp miễn phí trên nền tảng trung gian như OpenRouter tạo ra một động lực rất tự nhiên cho cộng đồng lập trình viên.
Khi không phải trả bất kỳ chi phí nào cho mỗi token xử lý, các nhà phát triển có xu hướng dùng mô hình đó cho những mục đích thử nghiệm quy mô lớn, chạy các tác vụ nền không quan trọng, hoặc dùng làm phương án dự phòng khi mô hình chính gặp sự cố hay đạt giới hạn tốc độ truy vấn. Khối lượng token khổng lồ từ các mô hình miễn phí, vì vậy, không hẳn phản ánh chất lượng vượt trội của mô hình đó, mà phần nhiều phản ánh việc rào cản chi phí bằng không đã mở ra cánh cửa cho việc sử dụng tràn lan hơn.
Nhìn theo tháng: Cuộc đua giữa các gã khổng lồ châu Á
Ở khung thời gian một tháng, bức tranh dẫn đầu lại có một sự thay đổi đáng chú ý. MiMo-V2.5 của Xiaomi vươn lên vị trí số một với 34,1 nghìn tỷ token, tăng 92% so với tháng trước, vượt qua cả DeepSeek V4 Flash 0423 đang đứng ở vị trí thứ hai với 26,3 nghìn tỷ token.
Đáng chú ý hơn, phiên bản miễn phí của Hy3 từ Tencent xếp thứ ba với 18,5 nghìn tỷ token, được ghi nhận mức tăng trưởng vượt quá 999%, một con số gần như không thể diễn giải theo nghĩa thông thường mà chỉ có thể hiểu là mô hình này gần như không được sử dụng trước đó rồi đột ngột bùng nổ trong tháng.

Sự trỗi dậy của các mô hình đến từ Xiaomi, Tencent, DeepSeek, cùng GLM 5.2 của Z.ai ở vị trí thứ tư, cho thấy một xu hướng rõ rệt trong cộng đồng lập trình viên toàn cầu: ngày càng nhiều nhà phát triển lựa chọn các mô hình đến từ Trung Quốc cho khối lượng công việc lớn. Câu hỏi đặt ra ở đây là vì sao lại như vậy, trong khi phần lớn sự chú ý của truyền thông vẫn tập trung vào các công ty Mỹ như OpenAI, Anthropic hay Google.
Lời giải thích hợp lý nhất nằm ở chiến lược giá và tốc độ cải tiến của các công ty này. Nhiều mô hình đến từ Trung Quốc được định giá thấp hơn đáng kể so với các đối thủ phương Tây cho cùng một mức năng lực, đồng thời liên tục tung ra các phiên bản cập nhật với tần suất rất nhanh, thể hiện rõ qua việc DeepSeek có tới ba phiên bản khác nhau cùng góp mặt trong top hai mươi của tháng.
Với những nhà phát triển đang xây dựng sản phẩm cần xử lý khối lượng token khổng lồ mỗi ngày, một sự chênh lệch giá nhỏ trên mỗi nghìn token có thể tạo ra khoản tiết kiệm lên tới hàng trăm nghìn đô la mỗi tháng khi nhân với quy mô sử dụng thực tế, và đây chính là động lực kinh tế thúc đẩy sự dịch chuyển này.
Trong khi đó, các mô hình của Anthropic vẫn góp mặt đều đặn trong tháng, với Claude Opus 4.8 đạt 5,84 nghìn tỷ token ở vị trí thứ mười một, dù giảm 23% so với tháng trước, và Claude Sonnet 5 tăng tới 442% để đạt 4,46 nghìn tỷ token. Sự sụt giảm của phiên bản Opus 4.8 đi kèm mức tăng vọt của Sonnet 5 gợi ý một khả năng rất thực tế: khi Anthropic tung ra một phiên bản mô hình mới, một phần lớn lưu lượng truy vấn từ các nhà phát triển đã chuyển dịch từ phiên bản cũ sang phiên bản mới gần như ngay lập tức, một hành vi khá phổ biến trong cộng đồng lập trình viên vốn luôn muốn dùng phiên bản mới nhất có sẵn.
Nhóm tăng trưởng nhanh nhất: Khi phần trăm có thể đánh lừa người đọc
Chuyển sang danh sách các mô hình có tốc độ tăng trưởng nhanh nhất, đây là nơi các con số phần trăm trở nên đặc biệt cần được nhìn nhận thận trọng. Đứng đầu danh sách này là DeepSeek V4 Flash 0731, được đánh dấu là mô hình hoàn toàn mới, đạt 6,15 nghìn tỷ token. Nhưng ngay phía sau, những cái tên như S2.1 Pro Free của Fish Audio chỉ đạt 7,36 triệu token, hay Codestral Embed 2505 của Mistral AI đạt 12,8 tỷ token, dù đều được ghi nhận mức tăng trưởng vượt quá 999% hoặc hàng trăm phần trăm.
Sự chênh lệch giữa các con số tuyệt đối trong danh sách này, từ vài triệu token cho đến vài nghìn tỷ token, đặt ra câu hỏi cốt lõi: Tại sao lại xếp chung một danh sách những mô hình có quy mô sử dụng khác nhau đến hàng triệu lần như vậy.
Câu trả lời nằm ở bản chất của khái niệm xu hướng tăng trưởng, vốn được tính dựa trên tỷ lệ thay đổi tương đối chứ không phải quy mô tuyệt đối. Một mô hình chuyên biệt như công cụ xếp hạng lại kết quả tìm kiếm rerank-2.5 của Voyage AI, hay các mô hình nhúng văn bản dùng cho tìm kiếm ngữ nghĩa như voyage-4-large, dù có khối lượng token tuyệt đối nhỏ hơn nhiều so với các mô hình trò chuyện tổng quát, vẫn có thể ghi nhận mức tăng trưởng đột biến chỉ vì trước đó gần như không có ai sử dụng đến chúng qua nền tảng này.

Điều này gợi mở một câu hỏi thú vị hơn về bản chất thị trường AI hiện nay: Liệu nhu cầu thực sự đang dịch chuyển từ các mô hình trò chuyện tổng quát sang các mô hình chuyên biệt cho từng tác vụ cụ thể hay không.
Sự xuất hiện đồng thời của nhiều mô hình nhúng văn bản, mô hình xếp hạng lại kết quả, và cả một mô hình chuyển giọng nói thành văn bản chất lượng cao mang tên Speech 2.8 HD của MiniMax, đạt mức tăng 959% dù khối lượng tuyệt đối chỉ 3,11 triệu token, cho thấy các nhà phát triển đang ngày càng phối hợp nhiều loại mô hình chuyên biệt khác nhau trong cùng một sản phẩm, thay vì chỉ dựa vào một mô hình trò chuyện duy nhất để xử lý mọi tác vụ.
Vì sao lượng token khổng lồ không đồng nghĩa với chất lượng vượt trội
Một trong những hiểu lầm phổ biến nhất khi nhìn vào bảng xếp hạng dạng này là mặc định rằng mô hình xử lý nhiều token nhất chính là mô hình tốt nhất. Trên thực tế, khối lượng token phản ánh chính xác hơn cho câu hỏi mô hình nào đang được lựa chọn nhiều nhất cho khối lượng công việc lớn, chứ không trả lời cho câu hỏi mô hình nào có năng lực suy luận, sáng tạo, hay độ chính xác cao nhất.
Hãy thử đặt câu hỏi ngược lại: Vì sao những mô hình được giới chuyên môn và các bài đánh giá kỹ thuật xếp hạng cao về năng lực suy luận, chẳng hạn các phiên bản Opus của Anthropic hay các mô hình suy luận sâu của OpenAI, lại thường xuất hiện ở nửa dưới của bảng xếp hạng token thay vì đứng đầu. Lời giải thích hợp lý nhất nằm ở sự phân hóa rõ rệt giữa hai nhóm nhu cầu sử dụng AI hiện nay.
Một nhóm là nhu cầu xử lý khối lượng lớn với chi phí thấp, phù hợp cho các tác vụ lặp lại, tự động hóa quy mô lớn, hay các sản phẩm phục vụ hàng triệu người dùng cuối. Nhóm còn lại là nhu cầu xử lý chính xác cao cho những tác vụ phức tạp, ít lặp lại, nhưng đòi hỏi chất lượng đầu ra tối đa.

Hai nhóm nhu cầu này tạo ra hai mô hình kinh tế sử dụng hoàn toàn khác nhau. Nhóm xử lý khối lượng lớn sẽ luôn tạo ra số liệu token khổng lồ vì bản chất công việc đòi hỏi tần suất gọi mô hình cực cao. Nhóm xử lý chính xác cao sẽ luôn có số liệu token thấp hơn hẳn vì mỗi lượt gọi mô hình được cân nhắc kỹ lưỡng hơn, chỉ dùng khi thực sự cần thiết. Bảng xếp hạng token, vì vậy, phản ánh trung thực bức tranh thị trường theo khối lượng công việc, nhưng lại không phải là thước đo phù hợp để đánh giá năng lực kỹ thuật thuần túy của một mô hình.
Những câu hỏi thực tế đằng sau mỗi con số
Nhìn xuyên suốt cả bốn khung thời gian, có thể rút ra một số câu hỏi mang tính quy luật mà bất kỳ ai quan tâm đến thị trường AI cũng nên tự đặt ra mỗi khi nhìn vào một bảng xếp hạng dạng này.
Câu hỏi đầu tiên là vì sao một mô hình cụ thể lại xuất hiện ở vị trí đó vào đúng thời điểm đó. Với những mô hình mới ra mắt đột ngột nhảy vào top đầu, khả năng cao là các nhà phát triển đang trong giai đoạn thử nghiệm ồ ạt để đánh giá xem mô hình mới có đáng để chuyển đổi hệ thống sản xuất sang hay không, một hành vi tạo ra lượng token tăng vọt trong thời gian ngắn nhưng chưa chắc sẽ duy trì ổn định về sau.
Câu hỏi thứ hai là vì sao có sự chênh lệch lớn giữa thứ hạng trong ngày, trong tuần và trong tháng của cùng một mô hình. Sự khác biệt này thường phản ánh tốc độ mà cộng đồng lập trình viên phản ứng với các đợt cập nhật giá hoặc năng lực mới. Một mô hình có thể đứng đầu trong ngày nhờ một đợt giảm giá tạm thời hoặc một tính năng mới vừa ra mắt, nhưng khi tính trung bình theo tháng, vị trí của nó có thể tụt xuống đáng kể nếu xu hướng đó không được duy trì.

Câu hỏi thứ ba, có lẽ là quan trọng nhất là lượng token sử dụng như vậy đến từ đâu. Phần lớn khối lượng token khổng lồ trên các nền tảng trung gian như OpenRouter không đến từ người dùng cá nhân gõ từng câu hỏi một trong khung chat, mà đến từ các hệ thống tự động, các sản phẩm phần mềm đã được lập trình sẵn để gọi mô hình AI hàng triệu lần mỗi ngày mà không cần con người can thiệp trực tiếp. Một chatbot chăm sóc khách hàng của một doanh nghiệp thương mại điện tử, một hệ thống tự động tóm tắt tài liệu nội bộ, hay một công cụ kiểm duyệt nội dung tự động, đều có thể tạo ra khối lượng token lớn hơn rất nhiều lần so với việc hàng nghìn cá nhân sử dụng mô hình đó để trò chuyện trực tiếp.
Bức tranh toàn cảnh: Thị trường AI đang được định hình bởi ai
Khi ghép lại toàn bộ bốn khung thời gian mà ta có được ở trên, có thể thấy một xu hướng nhất quán: nhóm mô hình dẫn đầu về khối lượng token gần như luôn thuộc về các phiên bản tốc độ cao, chi phí thấp, đến từ một nhóm nhỏ các công ty công nghệ lớn của châu Á, đặc biệt là Trung Quốc, cùng với sự góp mặt thường xuyên của Google thông qua dòng Gemini Flash.
Trong khi đó, các mô hình cao cấp, đắt tiền hơn của Anthropic và OpenAI vẫn duy trì một vị trí ổn định nhưng không chiếm ưu thế tuyệt đối về khối lượng, phản ánh đúng vai trò của chúng trong hệ sinh thái: được lựa chọn cho những tác vụ đòi hỏi chất lượng cao thay vì khối lượng lớn.
Điều này đặt ra một câu hỏi lớn hơn cho toàn ngành: Liệu cuộc đua thực sự đang định hình thị trường AI có phải là cuộc đua về năng lực suy luận đỉnh cao, như phần lớn truyền thông vẫn tập trung đưa tin, hay thực chất là cuộc đua về ai có thể cung cấp năng lực đủ dùng với chi phí thấp nhất cho khối lượng công việc khổng lồ mà thế giới phần mềm đang cần mỗi ngày. Dựa trên những con số token thực tế từ OpenRouter, câu trả lời có thể nghiêng nhiều hơn về vế thứ hai, ít nhất là xét trên góc độ khối lượng sử dụng công nghiệp.
Với người dùng phổ thông theo dõi tin tức AI, bài học rút ra có lẽ là cần phân biệt rõ giữa hai loại bảng xếp hạng khác nhau: một bên là các bài đánh giá năng lực kỹ thuật thuần túy, đo lường mô hình nào giỏi nhất trong việc giải toán, viết mã, hay lập luận logic, và một bên là các bảng xếp hạng khối lượng sử dụng thực tế như của OpenRouter, đo lường mô hình nào đang thực sự gánh vác phần lớn khối lượng công việc của ngành công nghiệp phần mềm toàn cầu. Hai loại bảng xếp hạng này thường không trùng khớp nhau, và chính sự khác biệt đó mới là điều đáng để người theo dõi ngành công nghệ suy ngẫm nhiều nhất, thay vì chỉ nhìn vào vị trí số một trên bất kỳ một bảng xếp hạng đơn lẻ nào.
Hướng dẫn AI
AI Tools
Học IT
AI
Hàm Excel