Tìm hiểu về GLM-5.3 Flash: Mô hình đa phương thức của Z.ai với mức giá chỉ bằng 1/10

Z.ai đã ra mắt GLM-5.3 Flash vào ngày 26 tháng 8 năm 2026 - mô hình đa phương thức (multimodal) nguyên bản đầu tiên trong dòng GLM-5, được phát hành theo giấy phép MIT với cửa sổ ngữ cảnh 1 triệu token (theo Z.ai trên X). Đây là mô hình có quy mô 320 tỷ tham số tổng thể và 18 tỷ tham số hoạt động (320B-A18B); Z.ai cho biết mô hình này vượt trội hơn GLM-5.2 trong các bài kiểm tra về lập trình và tác vụ agent với mức chi phí chỉ bằng khoảng 1/10. Dưới đây là những điểm mới thực sự, các chỉ số đánh giá quan trọng đối với tác vụ agent, chi phí và sự khác biệt so với GLM-5.3.

GLM-5.3 Flash là gì?

GLM-5.3 Flash là mô hình Mixture-of-Experts - MoE với tổng cộng 320 tỷ tham số và 18 tỷ tham số hoạt động trên mỗi token (theo TestingCatalog). Z.ai định vị đây là phiên bản có chi phí thấp hơn và hiệu suất cao hơn trong dòng GLM-5: mang lại hiệu năng mạnh mẽ về lập trình và khả năng thực hiện tác vụ agent, nhưng được thiết kế để vận hành với chi phí thấp và phản hồi nhanh chóng.

Có hai yếu tố khiến nó trở nên khác biệt so với các phiên bản GLM trước đó. Đây là mô hình đa phương thức nguyên bản đầu tiên trong dòng sản phẩm - khả năng xử lý hình ảnh được tích hợp ngay từ quá trình huấn luyện chứ không phải được thêm vào sau - và nó được phát hành theo giấy phép MIT với trọng số mở trên Hugging Face. Nếu cái tên "Ox Alpha" nghe có vẻ quen thuộc, thì đó là vì đây chính là cùng một mô hình: Nó đã hoạt động ẩn danh dưới tên ox-alpha trên OpenCode và OpenRouter trong khoảng một tuần trước khi được công bố chính thức.

Kiến trúc hybrid: Cơ chế attention tiết kiệm chi phí hơn ở mức 1 triệu token

Câu chuyện về hiệu suất bắt đầu từ thiết kế cơ chế attention. Theo Z.ai, GLM-5.3 Flash là mô hình tiên phong mã nguồn mở đầu tiên kết hợp cơ chế Sparse attention (chú ý thưa) và Linear attention (chú ý tuyến tính) trong một kiến trúc hybrid - chú ý tuyến tính dành cho các dependency cục bộ, còn chú ý thưa dành cho ngữ cảnh toàn cục có liên quan (theo tài liệu của Z.ai).

Kết quả mang lại rất rõ rệt. So với GLM-5.3, Z.ai báo cáo mức tiêu thụ tài nguyên tính toán cho cơ chế attention giảm khoảng 3 lầnKV cache nhỏ hơn 4,4 lần (theo TestingCatalog). Với độ dài ngữ cảnh lên tới 1 triệu token, một thành phần được Z.ai gọi là IndexPool sẽ nén các nhóm indexer key vector để giảm thiểu độ trễ và mức sử dụng bộ nhớ. Chính điều này giúp cửa sổ ngữ cảnh 1 triệu token thực sự hữu dụng trong thực tế chứ không chỉ là con số trên bảng thông số kỹ thuật - các agent hoạt động trong phạm vi dài hạn có thể duy trì nhiều ngữ cảnh hơn mà không làm chi phí tăng vọt.

Mô hình được huấn luyện trên một tập dữ liệu đa phương thức khổng lồ với 30 nghìn tỷ token. Z.ai cho biết họ bắt đầu từ một mô hình nền tảng hoàn toàn mới thay vì tái sử dụng nền tảng của GLM-5.2 - một sự thay đổi so với quy trình của GLM-5.3 (vốn tái sử dụng nền tảng GLM-5.2 và chỉ mở rộng quy mô ở giai đoạn hậu huấn luyện).

Kết quả đánh giá hiệu năng (benchmark) của GLM-5.3 Flash

Tất cả các số liệu dưới đây đều do nhà cung cấp công bố hoặc từ các đơn vị theo dõi độc lập; do sự khác biệt về công cụ và thiết lập thử nghiệm, những con số này nên được xem là chỉ dấu về xu hướng thay vì kết quả so sánh đối đầu trực tiếp.

Ở các bài kiểm tra về lập trình và khả năng vận hành agent so với GLM-5.2, mức độ cải thiện là rất lớn chứ không chỉ là những bước tiến nhỏ (theo OfficeChai):

  • DeepSWE v1.1: 46,2 → 63,4
  • AutomationBench: 26,2 → 48,8 (gần gấp đôi)
  • Terminal-Bench 2.1: 84,3 - vượt qua DeepSeek-V4-Vision-Exp và bám đuổi sát sao mức 85,0 của Claude Opus 4.8.

Trong cùng bài kiểm tra Terminal-Bench, GPT-5.6 Terra (87,4) và Gemini 3.7 Flash (85,8) vẫn dẫn trước đôi chút, nhưng khoảng cách đã thu hẹp đáng kể so với vị trí của GLM-5.2 trước đó. Với bài kiểm tra nội bộ Code Bench v1.0 của Z.ai - chạy trên nền tảng Claude Code - GLM-5.3 Flash đạt mức tối đa 29,0 điểm, so với 29,5 điểm của Opus 4.8. Công ty coi đây là bằng chứng cho thấy mô hình thuộc phân khúc "flash" (tốc độ cao/chi phí thấp) của họ giờ đây có thể cạnh tranh ngang ngửa với những mô hình tiên phong trong lĩnh vực lập trình.

Trên bảng xếp hạng độc lập Artificial Analysis Intelligence Index, GLM-5.3 Flash đạt 57 điểm - cao hơn nhiều so với mức trung vị của các mô hình suy luận trong cùng phân khúc giá. Một lưu ý khách quan: Các bài kiểm tra nội bộ như Code Bench không thể được tái lập bởi bên thứ ba, và mô hình này cũng không tuyên bố vượt qua GPT-5.6 Sol hay Fable 5 trong các bộ bài kiểm tra công khai khó nhất. Đây là giải pháp mang lại giá trị thực tiễn cao, thay vì chỉ tập trung vào việc đứng đầu bảng xếp hạng hiệu năng.

Khả năng đa phương thức tích hợp sẵn: Xử lý hình ảnh ngay trong quy trình lập trình

Khả năng đa phương thức không phải là một tính năng tách biệt - nó được tích hợp sâu vào cơ chế hoạt động của mô hình. Z.ai đã huấn luyện GLM-5.3 Flash để quan sát các giao diện đã được kết xuất, diễn biến game và kết quả đầu ra 3D, sau đó tự đánh giá và chỉnh sửa công việc của chính mình dựa trên các phản hồi trực quan đó (theo TestingCatalog).

Quy trình "quan sát kết quả rồi sửa lỗi" này đặc biệt quan trọng đối với các AI agent chuyên xây dựng giao diện người dùng (UI) hoặc bảng điều khiển (dashboard): Mô hình có thể nhìn thấy trang web đã dựng, nhận ra lỗi sai và thực hiện các bước chỉnh sửa lặp lại. Phương pháp này không chỉ áp dụng cho code mà còn mở rộng sang tài liệu, bảng tính, bài thuyết trình và tài liệu cuộc họp - cho phép mô hình tư duy dựa trên sự kết hợp giữa văn bản, hình ảnh và cấu trúc dữ liệu, từ đó tạo ra các file hoàn chỉnh ở định dạng PPTX, PDF, DOCX và XLSX (theo tài liệu Z.ai).

Chi phí sử dụng GLM-5.3 Flash là bao nhiêu?

Mức giá là điểm nhấn đáng chú ý. Giá API tiêu chuẩn của Z.ai là 0,15 USD cho mỗi 1 triệu token đầu vào và 0,50 USD cho mỗi 1 triệu token đầu ra, với mức giá 0,03 USD cho dữ liệu đầu vào được lưu trong cache (theo tuyên bố của Z.ai trên X). Các nhà cung cấp bên thứ ba thậm chí còn đưa ra mức giá thấp hơn - OpenRouter niêm yết mức 0,075 USD cho đầu vào và 0,25 USD cho đầu ra (theo OpenRouter).

Đối với người đăng ký gói GLM Coding, mô hình này đã được triển khai với hạn mức sử dụng gấp 3 lần so với GLM-5.3 (TestingCatalog). Đây chính là sự khác biệt thực tiễn so với các gói dịch vụ đắt tiền hơn: Bạn có thể vận hành các quy trình agent loop kéo dài mà không cần lo lắng về việc tiêu tốn hạn mức token.

So sánh GLM-5.3 Flash và GLM-5.3

Chúng được thiết kế cho các mục đích khác nhau. GLM-5.3 là mô hình lập trình chú trọng vào khả năng tư duy - mô hình từng phát triển kỹ năng an ninh mạng ngoài dự kiến ​​và có các trọng số được chuẩn bị sẵn sàng cho quy trình đánh giá an toàn. Trong khi đó, GLM-5.3 Flash là phiên bản hiệu quả cao, hỗ trợ đa phương thức, sử dụng giấy phép MIT và được thiết kế để vận hành với chi phí thấp ở quy mô lớn.

So sánh nhanh:

  • Phương thức (Modality): GLM-5.3 tập trung vào văn bản; GLM-5.3 Flash là mô hình đa phương thức (multimodal) ngay từ cốt lõi.
  • Kiến trúc: GLM-5.3 tái sử dụng nền tảng của GLM-5.2; GLM-5.3 Flash sử dụng nền tảng được huấn luyện mới với cơ chế attention hybrid giữa dạng thưa (sparse) và tuyến tính (linear).
  • Hiệu suất: GLM-5.3 Flash tiêu tốn ít tài nguyên tính toán cho cơ chế attention hơn khoảng 3 lần và có KV cache nhỏ hơn 4,4 lần so với GLM-5.3.
  • Giấy phép và trọng số: GLM-5.3 Flash được phát hành với giấy phép MIT và công khai trọng số ngay từ ngày đầu; trong khi trọng số của GLM-5.3 được phát hành theo từng giai đoạn.
  • Chi phí: GLM-5.3 Flash có mức giá tối ưu cho quy mô lớn - chỉ bằng khoảng 1/10 chi phí của GLM-5.2 (theo Z.ai).

Nếu bạn cần khả năng suy luận chuyên sâu cho các vấn đề phức tạp, GLM-5.3 là lựa chọn phù hợp. Nếu bạn đang vận hành các AI agent đa phương thức hoặc hoạt động trong thời gian dài mà chi phí trên mỗi tác vụ quyết định tính khả thi của quy trình làm việc, thì GLM-5.3 Flash là lựa chọn đáng để thử nghiệm.

Ý nghĩa của GLM-5.3 Flash đối với việc xây dựng AI agent

Một số điểm lưu ý thực tế:

  • Đây là giải pháp tối ưu chi phí cho các AI agent hoạt động liên tục. Với mức giá 0,075 - 0,15 USD cho mỗi 1 triệu token đầu vào cùng cửa sổ ngữ cảnh thực tế lên tới 1 triệu token, GLM-5.3 Flash giúp các agent loop hoạt động dài hạn trở nên khả thi về mặt chi phí - điều mà các mô hình tiên phong hiện nay chưa làm được.
  • Khả năng đa phương thức thay đổi những gì agent có thể kiểm chứng. Một mô hình có thể "nhìn" thấy giao diện đã được hiển thị và chỉnh sửa nó sẽ giúp hoàn thiện quy trình khép kín mà các agent chỉ xử lý văn bản không thể thực hiện được - rất hữu ích cho các công việc liên quan đến giao diện người dùng (UI), dashboard và tài liệu.
  • Giấy phép MIT giúp loại bỏ các rào cản. Việc công khai trọng số dưới một giấy phép cởi mở cho phép các nhóm chịu ràng buộc về quy định lưu trữ dữ liệu hoặc quy trình đánh giá nhà cung cấp có thể tự triển khai mô hình (self-host) ngay từ ngày đầu; khả năng triển khai cục bộ hỗ trợ các công cụ như SGLang, vLLM và TokenSpeed.
  • Hãy coi các kết quả đánh giá nội bộ (benchmark) chỉ là điểm khởi đầu. Các số liệu về Code Bench là dữ liệu mới và chưa được công bố rộng rãi trước đó. Việc kiểm thử độc lập chỉ mới bắt đầu khi trọng số mô hình đã được phát hành.

Triển khai các mô hình như GLM-5.3 Flash trong hệ thống riêng

GLM-5.3 Flash được thiết kế chuyên biệt cho kiểu quy trình làm việc như những agent loop đa phương thức, chi phí thấp và có phạm vi thực hiện dài hơi, hoạt động xuyên suốt từ đầu đến cuối thay vì chỉ phản hồi một câu lệnh đơn lẻ. Đây là mô hình GLM-5 đa phương thức nguyên bản đầu tiên - 320B-A18B, sử dụng giấy phép MIT, hỗ trợ ngữ cảnh 1 triệu token và có mức chi phí phù hợp để vận hành các agent suốt cả ngày.

Thứ Năm, 27/08/2026 10:19
51 👨
Xác thực tài khoản!

Theo Nghị định 147/2024/ND-CP, bạn cần xác thực tài khoản trước khi sử dụng tính năng này. Chúng tôi sẽ gửi mã xác thực qua SMS hoặc Zalo tới số điện thoại mà bạn nhập dưới đây:

Số điện thoại chưa đúng định dạng!
Số điện thoại này đã được xác thực!
Bạn có thể dùng Sđt này đăng nhập tại đây!
Lỗi gửi SMS, liên hệ Admin
0 Bình luận
Sắp xếp theo
❖ AI cho Lập trình