Giới thiệu Muse Glimmer: Mô hình agentic mở chạy ngay trên thiết bị của người dùng

Meta đã giới thiệu Muse Glimmer – mô hình tiếp theo từ Meta Superintelligence Labs – và phát hành mã nguồn mở cho trọng số mô hình theo giấy phép Apache 2.0.

Muse Glimmer là gì?

Muse Glimmer là mô hình có 30 tỷ tham số, được tối ưu hóa cho các agent workflow chạy cục bộ và luôn sẵn sàng hoạt động. Mô hình này đủ nhỏ gọn để chạy trên máy Mac hoặc PC chỉ với một GPU phổ thông, mở ra nhiều ứng dụng đa dạng: Từ các agent cục bộ và khả năng gọi hàm đến lập trình cục bộ và đánh giá mô hình bằng LLM-as-a-judge. Muse Glimmer mang lại hiệu suất mạnh mẽ trong các tác vụ agent và những bài kiểm tra benchmark quan trọng, vượt trội so với các mô hình hàng đầu cùng quy mô.

Các mô hình nền tảng đã đạt được những khả năng ấn tượng trong các lĩnh vực như suy luận, tạo code và sử dụng công cụ; tuy nhiên, hầu hết những triển khai thực tế vẫn phụ thuộc vào cơ sở hạ tầng đám mây và kết nối mạng. Việc chạy mô hình cục bộ cho phép bạn sử dụng AI ở bất cứ đâu, bất cứ lúc nào, dù có hay không có kết nối Internet. Giải pháp này ngày càng trở nên khả thi: Cộng đồng mã nguồn mở đã chứng minh rằng các mô hình nhỏ hơn, nếu được huấn luyện hiệu quả, có thể đạt hiệu suất tiệm cận những mô hình tiên tiến nhất đối với các tác vụ cụ thể. Muse Glimmer được tối ưu hóa chính xác cho các trường hợp sử dụng cục bộ này.

Tiếp nối truyền thống lâu dài trong việc chia sẻ các nghiên cứu AI nền tảng, Meta đã phát hành trọng số mở của Muse Glimmer trên Hugging Face, kèm theo tài liệu dành cho nhà phát triển để hỗ trợ bạn bắt đầu xây dựng và vận hành các agent của riêng mình. Muse Glimmer được thiết kế để tương thích với các công cụ mà nhà phát triển đang sử dụng. Các bản tích hợp được tối ưu hóa cho llama.cpp, MLX và ExecuTorch sẽ sớm ra mắt trong thời gian tới, giúp bạn nhanh chóng chuyển từ bước tải xuống sang vận hành agent chỉ trong vài phút.

Quy trình huấn luyện Muse Glimmer

Một agent có khả năng quản lý lịch trình, soạn thảo tin nhắn, sắp xếp file và học hỏi phong cách làm việc của bạn cần có quyền truy cập sâu vào bối cảnh cá nhân. Nó cũng đòi hỏi sự phối hợp nhịp nhàng của nhiều khả năng: Thực thi tác vụ dài hạn, gọi công cụ chính xác, hiểu biết đa phương thức, bộ nhớ ngữ cảnh dài và tuân thủ chỉ dẫn.

Muse Glimmer được thiết kế nhằm cân bằng giữa năng lực xử lý và các hạn chế về bộ nhớ cũng như tài nguyên tính toán của phần cứng cục bộ. Điều này đòi hỏi một kiến ​​trúc tinh gọn, một phương pháp mới lạ giúp chuyển giao khả năng suy luận agent từ một mô hình "giáo viên" lớn hơn nhiều, cùng các tối ưu hóa suy luận - bao gồm cả kỹ thuật lượng tử hóa - để đáp ứng những yêu cầu về độ trễ. Điều này đã được thực hiện qua các giai đoạn sau:

  • Huấn luyện sơ bộ (Pre-Training). Meta huấn luyện Muse Glimmer dựa trên kết quả đầu ra của Muse Spark bằng phương pháp Logit Distillation, đồng thời tận dụng tập hợp dữ liệu tương tự như mô hình "giáo viên".
  • Trong giai đoạn huấn luyện. Meta đã huấn luyện mô hình trên dữ liệu có ngữ cảnh dài hơn, nhiều agent hơn với các dấu vết suy luận phong phú hơn, cùng với dữ liệu tự nhiên.
  • Sau giai đoạn huấn luyện. Meta đã kết hợp tinh chỉnh có giám sát với sự kết hợp giữa chưng cất theo chính sách và học tăng cường trên các lĩnh vực tổng quát, suy luận, lập trình và agent.

Muse Glimmer đã được đánh giá theo các tiêu chuẩn được đặt ra trong Advanced AI Scaling Framework của Meta và được đánh giá để phát hành công khai trên tất cả các hạng mục liên quan.

Khả năng của Muse Glimmer: Được thiết kế cho các agent 

Việc xây dựng các agent hiệu quả đòi hỏi sự phối hợp của nhiều năng lực cốt lõi để đạt được mục tiêu của người dùng. Muse Glimmer được huấn luyện và đánh giá dựa trên các khía cạnh sau:

  • Hoàn thành tác vụ toàn diện. Muse Glimmer đạt tỷ lệ thành công cao trong các bộ tiêu chuẩn đánh giá tác vụ toàn diện như DeepSearch QA, MCP-Atlas, 𝛕-Bench và SWE-Bench; những bài kiểm tra này đo lường khả năng làm việc trong các khung hỗ trợ, viết và sửa lỗi code, cũng như giải quyết những yêu cầu đa lượt từ đầu đến cuối.
  • Sử dụng công cụ đáng tin cậy. Mô hình xử lý đa dạng các lệnh gọi hàm, kích hoạt công cụ với cấu trúc dữ liệu chính xác trong suốt các quy trình làm việc kéo dài.
  • Suy luận đa bước. Muse Glimmer thực hiện chuỗi suy luận dài hạn, duy trì các kế hoạch mạch lạc xuyên suốt những quy trình làm việc phức tạp và kéo dài.
  • Khả năng phục hồi khi gặp lỗi. Khi một lệnh gọi công cụ thất bại hoặc trả về kết quả không mong muốn, mô hình được huấn luyện để chẩn đoán lỗi và thử lại thay vì dừng hoạt động.
  • Đầu vào và suy luận đa phương thức. Thông qua bộ mã hóa nhận thức chuyên dụng, mô hình có thể tiếp nhận dữ liệu văn bản và hình ảnh đan xen. Điều này cho phép các agent hiểu và xử lý ảnh chụp màn hình, biểu đồ và tài liệu song song với nội dung hội thoại.
  • Tương thích với khung hỗ trợ. Muse Glimmer hoạt động hiệu quả với OpenClaw và các mô hình điều phối agent khác.
  • Kiểm soát mức effort. Muse Glimmer hỗ trợ các mức độ suy luận khác nhau, cho phép lựa chọn sự cân bằng hợp lý giữa chất lượng và tốc độ.
  • Đa ngôn ngữ. Muse Glimmer được huấn luyện trên dữ liệu từ hơn 100 ngôn ngữ.

Hiệu suất của Muse Glimmer

Muse Glimmer được đánh giá trên nhiều bộ tiêu chuẩn đa dạng để kiểm tra những năng lực cần thiết cho hoạt động hiệu quả của agent tự hành. So với Gemma4-31B và Qwen3.6-27B, Muse Glimmer thể hiện hiệu suất vượt trội trong cùng phân khúc quy mô trên nhiều bộ tiêu chuẩn đánh giá LLM phổ biến.

Bảng so sánh Muse Glimmer 30B với Gemma4 31B và Qwen3.6 27B dựa trên các tiêu chuẩn đánh giá về agent, lập trình, đa phương thức, độ an toàn và khả năng suy luận
Bảng so sánh Muse Glimmer 30B với Gemma4 31B và Qwen3.6 27B dựa trên các tiêu chuẩn đánh giá về agent, lập trình, đa phương thức, độ an toàn và khả năng suy luận

Tối ưu hóa cho việc triển khai cục bộ

Một agent cục bộ chỉ thực sự hữu ích khi nó đủ nhanh để mang lại cảm giác phản hồi tức thì. Nếu agent mất hàng phút để phản hồi hoặc lên kế hoạch cho bước tiếp theo, luồng công việc thực tế sẽ bị gián đoạn. Meta đã áp dụng hai giải pháp tối ưu hóa để Muse Glimmer vận hành với tốc độ thực tế trên phần cứng phổ thông mà không làm giảm chất lượng.

Đưa mô hình vào thiết bị của bạn

Ở độ chính xác hoàn toàn, một mô hình với 30 tỷ tham số sẽ cần hơn 55 GB bộ nhớ - vượt xa dung lượng của bất kỳ GPU phổ thông nào. Meta sử dụng các kỹ thuật lượng tử hóa để nén trọng số của mô hình xuống mức xấp xỉ 4-bit, qua đó giảm dung lượng mô hình ngôn ngữ xuống dưới 20GB. Việc này tạo ra đủ khoảng trống để mô hình vận hành bộ nhớ làm việc (KV cache), bộ mã hóa nhận thức (để hiểu hình ảnh) và thành phần dự thảo (drafter) cho cơ chế giải mã suy đoán (speculative decoding) cùng hoạt động trong giới hạn 24GB hoặc 32GB bộ nhớ. Quá trình nén này hầu như không làm giảm hiệu suất đối với các tác vụ của agent.

Bảng so sánh giữa độ chính xác đầy đủ, K-Quant-Dynamic và K-Quant-17GB dựa trên mức độ suy giảm độ chính xác và yêu cầu bộ nhớ phần cứng.
Bảng so sánh giữa độ chính xác đầy đủ, K-Quant-Dynamic và K-Quant-17GB dựa trên mức độ suy giảm độ chính xác và yêu cầu bộ nhớ phần cứng.

Tạo văn bản nhanh hơn nhờ giải mã suy đoán

Thông thường, các mô hình ngôn ngữ tạo văn bản theo từng token, điều này có thể gây cảm giác chậm chạp khi thực hiện các chuỗi suy luận dài hoặc gọi công cụ qua nhiều bước. Muse Glimmer được tích hợp một mô hình "drafter" gọn nhẹ dựa trên DFlash - một mạng lưới đồng hành nhỏ có khả năng đề xuất cả một khối token cùng lúc. Sau đó, mô hình chính sẽ xác thực các đề xuất này song song, chấp nhận những token đúng và sửa lại những token sai. Kỹ thuật này cho phép Muse Glimmer tạo văn bản nhanh hơn đáng kể so với phương pháp tạo từng token thông thường mà vẫn đảm bảo chất lượng đầu ra tương đương. Trong bản phát hành này, Meta cung cấp các phiên bản mô hình dự thảo đã được lượng tử hóa để giảm thiểu mức tiêu thụ bộ nhớ.

Kết quả

Mô hình K-Quant-17GB kết hợp với mô hình drafter DFlash đã lượng tử hóa được đo lường kết quả trên các thiết bị MacBook M4-Max, M5-Max và card đồ họa RTX-5090. Mô hình đạt tốc độ đủ nhanh để duy trì cuộc trò chuyện trôi chảy và tương tác với agent theo thời gian thực, tất cả đều diễn ra hoàn toàn trên thiết bị của bạn.

Biểu đồ cột cho thấy cơ chế giải mã suy đoán DFlash giúp tăng tốc độ giải mã của Muse Glimmer lên gấp 3,1 lần trên RTX 5090, 1,8 lần trên M5 Max và 1,5 lần trên M4 Max
Biểu đồ cột cho thấy cơ chế giải mã suy đoán DFlash giúp tăng tốc độ giải mã của Muse Glimmer lên gấp 3,1 lần trên RTX 5090, 1,8 lần trên M5 Max và 1,5 lần trên M4 Max

Bắt đầu với Muse Glimmer ngay hôm nay

Muse Glimmer hiện đã có sẵn và bạn có thể tải xuống các trọng số trên Hugging Face. Trong những ngày tới, bạn có thể chạy mô hình cục bộ thông qua các đối tác như Ollama, LM Studio và Unsloth; triển khai bằng các edge ​​framework như llama.cpp, ExecuTorch và MLX; vận hành ở quy mô lớn với vLLM và SGLang; hoặc bắt đầu nhanh chóng thông qua các đối tác như Together AI, Fireworks AI và OpenRouter. Bạn thậm chí có thể tùy chỉnh mô hình cho trường hợp sử dụng cụ thể của mình bằng cách tận dụng tính năng huấn luyện TorchTitan của PyTorch để tinh chỉnh thêm.

Meta cũng đang hợp tác với các đối tác như AMD, Arm, Dell, Intel và NVIDIA để tối ưu hóa hiệu suất trên nhiều thiết bị. Ngoài ra, công ty còn phát hành tài liệu hướng dẫn để các nhà phát triển có đủ nguồn lực cần thiết nhằm bắt đầu và xây dựng những ứng dụng một cách có trách nhiệm với Muse Glimmer. Tài liệu này bao gồm hướng dẫn thiết lập các khung sườn tùy chỉnh, giúp việc bắt đầu xây dựng và triển khai những agent cá nhân trở nên dễ dàng hơn ngay từ ngày đầu tiên. Bạn có thể tìm hiểu thêm và tiếp cận các tài nguyên phát triển tại AI Developer Center của Meta.

Nỗ lực này tiếp nối truyền thống lâu dài của Meta trong lĩnh vực nghiên cứu AI mã nguồn mở, mở rộng sang mảng Agentic AI và trao cho các nhà phát triển quyền tiếp cận những khả năng vận hành agent ngay trên thiết bị cục bộ. Như thường lệ, Meta luôn hoan nghênh phản hồi từ cộng đồng và rất mong chờ được chứng kiến ​​những sản phẩm mà các nhà phát triển sẽ tạo ra với mô hình mã nguồn mở này.

Thứ Ba, 25/08/2026 10:34
51 👨 41
Xác thực tài khoản!

Theo Nghị định 147/2024/ND-CP, bạn cần xác thực tài khoản trước khi sử dụng tính năng này. Chúng tôi sẽ gửi mã xác thực qua SMS hoặc Zalo tới số điện thoại mà bạn nhập dưới đây:

Số điện thoại chưa đúng định dạng!
Số điện thoại này đã được xác thực!
Bạn có thể dùng Sđt này đăng nhập tại đây!
Lỗi gửi SMS, liên hệ Admin
0 Bình luận
Sắp xếp theo
❖ AI cho người mới