Nếu đã từng dành thời gian thử nghiệm với các mô hình AI cục bộ, chắc chắn bạn cũng đã trải qua chu kỳ tương tự như sau: Bạn tìm thấy một mô hình mới thú vị, khởi động Ollama hoặc Hugging Face, chờ quá trình tải xuống hoàn tất, chỉ để phát hiện ra rằng mô hình mới hoặc xử lý rất chậm, chỉ hai token mỗi giây, hoặc thậm chí không thể chứa vừa trong bộ nhớ.
Đây là lúc LLMFit phát huy tác dụng. Thay vì để bạn phải đoán xem phần cứng của mình có thể xử lý mô hình nào trong khi bạn vò đầu bứt tai nhìn vào các lượng tử hóa và số lượng tham số khác nhau, LLMFit sẽ phân tích hệ thống của bạn và đề xuất các mô hình AI hoạt động tốt. Rất nhiều người dùng AI đám mây đang dần chuyển sang tự host các mô hình AI cục bộ của họ, và nếu bạn là một trong số đó, LLMFit nên là thứ đầu tiên bạn sử dụng để có cái nhìn tổng quan đúng đắn.
LLMFit là gì?
LLMFit loại bỏ phỏng đoán khi chạy các mô hình AI cục bộ. Đây là một công cụ đề xuất nhận biết phần cứng dành cho các mô hình LLM cục bộ.
LLMFit về cơ bản là một công cụ đề xuất cho các mô hình AI cục bộ giúp công việc của bạn dễ dàng hơn rất nhiều, nếu bạn đang bắt đầu với AI tự host. Trước khi bạn cam kết tải xuống một mô hình khổng lồ có dung lượng 10, 15 hoặc 20 GB, nó sẽ tìm hiểu xem phần cứng của bạn có thể xử lý mô hình đó một cách thực tế hay không. Sau khi bạn cài đặt và chạy, LLMFit sẽ đánh giá CPU, GPU, RAM và VRAM khả dụng của bạn trước khi xếp hạng hơn 250 mô hình theo hiệu suất của chúng trên máy tính của bạn.
Điều nổi bật ở đây là điểm "Fit", kết hợp tốc độ, độ dài ngữ cảnh và chất lượng để chấm điểm một mô hình trên thang điểm 100. Vì vậy, thay vì bắt bạn phải giải mã hàng trang kết quả kiểm tra hiệu năng, nó sẽ cung cấp cho bạn một danh sách ngắn gọn các mô hình thực sự đáng để bạn dành thời gian. Chắc chắn, nếu đang sử dụng một máy trạm với dung lượng VRAM đủ để khiến các phòng thí nghiệm AI doanh nghiệp phải đỏ mặt, bạn sẽ không thiếu lựa chọn, nhưng đối với những người còn lại đang làm việc trong giới hạn phần cứng tiêu dùng, đây chính là loại vấn đề mà LLMFit được tạo ra để giải quyết.
Không chỉ dừng lại ở việc đưa ra gợi ý, LLMFit còn tích hợp trực tiếp với Ollama và llama.cpp; nhờ đó, ngay khi tìm được mô hình phù hợp, bạn có thể khởi chạy nó mà không cần phải chuyển đổi qua lại giữa các ứng dụng khác nhau. Đi kèm với mỗi gợi ý là một thông tin đặc biệt hữu ích cho người mới bắt đầu: Nhãn phân loại tác vụ. Công cụ này sẽ cho bạn biết liệu mô hình đang được cân nhắc có tối ưu nhất cho việc lập trình, trò chuyện, tạo ảnh hay các tác vụ MoE (Mixture of Experts) hay không. Điều này giúp tiết kiệm đáng kể thời gian tra cứu tên mô hình trên Google, để bạn có nhiều thời gian hơn cho việc thực sự sử dụng chúng.
Hướng dẫn cài đặt LLMFit trên thiết bị Windows
Để cài đặt LLMFit trên thiết bị của mình, điều đầu tiên bạn cần trên máy tính Windows là Scoop. Scoop là trình cài đặt dòng lệnh đáng tin cậy dành cho Windows. Để cài đặt Scoop, chỉ cần dán dòng code sau vào cửa sổ PowerShell với quyền admin
Set-ExecutionPolicy -ExecutionPolicy RemoteSigned -Scope CurrentUser
Ở đây, rất có thể bạn sẽ không thấy phản hồi nào và lệnh sẽ hoạt động bình thường, hoặc PowerShell sẽ hỏi bạn có muốn thay đổi chính sách thực thi hay không. Nhấn Y và nhấn Enter. Sao chép dòng tiếp theo vào cùng cửa sổ:
Invoke-RestMethod -Uri https://get.scoop.sh | Invoke-Expression
Thao tác này sẽ cài đặt Scoop trên thiết bị Windows của bạn. Điều tiếp theo bạn cần làm là mở cửa sổ Command Prompt và chỉ cần nhập lệnh sau:
scoop install llmfit
Sau đó, LLMFit sẽ được cài đặt trên thiết bị của bạn. Chỉ cần gõ llmfit vào cửa sổ CMD hoặc PowerShell, nó sẽ ngay lập tức hiển thị tất cả dữ liệu về các mô hình AI cục bộ mà bạn có thể cài đặt và chạy trên thiết bị của mình.
Thử nghiệm LLMFit trên một chiếc laptop 6 năm tuổi
Sau khi cài đặt LLMFit trên một laptop 6 năm tuổi, nó nhanh chóng phát hiện phần cứng và liệt kê các mô hình mà nó cho rằng sẽ hoạt động tốt nhất trên đó. Đây là một chiếc laptop Mi cũ được mua vào năm 2019, với RAM 8GB và CPU Intel i5-10210U chạy ở tốc độ 1.60 GHz. Về đồ họa, nó không có gì đáng tự hào ngoài đồ họa tích hợp Intel UHD. Ngay cả trên phần cứng cũ kỹ này, LLMFit cũng chỉ mất vài giây để khởi động và hoạt động sau khi phát hiện khả năng của thiết bị.
Lưu ý: LLMFit là một công cụ chỉ sử dụng bàn phím. Nó hoạt động giống như giao diện BIOS của bo mạch chủ cũ.
LLMFit đã chấm điểm cho mô hình Phi-mini-MoE-instruct của Microsoft với số điểm tổng hợp ấn tượng 90,4 trên 100, xếp nó ở vị trí đầu danh sách những mô hình sẽ chạy tốt nhất. Công cụ này ước tính rằng bạn sẽ nhận được khoảng 40-42 token mỗi giây khi chạy mô hình 7,6 tỷ tham số này trong llama.cpp, vì vậy có thể ngay lập tức tải xuống lượng tử hóa chính xác mà LLMFit đề xuất (Q4_K_M).
May mắn thay, có tùy chọn tải xuống mô hình trực tiếp từ chính công cụ, và chỉ với một lần nhấn phím "d", mô hình AI ngay lập tức được tải xuống từ Hugging Face. Khi chạy, không đạt được tốc độ và số lượng token như LLMFit đã hứa, nhưng vẫn nằm trong khoảng 20-25 token mỗi giây.
Tuy nhiên, vấn đề nảy sinh khi xem xét kỹ danh sách dài các mô hình AI có sẵn trong công cụ này. Nhiều mô hình được liệt kê đã cũ và lỗi thời; điều này cho thấy ngay rằng ứng dụng cần được cập nhật thêm nhiều mô hình mới với tần suất thường xuyên hơn. Dù vậy, xét như một bước đệm ban đầu, không có nhược điểm nào khi cài đặt LLMFit và sử dụng nó cùng phần cứng của bạn để nắm bắt tình hình trước khi tải xuống các mô hình AI lớn để chạy cục bộ.
Liệu mọi người dùng mô hình AI cục bộ có nên sử dụng LLMFit?
Trước khi bạn hiểu rõ cách số lượng tham số và kỹ thuật lượng tử hóa ảnh hưởng đến phần cứng, LLMFit sẽ giúp loại bỏ phần lớn quá trình thử và sai.
Đối với nhiều người, LLMFit nên được xem là một bước đệm hơn là một công cụ mà bạn sẽ gắn bó mãi mãi. Chỉ cần vài tuần thử nghiệm với AI cục bộ là bạn đã có thể hiểu rõ về khả năng phần cứng của mình. Một khi đã nắm được cách số lượng tham số, lượng tử hóa và yêu cầu bộ nhớ ảnh hưởng đến hiệu suất, bạn sẽ bắt đầu có thể tự đưa ra những đánh giá chính xác. Tuy nhiên, cho đến khi đạt được trình độ đó, việc sở hữu một công cụ giúp loại bỏ phần lớn quá trình thử và sai thực sự rất giá trị. Nó mang lại cho bạn sự tự tin khi tải xuống các mô hình, vì biết rằng khả năng cao chúng sẽ hoạt động đúng như mong đợi.
Điều này càng trở nên rõ ràng khi bạn giúp một người bạn bắt đầu làm quen với AI cục bộ trên chiếc laptop Acer Nitro 5 trang bị GPU RTX 3050. Không cần phải tải xuống hàng loạt mô hình rồi thử nghiệm từng cái một để xem cái nào hoạt động tốt nhất. LLMFit đã nhanh chóng đề xuất các mô hình phù hợp với phần cứng và hoạt động hoàn hảo với Ollama, llama.cpp cũng như các giao diện người dùng (front-end) tự host khác. Tuy nhiên, quan trọng hơn cả là nó giúp quá trình self-hosting ban đầu diễn ra suôn sẻ hơn; nó thay thế sự nản lòng bằng đà phát triển thuận lợi, đồng thời giúp người mới xây dựng nền tảng vững chắc mà không phải tốn hàng giờ loay hoay với những mô hình vốn dĩ không thể vận hành hiệu quả ngay từ đầu.
Hướng dẫn AI
AI Tools
Học IT





AI
Hàm Excel