Trong nhiều năm qua, AMD luôn tụt hậu so với Nvidia trong hầu hết các tác vụ liên quan đến Trí tuệ nhân tạo (AI). Nvidia hầu như luôn là lựa chọn hiệu năng tốt hơn, ngay cả khi điều này đi kèm với mức giá cao hơn, điều này vẫn đúng một phần cho đến ngày nay.
May mắn thay, AMD có vẻ đã (gần như) bắt kịp Nvidia và bộ phần mềm Radeon Open Compute (ROCm) của họ, mang lại trải nghiệm khá tốt trên Linux.
Các sản phẩm phần cứng mới ra mắt gần đây như dòng Ryzen AI cũng góp phần vào điều này, và để kiểm chứng, chiếc ROG Flow Z13 — với 32GB bộ nhớ dùng chung và chạy trên chipset AMD Ryzen AI Max 390 đã được sử dụng. Điều này vừa là lợi thế vừa là bất lợi, vì AI Max "chia sẻ" lượng bộ nhớ đó cho cả VRAM và RAM hệ thống, điều này làm mọi thứ trở nên phức tạp hơn một chút.
Thiết lập và vận hành mọi thứ trên Arch Linux
Việc cài đặt Ollama trên Arch Linux khá đơn giản. Tất cả những gì bạn phải làm trên hệ thống của mình là mở terminal và tải xuống phiên bản AUR mới nhất bằng Pacman.
Vì đây là hệ thống hoàn toàn bằng AMD, nên phải chọn lọc các gói. Hai gói đã chọn là ollama-vulkan và olla-rocm, sau đó kích hoạt service daemon trên toàn hệ thống.
sudo pacman -S ollama ollama-vulkan ollama-rocm rocm-hip-sdk rocm-opencl-sdk
sudo systemctl enable --now ollama
Cũng có thể cài đặt hoàn toàn Ollama bằng script cài đặt web, nhưng đừng làm như vậy. Lý do là để chọn tham gia vào các bản cập nhật tập trung, thay vì dựa vào Ollama để cập nhật riêng lẻ.
Sau khi thiết lập Ollama, cuối cùng đã đến lúc triển khai một số mô hình:
- gemma2:9b
- mistral:7b
- phi4:14b
- deepseek-r1:8b
- deepseek-r1:14b
- llava:7b
- llava:13b
Cũng phải lưu ý đến giới hạn phần cứng. Model Flow Z13 cụ thể sử dụng chipset AI Max 390 có thông số kỹ thuật thấp hơn, với iGPU Radeon 8050S có ít hơn 8 CU so với flagship 8060S.
Nó cũng chỉ có 32 gigabyte bộ nhớ dùng chung giữa hệ thống và iGPU, điều này sẽ hạn chế số lượng mô hình có thể chạy. Tuy nhiên, có thể phân bổ tối đa 24GB VRAM từ trong BIOS, điều này tương đương với hầu hết các GPU cao cấp dành cho người tiêu dùng.
Tuy nhiên, đó mới chỉ là một nửa câu chuyện — vẫn cần tính đến băng thông bộ nhớ, khoảng 256 GB/s đối với AI Max. So sánh với RX 9070 (640 GB/s), một trong những sản phẩm tốt nhất của AMD, thì rõ ràng là con số này có thể không quá ấn tượng, ít nhất là thoạt nhìn.
Chạy các bài kiểm tra hiệu năng
Để chạy các bài kiểm tra hiệu năng, bộ công cụ llm-benchmark được sử dụng, tự động cài đặt các dependency cần thiết.
sudo pacman -S python-pip python-pipx
pipx install llm-benchmark
llm_benchmark run
Chuyển đổi giữa hai backend Vulkan và ROCm, một loạt các bài kiểm tra hiệu năng mất khá nhiều thời gian được chạy. Máy tính được đẩy đến giới hạn tuyệt đối, với TDP tối đa được thiết lập.
Từ biểu đồ, khá bất ngờ khi hiệu năng của ROCm và Vulkan lại gần nhau đến vậy. Nhìn chung, chúng hoạt động khá tương đồng. Tuy nhiên, lỗi "hết bộ nhớ" thường xuất hiện trên ROCm. Do đó, vẫn còn chút do dự khi khuyên dùng ROCm vào lúc này — hãy sử dụng Vulkan để có trải nghiệm ổn định hơn.
Card đồ họa 32 CU Radeon 8050S hoạt động rất tốt nhờ kích thước nhỏ gọn và TDP thấp hơn, gần bằng Nvidia RTX 4060 Mobile, một GPU tầm trung tiêu thụ nhiều điện năng hơn. Mặc dù RX 4060 Mobile mạnh mẽ hơn, nhưng chắc chắn sẽ gặp phải tình trạng nghẽn cổ chai do dung lượng VRAM chỉ có 8 gigabyte.
Ngược lại, Strix Halo có quyền truy cập vào toàn bộ 32GB RAM, điều này khiến nó trở thành lựa chọn hiển nhiên cho các tác vụ LLM nặng hơn. Đây là một xu hướng của AMD mà bạn sẽ dần quen thuộc.
Mặt khác, RX 9070 XT dành cho desktop có trường hợp sử dụng tốt nhất với 95 tok/s trên các mô hình 7B, gấp khoảng 2 lần so với 8050S. Nó cũng có giá trị so với giá tiền và băng thông bộ nhớ tốt hơn nhiều, trở thành lựa chọn dễ dàng cho hầu hết mọi người.
Tuy nhiên, khi so sánh với RTX 5090 của Nvidia, tất cả các sản phẩm của AMD đều không đáp ứng được kỳ vọng. 5090 đơn giản là một card tốt hơn nhiều cho AI cục bộ, nhưng nó cũng quá đắt đối với hầu hết mọi người. AMD là một lựa chọn hợp lý hơn nhiều, đồng thời cũng tiết kiệm chi phí hơn, cung cấp hiệu năng cạnh tranh so với giá cả.
Hiệu năng khá tốt, nhưng giá trị mới là điểm mạnh thực sự của AMD
Mặc dù không thể phủ nhận rằng Nvidia hiện đang cung cấp những gì tốt nhất tuyệt đối cho LLM, nhưng AMD đã làm rất tốt để bắt kịp trong những năm gần đây. Cả ROCm và Vulkan đều đã có những cải tiến đáng kể, và AMD hiện là một lựa chọn thay thế cạnh tranh đáng ngạc nhiên.
Không có nhiều lý do để bỏ thêm tiền cho một card Nvidia — đặc biệt khi xét đến việc chúng thường bị hạn chế nghiêm trọng về VRAM.
Hướng dẫn AI
Học IT





AI
Hàm Excel