Có quá nhiều LLM để kiểm tra đúng cách. Bạn có thể trò chuyện với một vài mô hình, chọn một mô hình yêu thích và kết thúc công việc, nhưng một mô hình giỏi giao tiếp có thể lại tệ trong việc lập trình, tạo đầu ra có cấu trúc hoặc tuân theo một hướng dẫn cụ thể kỳ lạ.
Khi cần một LLM cho một nhiệm vụ mới, chẳng hạn như xếp hạng một danh sách và trả về JSON sạch, không ai muốn chạy cùng một prompt qua hàng chục mô hình chỉ để tìm ra mô hình phù hợp. Đó là lý do tại sao các bài kiểm tra hiệu năng (benchmark) được tạo ra để giúp đỡ. Nhưng không giống như các bài kiểm tra hiệu năng PC, mà bất cứ ai cũng có thể chạy chỉ với vài cú nhấp chuột, những bài kiểm tra hiệu năng LLM thường có nghĩa là tin tưởng vào kết quả của người khác hoặc tự thiết lập một bộ kiểm thử phức tạp.
Đó là lý do tại sao một bài kiểm tra sơ bộ (smoke test) tốt lại quan trọng. Nó phải nhanh chóng, dễ lặp lại và đủ để cho thấy mô hình thực sự hoạt động như thế nào. Rõ ràng, tất cả những gì bạn cần chỉ là "A pelican on a bicycle" (câu lệnh kiểm tra (prompt) nổi tiếng dùng để đánh giá khả năng suy luận không gian, tư duy logic và kỹ năng lập trình vẽ hình vector (SVG) của các mô hình trí tuệ nhân tạo (AI)).
Bài kiểm tra "A pelican on a bicycle"
Nhà phát triển và nhà nghiên cứu AI Simon Willison đã giới thiệu bài kiểm tra này vào ngày 25 tháng 10 năm 2024. Prompt chính xác là:
Generate an SVG of a pelican riding a bicycle.
Tạo một hình ảnh SVG về một con chim bồ nông đang đạp xe.
Ban đầu, ông chạy thử nghiệm với 16 mô hình từ OpenAI, Anthropic, Google và Meta. Willison chọn chủ đề này một phần vì ông thích chim bồ nông và một phần vì ông nghi ngờ rằng sẽ không có nhiều hình minh họa SVG về chim bồ nông đang đạp xe trong dữ liệu huấn luyện của các mô hình.
SVG là hình ảnh, nhưng chỉ khi chúng được hiển thị. Có lẽ bạn biết chúng là những hình ảnh có thể được phóng to gần như vô hạn mà không bị mờ hoặc vỡ pixel. Điều đó có thể thực hiện được vì SVG là một ngôn ngữ markup dựa trên XML. Về mặt lý thuyết, bất kỳ mô hình ngôn ngữ nào có khả năng xử lý văn bản và lập trình cơ bản đều có thể tạo ra một file SVG. Bạn không cần một bộ công cụ đánh giá hiệu năng, trình thông dịch code, script API, IDE hoặc một tập hợp các ràng buộc phức tạp. Bạn thậm chí không cần cài đặt bất cứ thứ gì. Bạn chỉ cần cung cấp cho mô hình một dòng văn bản, sao chép kết quả vào file SVG nếu giao diện không tự động hiển thị, và mở nó trong trình duyệt.
Việc đánh giá cũng rất dễ dàng. Không có bảng đáp án hay điểm số trừu tượng nào để diễn giải. Bạn chỉ cần nhìn vào hình ảnh. Con chim có dễ nhận ra là bồ nông không? Chiếc xe đạp có hai bánh không? Những bánh xe đó có được kết nối với khung xe không? Con bồ nông có thực sự đang đạp xe hay nó đang lơ lửng ở đâu đó phía sau? Mô hình có tuân theo hướng dẫn và trả về code SVG hay nó đã bỏ qua bạn và khởi chạy một công cụ tạo hình ảnh thay vào đó?
Prompt duy nhất đó cuối cùng sẽ kiểm tra khả năng tuân theo hướng dẫn, lập trình, cú pháp hợp lệ, nhận dạng đối tượng, suy luận không gian, bố cục và thậm chí cả sự kiềm chế. Một số mô hình tạo ra một chiếc xe đạp hoạt động và đặt con bồ nông đúng vị trí. Những mô hình khác thêm mây, hiệu ứng chuyển màu, cỏ, hoạt hình và nền nắng trong khi quên kết nối bánh trước.
Nó cũng cho bạn biết điều gì đó về sản phẩm xung quanh mô hình. ChatGPT, Claude và Gemini không phải lúc nào cũng cung cấp cho bạn quyền truy cập trực tiếp vào LLM thô. Chúng bao bọc mô hình trong các lệnh hệ thống, công cụ, trình kết xuất và những quyết định định tuyến. Bài kiểm tra Pelican cho thấy những quyết định đó gần như ngay lập tức.
Ngay cả những mô hình tiên tiến nhất cũng gặp khó khăn với bài kiểm tra Chim bồ nông
Prompt được kiểm tra trên Claude, Gemini và ChatGPT. API của chúng không được sử dụng. Sử dụng các giao diện thông thường được cung cấp thông qua những gói đăng ký hiện có, điều đó có nghĩa là toàn bộ sản phẩm được kiểm tra chứ không phải các mô hình riêng lẻ. Các giao diện đó không hiển thị số lượng token chính xác hoặc tốc độ token mỗi giây, vì vậy những con số đó được để là N/A.



Bạn có thể xem kết quả trong các thư viện ảnh đã đính kèm. Gemini thực sự vượt trội hơn tất cả những đối thủ khác. Kết quả của ChatGPT khá kỳ lạ và đáng thất vọng, chủ yếu là vì GPT quá vội vàng chuyển thẳng sang công cụ tạo hình ảnh. Có thể nói đó vẫn là một kết quả hợp lệ. Mô hình cơ bản có thể có khả năng viết một code SVG tốt, nhưng sản phẩm của ChatGPT đã không tuân theo hướng dẫn ban đầu.




Các mô hình Claude hoạt động khá tốt. Điều thú vị là kết quả thay đổi rất ít so với sự khác biệt lớn về chi phí giữa chúng. Claude Haiku 4.5 có giá 1 USD cho mỗi triệu token đầu vào và 5 USD cho mỗi triệu token đầu ra thông qua API. Claude Opus 5 có giá lần lượt là 5 USD và 25 USD, tức là đắt gấp 5 lần. Fable 5 thậm chí còn đắt hơn với giá 10 USD cho mỗi triệu token đầu vào và 50 USD cho mỗi triệu token đầu ra.
Đó không phải là giá đã trả thông qua gói đăng ký, nhưng chúng cho chúng ta một ý tưởng hữu ích về cách Anthropic định giá từng mô hình. Với sự khác biệt đó, bạn sẽ kỳ vọng Opus 5 sẽ tạo ra một chú chim bồ nông tốt hơn đáng kể so với Haiku 4.5. Tuy nhiên, thực tế lại khác. Có sự khác biệt, nhưng không nhiều như chênh lệch giá cả.
Các mô hình cục bộ cũng không kém cạnh
Gemini chắc chắn đã cho ra kết quả ấn tượng nhất trong số các mô hình tiên phong, nhưng nó cũng thêm vào rất nhiều thứ mà người dùng không hề yêu cầu. Nó tạo ra một hình minh họa trau chuốt, nhưng không thực sự nắm bắt được những gì được mong đợi từ một prompt đơn giản và ngẫu nhiên như vậy.



Trong số các mô hình cục bộ, kết quả tốt nhất đến từ Qwen3.6-27B. Một phiên bản lượng tử hóa Q4 được chạy. Nó suy nghĩ trong gần 3 phút, nhưng kết quả chính xác là những gì được mong đợi từ một prompt như thế này: Một con bồ nông dễ nhận biết, một chiếc xe đạp dễ nhận biết, và không có bất kỳ chi tiết trang trí không cần thiết nào. Qwen3.6-27B là mẫu card đồ họa rời cao cấp hàng đầu trong dòng Qwen3.6 của Alibaba, vì vậy nó không thực sự nhỏ gọn, nhưng việc chạy phiên bản lượng tử hóa cục bộ vẫn giúp nó nằm trong tầm với của phần cứng tiêu dùng cao cấp.
Ornith 35B Q4 cũng hoạt động rất tốt với cả xe đạp và chim bồ nông. Vấn đề chính là chim bồ nông dường như bị tụt lại phía sau xe đạp hơn là đậu đúng vị trí trên đó. Các vật thể riêng lẻ thì tốt, nhưng mối quan hệ không gian của chúng thì không.




Để tham khảo, thử nghiệm cũng được chạy với Gemma 4 E2B. Đây là một trong những mô hình Gemma 4 nhỏ nhất và được thiết kế cho phần cứng di động và biên chứ không phải máy trạm lớn. Đó là loại mô hình mà bạn có thể thử nghiệm trên các thiết bị tương tự Raspberry Pi. Ban đầu nó từ chối yêu cầu. Sau đó, nó được thuyết phục rằng mình thực sự có thể tạo ra một SVG bằng cách viết XML, và đây là kết quả đầu ra.
Sự từ chối ban đầu đó tự nó đã là một kết quả. Mô hình có khả năng kỹ thuật để hoàn thành nhiệm vụ, nhưng nó không hiểu khả năng của chính mình cho đến khi được giải thích. Gemma 4 31B cũng làm khá tốt, mặc dù lốp trước của xe đạp không được kết nối với phần còn lại của khung.


Kết quả của GLM-4.7-Flash không tuyệt vời, nhưng vẫn ấn tượng khi nó tạo ra đầu ra với tốc độ đáng kinh ngạc là 112,7 token mỗi giây. Nó là một mô hình Mixture-of-Experts với tổng cộng 30B tham số, 3B tham số hoạt động, điều này giúp giải thích tại sao nó có thể chạy với tốc độ gần như tương đương với Gemma 4 E2B nhỏ bé.
Kết quả cục bộ đáng thất vọng nhất đến từ North-Mini-Code-1.0. SVG của nó thậm chí còn tệ hơn SVG do Gemma 4 E2B tạo ra. Công bằng mà nói, North Mini Code là một mô hình Mixture-of-Experts với tổng cộng 30 tỷ tham số nhưng chỉ có 3 tỷ tham số hoạt động trong quá trình suy luận. Nó cũng được tối ưu hóa đặc biệt cho việc lập trình agentic và làm việc trên terminal hơn là vẽ chim ngồi trên xe đạp. Tuy nhiên, một mô hình được xây dựng dựa trên việc tạo code vẫn được kỳ vọng nhiều hơn.
Các mô hình cục bộ không tính phí theo từng token khi sử dụng, mặc dù phần cứng và điện năng chắc chắn không miễn phí. Quan trọng hơn, kết quả của chúng không hề tụt hậu nhiều thế hệ so với các mô hình tiên tiến đắt tiền. Trong một số trường hợp, chúng còn được yêu thích hơn.
Bài kiểm tra benchmark tiêu chuẩn này dường như chưa bị thao túng
Định luật Goodhart nói rằng khi một thước đo trở thành mục tiêu, nó sẽ không còn là một thước đo tốt nữa. Điều đó ngày càng trở thành vấn đề đối với các benchmark LLM.
Một khi các nhà cung cấp mô hình biết được những tiêu chuẩn nào quan trọng, họ có thể tối ưu hóa dựa trên chúng. Điều đó không nhất thiết có nghĩa là một kỹ sư đang tự tay cung cấp cho mô hình bảng câu trả lời của một tiêu chuẩn. Các câu hỏi, giải pháp, kho code, thảo luận và giải thích về tiêu chuẩn có thể đơn giản là xuất hiện trong tập dữ liệu huấn luyện khổng lồ của mô hình.
Mô hình sau đó có thể hoạt động tốt vì nó đã gặp phải cùng một vấn đề, hoặc một vấn đề rất gần với nó, trước đây — chứ không phải vì nó đã phát triển khả năng tổng quát hơn để giải quyết các vấn đề không quen thuộc.
Chúng ta đã thấy các benchmark lớn mất đi giá trị theo cách này. Vào tháng 2 năm 2026, OpenAI đã ngừng báo cáo điểm số cho SWE-bench Verified, một trong những tiêu chuẩn lập trình được sử dụng rộng rãi nhất. Cuộc điều tra đã phát hiện cả những bài kiểm tra sai sót và bằng chứng cho thấy các mô hình tiên tiến đã gặp phải một số vấn đề của benchmark và các bản vá lỗi do con người viết ban đầu trong quá trình huấn luyện. OpenAI kết luận rằng kết quả cao hơn ngày càng phản ánh mức độ tiếp xúc với benchmark hơn là những cải tiến thực sự trong phát triển phần mềm thực tế.
Các benchmark cũng rất quan trọng về mặt thương mại. OpenAI và Anthropic đang chuẩn bị niêm yết công khai, và các biểu đồ chuẩn mực không còn chỉ là kết quả nghiên cứu nữa. Chúng là tài sản tiếp thị giúp định hình câu chuyện của nhà đầu tư, định giá dự kiến và nhận thức rằng một công ty đang phát triển nhanh hơn công ty khác.
Khi một công ty ra mắt một mô hình mới và lấp đầy bài thuyết trình của mình bằng các biểu đồ cho thấy nó đánh bại mọi đối thủ cạnh tranh, câu chuyện định giá sẽ dễ bán hơn nhiều. Có một động lực rất lớn để làm cho những biểu đồ đó trông thật ấn tượng.
Bài kiểm tra chim bồ nông vẫn hữu ích bởi vì, theo như chúng ta biết, các nhà cung cấp chưa huấn luyện cụ thể những mô hình của họ để vẽ chim bồ nông trên xe đạp.
Tuy nhiên, chỉ cần bài kiểm tra chim bồ nông trở nên đủ quan trọng, cuối cùng nó có thể tự phản tác dụng. Một khi các nhà cung cấp bắt đầu tự hào đưa kết quả vẽ chim bồ nông vào những bài thuyết trình ra mắt sản phẩm, chắc chắn sẽ có người đảm bảo rằng mô hình tiếp theo vẽ được một con chim bồ nông hoàn hảo.
Đến lúc đó, chúng ta sẽ phải thay đổi yêu cầu vẽ. Có lẽ là một con hồng hạc cưỡi xe đạp một bánh. Hoặc một con gấu trúc lái xe nâng.
Hướng dẫn AI
Học IT






AI
Hàm Excel