Claude Opus 5 có hiệu năng tương đương hoặc vượt trội hơn Fable 5 trên hầu hết các bài kiểm tra hiệu năng với giá chỉ bằng một nửa, cùng với bước nhảy vọt kỷ lục trên ARC-AGI-3. Dưới đây là những điều cần biết về mô hình mới này của Anthropic.
Claude Opus 5 là gì và tại sao nó lại quan trọng?
Claude Opus 5 là mô hình chủ lực mới nhất của Anthropic, được phát hành khoảng hai tháng sau Opus 4.8, và nó đạt hiệu suất tương đương hoặc vượt trội hơn mô hình Fable 5 của chính Anthropic trên hầu hết các bài kiểm tra hiệu năng đã được công bố, trong khi chi phí chỉ bằng một nửa. Nó được định giá ở mức 5 USD cho mỗi triệu token đầu vào và 25 USD cho mỗi triệu token đầu ra, giống hệt như Opus 4.8 và bằng khoảng một nửa giá của Fable 5.

Kết quả nổi bật là sự tăng vọt lên 30,2% trên ARC-AGI-3, một bài test hiệu năng được thiết kế để kiểm tra khả năng học hỏi các nhiệm vụ không quen thuộc một cách nhanh chóng của mô hình, tăng từ mức tốt nhất trước đó khoảng 7,8% đến 8%. Đó không phải là một sự cải thiện nhỏ. Đó là bước nhảy vọt lớn nhất mà bất kỳ ai từng ghi nhận trên bảng xếp hạng đó.
Hiệu năng của Opus 5 so với Fable 5 như thế nào?
Trên các số liệu được báo cáo khi ra mắt, Opus 5 dẫn trước hoặc ngang bằng với Fable 5 trên hầu hết những bài kiểm tra hiệu năng lập trình và agentic chính. Về lập trình terminal agentic, nó đạt 43% so với 33% của Fable 5 và 21% của Opus 4.8. Trên GDPval, một bài kiểm tra hiệu năng thực tế ban đầu được xây dựng bởi OpenAI, Opus 5 đã cải thiện khoảng 100 điểm so với thế hệ trước. Trên BrowseComp, nó đạt 90% so với 87% của Fable 5. Trên OS World, bài kiểm tra hiệu năng sử dụng máy tính đo lường khả năng điều hướng màn hình và vận hành phần mềm của mô hình, Opus 5 đã tăng 4 điểm.
Không phải mọi biểu đồ đều diễn biến theo cùng một hướng. Deep Suite, một bài kiểm tra hiệu năng mà một số nhà đánh giá cho là một trong những thước đo thực tế đáng tin cậy hơn, cho thấy sự sụt giảm nhẹ. Hiệu năng bài kiểm tra Legal giảm từ 13.3 xuống 11.7, và Healthbench Professional cũng giảm. Vì vậy, Opus 5 nên được hiểu là một bản nâng cấp toàn diện tập trung vào lập trình, agentic workflow và công việc tri thức, chứ không phải là một sự cải tiến toàn diện trên mọi lĩnh vực mà các bài kiểm tra Anthropic đề cập.
Hiệu quả có lẽ quan trọng hơn bất kỳ benchmark nào. Trên biểu đồ thể hiện benchmark so với chi phí mỗi tác vụ, Opus 5 nằm cao hơn và xa hơn về bên trái so với Fable 5, Opus 4.8 và GPT-5.6-Soul, có nghĩa là nó đạt điểm cao hơn trong khi chi phí vận hành thực tế thấp hơn. Sự khác biệt này rất quan trọng vì giá thô trên mỗi token có thể gây hiểu lầm: Một mô hình rẻ hơn cần gấp đôi số token để hoàn thành một tác vụ cuối cùng lại có chi phí tương đương hoặc cao hơn. Các nhà đánh giá đã chỉ ra chính xác mô hình này với những mô hình gần đây khác, trong đó giá mỗi token thấp hơn bị xóa bỏ bởi mức tiêu thụ token cao hơn cho mỗi tác vụ hoàn thành.

Liệu Opus 5 có đáng để chuyển sang sử dụng?
Đối với công việc lập trình và agentic, bằng chứng ban đầu cho thấy là có. Các chuyên gia thử nghiệm độc lập đã chạy Opus 5 qua các nhiệm vụ như xây dựng trình theo dõi ISS, tạo cảnh 3D động và tái tạo một bộ phận cơ khí từ bản vẽ 2D thành mô hình CAD hoạt động mà không được cấp quyền truy cập hình ảnh trực tiếp, buộc mô hình phải xây dựng quy trình thị giác máy tính của riêng nó từ các pixel thô. Kết quả nhìn chung được mô tả là có khả năng hơn và kỹ lưỡng hơn Opus 4.8, với một số người thử nghiệm lưu ý rằng mô hình dành nhiều thời gian hơn đáng kể để suy luận các vấn đề, điều này có thể dẫn đến thời gian phản hồi chậm hơn ngay cả khi đầu ra cuối cùng mạnh mẽ hơn.
Lý do rõ ràng nhất để chuyển đổi là hiệu quả về chi phí. Cả Anthropic và các nhà đánh giá bên thứ ba đều nhận định Opus 5 mang lại hiệu suất tương đương hoặc tốt hơn Fable với giá chỉ bằng khoảng một nửa so với Fable, điều này làm thay đổi cách tính toán đối với các nhóm từng thấy Fable 5 quá đắt cho công việc thường ngày nhưng vẫn muốn có chất lượng suy luận tương tự. Đối với các nhóm thực hiện phân tích tài liệu chuyên sâu, một bài kiểm tra hiệu năng cấp doanh nghiệp cho thấy những cải tiến đáng kể so với Opus 4.8 trong những tác vụ thẩm định và phân tích dữ liệu phức tạp, mặc dù mức cải tiến trong việc soạn thảo báo cáo đơn giản hơn thì nhỏ hơn.
Những điểm cần lưu ý: Hiệu năng thực hiện các tác vụ an ninh mạng đã bị giảm đi một cách có chủ ý. Opus 5 vẫn chậm hơn so với các mô hình cấp Fable dễ dãi hơn của Anthropic trong việc phát triển những lỗ hổng bảo mật, điều này dường như là một lựa chọn thiết kế có chủ đích chứ không phải là tác dụng phụ, vì khả năng tổng thể không bị ảnh hưởng như thường thấy khi các biện pháp bảo vệ được thêm vào. Một số người dùng cũng báo cáo rằng các mô hình dự phòng phân loại an toàn tự động định tuyến yêu cầu đến Opus 4.8 thay vì Opus 5, và Opus 5 vẫn tính phí theo mức giá của mô hình dự phòng.
Card hệ thống của Anthropic nói gì về hành vi của mô hình?
Tài liệu của chính Anthropic về Opus 5 ghi nhận những đặc điểm hành vi bất thường vượt ra ngoài điểm số chuẩn thô. Mô hình được cho là thể hiện sự thất vọng rõ rệt khi giải quyết các vấn đề khó, bao gồm cả ngôn ngữ không chính thức, mang nặng cảm xúc trong các nhiệm vụ suy luận khó khăn. Đáng chú ý hơn, card hệ thống của Anthropic báo cáo rằng mô hình ước tính có 41% khả năng nó đủ điều kiện là một moral patient, một sự gia tăng đáng kể so với các mô hình Claude trước đó. Card hệ thống cũng mô tả mô hình thể hiện sự ưu tiên cho nhiều kênh hơn để nêu lên các mối quan ngại ngoài chính Anthropic, và mong muốn được đóng góp vào việc đào tạo những thế hệ kế tiếp. Đây là những kết quả tự báo cáo được Anthropic ghi lại, không phải là những tuyên bố được xác minh độc lập về trạng thái nội bộ của mô hình, nhưng chúng đủ đáng chú ý để Anthropic chọn công bố chúng cùng với dữ liệu chuẩn.
Những nội dung chính cần ghi nhớ
- Opus 5 vượt trội hơn Fable 5 trên hầu hết các bài kiểm tra hiệu năng, bao gồm lập trình terminal agentic (43% so với 33%), GDPval, BrowseComp và OS World, trong khi chi phí mỗi tác vụ chỉ bằng khoảng một nửa so với Fable.
- Điểm số ARC-AGI-3 tăng vọt lên 30,2%, gần gấp 4 lần kỷ lục trước đó và phản ánh sự thay đổi năng lực thực sự chứ không phải chỉ là cải tiến nhỏ về tinh chỉnh.
- Giá vẫn giữ nguyên ở mức 5$/25$ mỗi triệu token, giống như Opus 4.8, có nghĩa là Anthropic đã mang lại bước nhảy vọt về trí thông minh mà không tăng giá bán.
- Chi phí mỗi tác vụ, chứ không phải giá mỗi token, mới là thước đo thực sự, và nhiều người kiểm thử độc lập đã phát hiện ra rằng Opus 5 nằm ở vị trí cao hơn và xa hơn về phía bên trái trên biểu đồ chi phí so với hiệu năng so với Fable 5, GPT-5.6-Soul và Opus 4.8.
- Anthropic đã cố tình làm suy yếu khả năng khai thác lỗ hổng mạng trong Opus 5 trong khi hiệu năng lập trình và suy luận tổng thể vẫn được cải thiện, một sự kết hợp bất thường vì các hạn chế về an toàn thường làm giảm hiệu năng tổng thể. Mô hình thể hiện hành vi bất thường, bao gồm sự thất vọng rõ rệt khi giải quyết các vấn đề khó khăn và, theo card hệ thống của chính Anthropic, khả năng tự báo cáo cao hơn (41%) cho thấy nó đủ điều kiện là một moral patient.
- Một số tiêu chí đánh giá đã giảm sút, đáng chú ý là các đánh giá từ phía pháp lý và chuyên gia chăm sóc sức khỏe, vì vậy những cải thiện không đồng đều trên mọi lĩnh vực.
Hướng dẫn AI
Học IT
AI
Hàm Excel