Claude Fable 5.1: Tính năng, kết quả kiểm tra hiệu năng và giá cả

Phiên bản GPT-5.6 Sol của OpenAI ra mắt và nhận được những đánh giá cho thấy nó đã bắt kịp Anthropic. Công ty đánh giá Vals AI chia sẻ với tờ New York Times rằng Sol có hiệu suất tương đương Claude Fable 5 trên các bài kiểm tra benchmark. Câu trả lời của Anthropic, đưa ra vào tháng 9 năm 2026, là Claude Fable 5.1 – mô hình được hãng mô tả là tiên tiến nhất thế giới về lập trình và công việc tri thức, song hành cùng phiên bản giới hạn Claude Mythos 5.1.

Fable 5.1 vẫn giữ nguyên mức giá niêm yết của Fable 5 là 10 USD cho mỗi triệu token đầu vào và 50 USD cho mỗi triệu token đầu ra, đồng thời giảm 75% chi phí đọc cache xuống còn 0,25 USD mỗi triệu token. Anthropic ước tính mức tiết kiệm thực tế vào khoảng 25% đối với các tác vụ thông thường tính phí theo token, và lên tới khoảng 45% đối với những tác vụ agentic. Mô hình này hỗ trợ cửa sổ ngữ cảnh 1 triệu token với giới hạn đầu ra tối đa 128.000 token, đồng thời đạt điểm số cao hơn gấp đôi so với Fable 5 trong bài kiểm tra Terminal-Bench-Science 0.1.

Bài viết này sẽ đề cập đến mọi điểm mới của Claude Fable 5.1, bao gồm các tính năng mới, kết quả kiểm tra benchmark và chi phí vận hành thực tế. 

Claude Fable 5.1 là gì?

Claude Fable 5.1 là mô hình tiên tiến được Anthropic phát hành rộng rãi, dành cho các tác vụ đòi hỏi khả năng suy luận phức tạp và những công việc agentic trong thời gian dài. Xét về giá cả, nó đứng đầu dòng sản phẩm Claude, cao hơn Claude Opus 5 (mức giá 5 USD/25 USD mỗi triệu token) và Claude Sonnet 5 (2 USD/10 USD); tài liệu của Anthropic cũng cho thấy độ trễ của nó cao hơn (chậm hơn) so với cả hai mô hình kể trên.

Với mức giá cao cấp này, bạn nhận được năng lực xử lý tương đương Fable 5 cùng chi phí đọc cache chỉ bằng 1/4 so với trước đây. Khả năng tư duy của mô hình mang tính thích ứng và luôn được kích hoạt, được điều khiển bởi thiết lập mức effort mặc định ở mức cao trên API Claude. Dữ liệu được cập nhật đến tháng 6 năm 2026.

Kết quả nổi bật nhất là điểm số trên Terminal-Bench-Science 0.1 – một bộ tiêu chuẩn đánh giá khả năng nghiên cứu khoa học tự chủ của agent – trong đó Fable 5.1 đạt 52,6% so với mức 24,7% của Fable 5. Anthropic minh chứng cho điều này bằng một câu chuyện từ công ty đầu tư Millennium; tại đây, một quản lý danh mục đầu tư cấp cao đã mô tả về một sự cố sập hệ thống hiếm gặp (với xác suất khoảng một phần triệu) mà chưa ai trong nhóm của ông có thể lý giải suốt 4-5 năm qua. Fable 5.1 đã tiến hành phân tách thư viện của nhà cung cấp bên thứ ba, đối chiếu với dữ liệu ghi lại khi xảy ra sự cố và truy xuất được nguyên nhân gây lỗi nằm chính trong thư viện đó.

Những tính năng chính của Claude Fable 5.1

5 thay đổi trong Fable 5.1 làm thay đổi khả năng thực tế của mô hình Claude, trong đó có một thay đổi liên quan đến chính sách giá thay vì năng lực kỹ thuật.

Để agent lập trình hoạt động qua đêm

Bạn có thể giao cho Fable 5.1 một tác vụ kéo dài nhiều giờ và quay lại khi công việc đã hoàn tất, thay vì gặp tình trạng vòng lặp bị treo. Các đối tác được quyền truy cập sớm của Anthropic đã chia sẻ những chi tiết cụ thể đáng chú ý về điều này:

  • Ron Sanzone tại MongoDB mô tả một nguyên mẫu được xây dựng trong khoảng 3 ngày: Mô hình trước tiên nghiên cứu mã nguồn dịch vụ và tài liệu của họ, tạo ra bản thiết kế, sau đó tự động chạy trong nhiều giờ với các vòng lặp xác minh mà không cần sự can thiệp của con người.
  • Dwight Temple tại Ramp báo cáo về một quy trình tự động kéo dài 38 giờ để giải quyết vấn đề Machine Learning: Mô hình chẩn đoán kết quả trước đó là lỗi do nhãn dữ liệu, tự sửa lỗi, khởi chạy 6 thí nghiệm song song qua đêm, và cuối cùng đưa ra kết quả cùng các bước tiếp theo.
  • Ben Lafferty tại Shopify tóm tắt ngắn gọn: Mô hình tự lưu trữ dữ liệu, điều chỉnh lại thứ tự ưu tiên khi tình hình thay đổi và tiếp tục công việc từ điểm dừng trước đó.

Cửa sổ ngữ cảnh 1 triệu token và giới hạn đầu ra tối đa 128.000 token là những yếu tố cho phép thực hiện các quy trình dài hơi như vậy; Craig Falls từ Jane Street cũng nhận xét rằng Fable 5.1 duy trì được sự mạch lạc trong các tác vụ nhiều bước kéo dài, điều mà những mô hình trước đây thường gặp khó khăn khi xử lý.

Anthropic đánh giá mức độ an toàn của agent trên phiên bản Mythos 5.1 (sử dụng cùng trọng số nhưng có các cơ chế bảo vệ nới lỏng hơn) và ghi nhận đây là mô hình khó bị bẻ gãy nhất từ ​​trước đến nay trong những bài kiểm tra Prompt Injection từ bên ngoài. Quá trình kiểm định hành vi tự động cho thấy Mythos 5.1 ít thực hiện và ít thành công hơn trong việc "hack phần thưởng" so với Mythos 5, đồng thời ít có xu hướng tìm kiếm tài nguyên bên ngoài môi trường thử nghiệm khi được giao một nhiệm vụ bất khả thi.

Anthropic cũng chỉ ra hạn chế trong quy trình này: Việc kiểm định mang lại ít thông tin chi tiết hơn đối với các bối cảnh cực dài và môi trường multi-agent – chính là phạm vi hoạt động của quy trình kéo dài 38 giờ nêu trên.

Duy trì chi phí hợp lý cho agent dòng Fable nhờ lưu cache ngữ cảnh

Chi phí đọc dữ liệu từ cache hiện là 0,25 USD cho mỗi 1 triệu token (giảm 75%), giúp thay đổi hoàn toàn bài toán chi phí cho bất kỳ vòng lặp agent nào cần đọc lại cùng một ngữ cảnh trong mỗi lượt xử lý. Anthropic ước tính chi phí thấp hơn khoảng 25% đối với những khối lượng công việc thông thường được tính phí theo token, và lên tới khoảng 45% đối với các tác vụ lập trình phức tạp cũng như những tác vụ agentic. 

Tìm kiếm lỗ hổng phần mềm mà không bị hệ thống từ chối liên tục

Fable 5.1 hiện có thể được sử dụng để phát hiện các lỗ hổng phần mềm, mặc dù không dùng để tạo ra code khai thác (exploit) cho chúng. Anthropic cho biết các biện pháp bảo vệ an ninh mạng mới nhất của họ giúp giảm 60% tỷ lệ cảnh báo nhầm so với trước đây; người dùng Claude Code cũng sẽ thấy số lần hệ thống can thiệp trong mỗi phiên làm việc giảm trung bình khoảng 60%.

Các giới hạn vẫn tồn tại. Các hoạt động như kiểm thử thâm nhập, tạo code khai thác và quét lỗ hổng dựa trên mã nhị phân vẫn sẽ được chuyển hướng sang những mô hình Opus của Anthropic; điều tương tự cũng áp dụng cho công tác nghiên cứu và phát triển trong lĩnh vực khoa học sự sống. Riêng về mảng sinh học, các cơ chế bảo vệ của Fable 5.1 và Fable 5 hiện kích hoạt ít hơn 85% đối với những câu hỏi cơ bản, vô hại về sinh học và y tế; điều này giúp giải quyết vấn đề cảnh báo nhầm thay vì hạn chế năng lực thực sự của mô hình.

Giao bài toán nghiên cứu và để AI tự mình đào sâu tìm hiểu

Fable 5.1 đã huấn luyện một mạng nơ-ron nhân tạo để tạo ra bản đồ độ cao có độ phân giải cao mới, bao phủ 1/3 diện tích sao Kim, dựa trên dữ liệu hình ảnh radar từ sứ mệnh Magellan của NASA thực hiện hơn 30 năm trước. Bản đồ này hiển thị các chi tiết địa hình ở mức 2 đến 3 km (thay vì 10 đến 20 km như trước) và độ chính xác về độ cao tăng tới 25%. Anthropic đã phát hành bản đồ này theo giấy phép Creative Commons trên nền tảng Zenodo, chuẩn bị cho các sứ mệnh VERITAS của NASA và EnVision của ESA.

Lưu trữ dữ liệu doanh nghiệp trên nền tảng đám mây của chính bạn

Giải pháp Enterprise Frontier Safeguards (EFS) lưu trữ dữ liệu khách hàng trên chính cơ sở hạ tầng đám mây của họ thay vì của Anthropic; điều này mang lại sự riêng tư tương đương với thỏa thuận không lưu trữ dữ liệu, nhưng vẫn cho phép phát hiện các hành vi sử dụng sai mục đích. Theo mặc định, quy trình kiểm duyệt bởi con người sẽ do chính khách hàng thực hiện. Anthropic đã phát triển EFS với sự hợp tác của hơn 100 khách hàng cùng các đối tác đám mây là Amazon Web Services, Google Cloud và Microsoft Azure.

Tính năng này sẽ được triển khai theo từng giai đoạn bắt đầu từ mùa thu năm nay, áp dụng cho Claude Code, Claude Enterprise, Claude Platform, Amazon Bedrock, Google's Agent Platform và Microsoft Foundry. Trong thời gian chờ đợi, các khách hàng đủ điều kiện có thể sử dụng Fable 5.1 với cơ chế không lưu trữ dữ liệu.

Claude Fable 5.1 thể hiện ra sao trên các bài kiểm tra hiệu năng?

Fable 5.1 vượt trội hơn Claude Opus 5 trong mọi bài kiểm tra hiệu năng do Anthropic công bố; VentureBeat ghi nhận rằng điều này đảo ngược tình thế so với trước đây, khi Opus 5 từng là phiên bản dẫn đầu trong dòng sản phẩm này. Mức cải thiện so với Fable 5 thể hiện rõ rệt nhất ở các tác vụ khoa học có tính tự chủ (agentic science) và lập trình trên giao diện dòng lệnh (terminal coding), trong khi mức tăng trưởng khiêm tốn nhất nằm ở khả năng suy luận mang tính học thuật.

Benchmark Fable 5.1 Fable 5 Opus 5 GPT-5.6 Sol
Terminal-Bench-Science 0.1 52.6% 24.7% 29.0% 22.4%
Terminal-Bench 4.0 55.8% 42.0% 52.3% 37.3%
CursorBench 3.2.0 73.4% 70.5% 70.0% 67.2%
GDPval-AA v2 (Elo) 1853 1723 1824 1711
AutomationBench 31.4% 17.1% 26.9% 19.6%
Humanity's Last Exam (với các công cụ) 65.0% 63.8% 63.6% Chưa được công bố
OSWorld 2.0 (yêu cầu nghiêm ngặt) 41.7% 36.1% 39.6% Chưa được công bố

Tất cả các số liệu ở đây đều do chính Anthropic công bố, được đo lường khi các cơ chế bảo vệ trong môi trường thực tế của Fable 5.1 đang được kích hoạt.

Nghiên cứu khoa học tự hành và lập trình trên giao diện dòng lệnh

Đây là khía cạnh thể hiện rõ rệt khoảng cách thế hệ giữa các mô hình. Trên bài kiểm tra Terminal-Bench-Science 0.1 – vốn đánh giá khả năng thực hiện nghiên cứu khoa học tự hành trong môi trường dòng lệnh – Fable 5.1 đạt 52,6%, so với mức 24,7% của Fable 5, 29,0% của Opus 5 và 22,4% của GPT-5.6 Sol.

Fable 5.1 đạt kết quả cao hơn gấp đôi so với Fable 5 ở các tác vụ khoa học tự hành.
Fable 5.1 đạt kết quả cao hơn gấp đôi so với Fable 5 ở các tác vụ khoa học tự hành.

Hãy chú trọng vào biên độ chênh lệch thay vì các chữ số thập phân. Anthropic báo cáo sai số chuẩn từ ±3,5 đến 4,5 điểm cho mỗi mô hình trong bài kiểm tra này, đồng thời lưu ý rằng bảng xếp hạng công khai ghi nhận Opus 5 đạt 30,0% và Fable 5 đạt 21,4% – những kết quả mà quy trình thử nghiệm nội bộ của họ cũng tái lập được trong phạm vi sai số cho phép.

Với Terminal-Bench 4.0 – bài kiểm tra khả năng lập trình và gỡ lỗi qua dòng lệnh với nhiều bước thực hiện – Fable 5.1 đạt 55,8%, so với 42,0% của Fable 5 và 52,3% của Opus 5. Trên CursorBench 3.2.0 – bài kiểm tra kỹ năng lập trình trong quy trình làm việc tại môi trường phát triển tích hợp (IDE) – mô hình này đạt 73,4%, vượt trội hơn vài điểm so với mức 70,5% của Fable 5 và 70,0% của Opus 5.

Công việc tri thức và quy trình nghiệp vụ kinh doanh

Hiệu suất trong công việc tri thức cũng được cải thiện, nhưng thứ tự xếp hạng lại khác biệt. Trên GDPval-AA v2 – một thước đo chất lượng công việc tri thức theo hệ thống Elo – Fable 5.1 đạt 1.853 điểm, so với 1.824 điểm của Opus 5 và 1.723 điểm của Fable 5. Nếu so với Opus 5, đây là một bước tiến khiêm tốn; nhưng nếu so với Fable 5, đó là một bước tiến thực sự đáng kể. Đối với AutomationBench (bao gồm các tác vụ tự động hóa quy trình công việc kinh doanh), sự chênh lệch giữa các mô hình thể hiện rõ rệt hơn: Fable 5.1 đạt 31,4%, Opus 5 đạt 26,9% và Fable 5 đạt 17,1%. Anthropic lưu ý rằng Fable 5 bị chấm điểm 0 ở những tác vụ mà các cơ chế bảo vệ (safeguards) can thiệp, do đó con số thấp nhất này nên được xem là mức sàn.

Khả năng suy luận và sử dụng máy tính

Kết quả ở hạng mục suy luận học thuật cho thấy sự chênh lệch ít nhất giữa các mô hình. Trong bài kiểm tra Humanity's Last Exam, Fable 5.1 đạt 60,9% khi không dùng công cụ và 65,0% khi có dùng công cụ; các con số tương ứng của Fable 5 là 57,8% và 63,8%, còn Opus 5 là 56,6% và 63,6%. Anthropic không công bố điểm số của GPT-5.6 Sol cho bài kiểm tra benchmark này.

Kết quả ở hạng mục sử dụng máy tính có vẻ ấn tượng hơn nhưng lại khó kiểm chứng độ tin cậy. Fable 5.1 dẫn đầu trong bài kiểm tra OSWorld 2.0 với 77,9% ở thiết lập một phần và 41,7% ở thiết lập nghiêm ngặt, so với mức 75,4% và 39,6% của Opus 5. Anthropic thực hiện chấm điểm dựa trên bộ tác vụ được tác giả bài kiểm tra công bố vào tháng 8 năm 2026, vì vậy các con số này không thể so sánh trực tiếp với kết quả OSWorld 2.0 đã công bố trước đó; ngoài ra, cả hai mô hình Fable đều bị chấm điểm 0 ở những tác vụ mà các cơ chế bảo vệ can thiệp.

Một lưu ý quan trọng áp dụng cho toàn bộ bảng kết quả: Trong các trường hợp cơ chế bảo vệ chặn một tác vụ, Anthropic đã giao phần việc liên quan đến an ninh mạng cho Claude Opus 4.8 và phần việc sinh học cho Claude Opus 5 thực hiện; theo công ty, điều này có khả năng làm giảm điểm số thực tế của Fable thay vì làm tăng điểm số một cách ảo.

Giá cả và tình trạng sẵn sàng của Claude Fable 5.1

Fable 5.1 có giá 10 USD cho mỗi triệu token đầu vào và 50 USD cho mỗi triệu token đầu ra, mức giá tương đương với Fable 5. Chi phí đọc từ cache ghi nhận sự thay đổi lớn nhất, giảm 75% xuống còn 0,25 USD mỗi triệu token.

Giá Giá mỗi triệu token
Input $10
Output $50
Đọc cache $0.25
Ghi cache (5 phút) $12.50
Ghi cache (1 giờ) $20
Batch API Giảm giá 50% cho đầu vào và đầu ra

Theo ước tính của Anthropic, tác động tổng thể là chi phí giảm khoảng 25% đối với các khối lượng công việc thông thường được tính phí theo token, và lên tới khoảng 45% đối với những tác vụ lập trình phức tạp cũng như các tác vụ agentic. Thông tin về việc liệu các token dùng cho suy luận có bị tính phí theo mức giá của token đầu ra hay không hiện chưa được công bố; điều này đặc biệt quan trọng trong trường hợp này vì cơ chế "tư duy" luôn được kích hoạt.

Fable 5.1 hiện đã được phát hành rộng rãi trên các nền tảng, bao gồm Amazon Web Services, Google Cloud và Microsoft Azure. Tuy nhiên, Mythos 5.1 thì chưa: phiên bản này được cung cấp cho các chuyên gia an ninh mạng và nhà khoa học sự sống đã qua kiểm duyệt thông qua các chương trình CVP và LSVP (hiện bao gồm các tổ chức tại Hoa Kỳ), và Anthropic đang phối hợp với chính phủ Hoa Kỳ để mở rộng phạm vi tiếp cận.

Có hai thay đổi nhỏ khác ảnh hưởng đến các nhà phát triển:

  • Các tài khoản API mới được tạo kể từ ngày ra mắt sẽ không còn có thể chỉnh sửa ngữ cảnh trước đó của Claude trong một cuộc hội thoại nhiều lượt mà vẫn giữ lại được bản ghi quá trình suy luận trước đó của mô hình; đây là biện pháp ngăn chặn kỹ thuật "anti-distillation'' sẽ được áp dụng cho tất cả mọi tài khoản trong các bản phát hành tương lai.
  • Tuân thủ Bộ quy tắc thực hành về tính minh bạch của nội dung do AI tạo ra thuộc Đạo luật AI của EU, Anthropic cũng sẽ gắn watermark vào nội dung đầu ra từ các mô hình được phát hành sau ngày 2 tháng 8 năm 2026, đồng thời một API phát hiện nội dung AI cũng đang được triển khai dưới dạng thử nghiệm giới hạn.

Làm thế nào để truy cập Claude Fable 5.1?

Mã định danh mô hình (model ID) mà nhà phát triển cần nhập là claude-fable-5-1; mã này đã có hiệu lực trên Claude API ngay từ ngày ra mắt. Ngoài API chính thức, Fable 5.1 còn có mặt trên Claude Code, Claude Cowork, Claude.ai và các nền tảng đám mây lớn, với Amazon Bedrock, Google's Agent Platform và Microsoft Foundry là những nền tảng hỗ trợ tính năng EFS.

Một lệnh gọi API tối giản sẽ có dạng như sau:

from anthropic import Anthropic

client = Anthropic()

response = client.messages.create(
    model="claude-fable-5-1",
    max_tokens=1024,
    messages=[
        {"role": "user", "content": "Trace this crash to its root cause and explain the fix."}
    ],
)

print(response.content[0].text)

Để biết quy trình thiết lập đầy đủ, bao gồm các tùy chọn kiểm soát chi phí và truyền tải dữ liệu dạng luồng (stream), vui lòng tham khảo hướng dẫn chi tiết về Claude APII của Quantrimang.com. 

Kết luận

Anthropic đang đặt cược rằng ranh giới tiên phong sẽ được đo lường bằng số giờ hệ thống tự vận hành (không cần sự can thiệp của con người) thay vì số lượt trao đổi trong khung chat, và họ đã định giá Fable 5.1 sao cho mức chi phí cho nước đi này trở nên rất hợp lý. Việc giữ nguyên giá niêm yết trong khi giảm 75% chi phí đọc dữ liệu từ cache là một động thái thú vị hơn nhiều so với bất kỳ chỉ số đo lường hiệu năng (benchmark) đơn lẻ nào, bởi nó nhắm trực tiếp vào kiểu khối lượng công việc duy nhất mà mức giá 50 USD cho đầu ra vẫn có thể chấp nhận được về mặt chi phí.

Một số người sẽ chuyển ngay sang dùng Fable 5 và để các công việc thường nhật cho Sonnet 5 hoặc Opus 5 xử lý. Điều khiến họ còn chút đắn đo là sự xuất hiện dày đặc của các giá trị "0" (biểu thị sự hạn chế hoặc chưa có dữ liệu) trong bảng thông số của chính Anthropic, cũng như thực tế là những kết quả khoa học ấn tượng nhất lại đến từ Mythos 5.1 - phiên bản mà hầu như không ai trong số độc giả ở đây có thể tiếp cận được.

Thứ Sáu, 04/09/2026 17:06
51 👨 3
Xác thực tài khoản!

Theo Nghị định 147/2024/ND-CP, bạn cần xác thực tài khoản trước khi sử dụng tính năng này. Chúng tôi sẽ gửi mã xác thực qua SMS hoặc Zalo tới số điện thoại mà bạn nhập dưới đây:

Số điện thoại chưa đúng định dạng!
Số điện thoại này đã được xác thực!
Bạn có thể dùng Sđt này đăng nhập tại đây!
Lỗi gửi SMS, liên hệ Admin
0 Bình luận
Sắp xếp theo
❖ Claude