Claude Opus 4.6 mới cải tiến kỹ năng lập trình so với phiên bản tiền nhiệm. Nó lập kế hoạch cẩn thận hơn, duy trì các tác vụ tự động lâu hơn, có thể hoạt động đáng tin cậy trong các cơ sở code lớn hơn, có kỹ năng xem xét code và gỡ lỗi tốt hơn để tự phát hiện lỗi của mình. Và, lần đầu tiên đối với các mô hình thuộc lớp Opus, Opus 4.6 có cửa sổ ngữ cảnh 1 triệu token trong phiên bản beta1.
Opus 4.6 cũng có thể áp dụng các khả năng được cải tiến của mình cho một loạt những tác vụ công việc hàng ngày: Chạy phân tích tài chính, nghiên cứu và sử dụng cũng như tạo tài liệu, bảng tính và bài thuyết trình. Trong Cowork, nơi Claude có thể tự động thực hiện đa nhiệm, Opus 4.6 sử dụng tất cả các kỹ năng này để hỗ trợ bạn.
Hiệu năng của mô hình đạt mức tiên tiến nhất trên nhiều bài kiểm tra. Ví dụ, nó đạt điểm cao nhất trong bài kiểm tra agentic coding Terminal-Bench 2.0 và dẫn đầu tất cả các mô hình tiên tiến khác trên Humanity’s Last Exam, một bài kiểm tra suy luận đa ngành phức tạp. Trên GDPval-AA - một bài kiểm tra đánh giá hiệu năng trên các nhiệm vụ công việc tri thức có giá trị kinh tế trong lĩnh vực tài chính, pháp luật và những lĩnh vực khác2 - Opus 4.6 vượt trội hơn mô hình tốt thứ hai trong ngành (GPT-5.2 của OpenAI) khoảng 144 điểm Elo3, và vượt trội hơn chính phiên bản tiền nhiệm của nó (Claude Opus 4.5) 190 điểm. Opus 4.6 cũng hoạt động tốt hơn bất kỳ mô hình nào khác trên BrowseComp, bài kiểm tra đo lường khả năng của mô hình trong việc tìm kiếm thông tin khó tìm trực tuyến.
Opus 4.6 cũng cho thấy hồ sơ an toàn tổng thể tốt bằng hoặc tốt hơn bất kỳ mô hình tiên tiến nào khác trong ngành, với tỷ lệ hành vi không phù hợp thấp trên các bài kiểm tra an toàn.
Trong Claude Code, giờ đây bạn có thể tập hợp các nhóm agent để cùng nhau thực hiện các nhiệm vụ. Trên API, Claude có thể sử dụng tính năng nén để tóm tắt ngữ cảnh của chính nó và thực hiện các tác vụ dài hơn mà không gặp phải giới hạn. Claude cũng đang giới thiệu tư duy thích ứng, trong đó mô hình có thể nắm bắt các manh mối ngữ cảnh về mức độ sử dụng tư duy mở rộng của nó, và những điều khiển nỗ lực mới để cung cấp cho các nhà phát triển nhiều quyền kiểm soát hơn đối với trí thông minh, tốc độ và chi phí.
Nhà phát triển cũng đã thực hiện các nâng cấp đáng kể cho Claude trong Excel, và sẽ phát hành Claude trong PowerPoint trong bản xem trước nghiên cứu. Điều này làm cho Claude trở nên hữu ích hơn nhiều cho công việc hàng ngày.
Claude Opus 4.6 hiện có sẵn trên claude.ai, API và tất cả các nền tảng đám mây chính. Nếu bạn là nhà phát triển, hãy sử dụng claude-opus-4-6 thông qua API của Claude. Giá vẫn giữ nguyên ở mức 5$/25$ cho mỗi triệu token.
Ấn tượng ban đầu
Claude được xây dựng bằng chính nó. Các kỹ sư viết code bằng Claude Code mỗi ngày, và mọi mô hình mới đều được kiểm thử trên chính công việc của mình trước tiên. Với Opus 4.6, mô hình tập trung hơn vào những phần khó khăn nhất của một nhiệm vụ mà không cần phải chỉ dẫn, xử lý nhanh chóng các phần đơn giản hơn, giải quyết những vấn đề mơ hồ với khả năng phán đoán tốt hơn và duy trì năng suất trong các phiên làm việc dài hơn.
Opus 4.6 thường suy nghĩ sâu sắc hơn và xem xét lại lý luận của mình cẩn thận hơn trước khi đưa ra câu trả lời. Điều này tạo ra kết quả tốt hơn đối với các vấn đề khó hơn, nhưng có thể làm tăng chi phí và độ trễ đối với những vấn đề đơn giản hơn. Nếu thấy rằng mô hình đang suy nghĩ quá nhiều về một nhiệm vụ nhất định, bạn nên giảm nỗ lực từ cài đặt mặc định (cao) xuống trung bình. Bạn có thể dễ dàng kiểm soát điều này bằng tham số /effort.
Đánh giá Claude Opus 4.6
Trên các lĩnh vực lập trình agent, sử dụng máy tính, dùng công cụ, tìm kiếm và tài chính, Opus 4.6 là một mô hình hàng đầu trong ngành, thường vượt trội hơn hẳn. Bảng dưới đây cho thấy Claude Opus 4.6 so sánh với các mô hình trước đây và các mô hình khác trong ngành trên nhiều tiêu chí đánh giá.
Opus 4.6 tốt hơn nhiều trong việc truy xuất thông tin liên quan từ các tập tài liệu lớn. Điều này mở rộng đến những tác vụ ngữ cảnh dài, nơi nó lưu giữ và theo dõi thông tin trên hàng trăm nghìn token với độ lệch ít hơn, và phát hiện ra các chi tiết ẩn mà ngay cả Opus 4.5 cũng bỏ sót.
Một lời phàn nàn phổ biến về các mô hình AI là “sự suy giảm ngữ cảnh”, trong đó hiệu suất giảm sút khi những cuộc hội thoại vượt quá một số lượng từ nhất định. Opus 4.6 hoạt động tốt hơn đáng kể so với các phiên bản trước: trên biến thể 8 kim 1M của MRCR v2 - một bài kiểm tra khả năng tìm kiếm thông tin “ẩn” trong lượng lớn văn bản - Opus 4.6 đạt 76%, trong khi Sonnet 4.5 chỉ đạt 18,5%. Đây là một sự thay đổi về chất lượng trong việc một mô hình thực sự có thể sử dụng bao nhiêu ngữ cảnh trong khi vẫn duy trì hiệu suất cao nhất.
Tóm lại, Opus 4.6 tốt hơn trong việc tìm kiếm thông tin trong các ngữ cảnh dài, tốt hơn trong việc suy luận sau khi tiếp thu thông tin đó, và có khả năng suy luận ở cấp độ chuyên gia tốt hơn đáng kể nói chung.
Cuối cùng, các biểu đồ bên dưới cho thấy hiệu suất của Claude Opus 4.6 trên nhiều tiêu chí đánh giá khác nhau, bao gồm kỹ năng Software Engineering, khả năng lập trình đa ngôn ngữ, tính nhất quán lâu dài, khả năng an ninh mạng và kiến thức về khoa học sự sống.
Một bước tiến về an toàn
Những tiến bộ về trí tuệ này không phải trả giá bằng sự an toàn. Trong cuộc kiểm tra hành vi tự động, Opus 4.6 cho thấy tỷ lệ hành vi không phù hợp thấp, chẳng hạn như lừa dối, nịnh hót, khuyến khích ảo tưởng của người dùng và hợp tác với việc lạm dụng. Nhìn chung, nó phù hợp tốt như phiên bản tiền nhiệm của nó, Claude Opus 4.5, vốn là mô hình tiên phong phù hợp nhất cho đến nay. Opus 4.6 cũng cho thấy tỷ lệ từ chối quá mức thấp nhất - nơi mô hình không trả lời các truy vấn vô hại - so với bất kỳ mô hình Claude gần đây nào.
Claude Opus 4.6 đã thực hiện bộ đánh giá an toàn toàn diện nhất so với bất kỳ mô hình nào khác, áp dụng nhiều bài kiểm tra khác nhau lần đầu tiên và nâng cấp một số bài kiểm tra đã sử dụng trước đây, bao gồm các đánh giá mới về sự an toàn của người dùng, những bài kiểm tra phức tạp hơn về khả năng từ chối các yêu cầu có khả năng nguy hiểm của mô hình, và những đánh giá được cập nhật về khả năng thực hiện các hành động gây hại một cách lén lút của mô hình. Các phương pháp mới, từ khả năng giải thích, khoa học về hoạt động bên trong của các mô hình AI, cũng đã được thử nghiệm để bắt đầu hiểu tại sao mô hình lại hành xử theo những cách nhất định - và cuối cùng, để phát hiện ra các vấn đề mà các bài kiểm tra tiêu chuẩn có thể bỏ sót.
Anthropic cũng đã áp dụng các biện pháp bảo vệ mới trong những lĩnh vực mà Opus 4.6 thể hiện những điểm mạnh đặc biệt, có thể bị lạm dụng cả về mặt nguy hiểm lẫn có lợi. Cụ thể, vì mô hình cho thấy khả năng an ninh mạng được nâng cao, 6 phương pháp thăm dò an ninh mạng mới – các phương pháp phát hiện phản hồi có hại – đã dược phát triển để giúp theo dõi những hình thức lạm dụng tiềm tàng khác nhau.
Anthropic cũng đang đẩy nhanh việc sử dụng mô hình này trong phòng thủ mạng, sử dụng nó để giúp tìm và vá các lỗ hổng trong phần mềm mã nguồn mở. Anthropic cho rằng việc các chuyên gia phòng thủ mạng sử dụng các mô hình AI như Claude là rất quan trọng để giúp tạo ra một sân chơi công bằng. An ninh mạng phát triển rất nhanh, và công ty sẽ điều chỉnh và cập nhật các biện pháp bảo vệ của mình khi tìm hiểu thêm về những mối đe dọa tiềm tàng; trong tương lai gần, Anthropic có thể sẽ triển khai can thiệp theo thời gian thực để ngăn chặn hành vi lạm dụng.
Cập nhật sản phẩm và API
Những cập nhật quan trọng trên Claude, Claude Code và Claude Platform để giúp Opus 4.6 đạt hiệu suất tối ưu đã được thử nghiệm.
Claude Platform
Đối với API, Claude mang đến cho các nhà phát triển khả năng kiểm soát tốt hơn về mức độ nỗ lực của mô hình và sự linh hoạt cao hơn cho các agent hoạt động trong thời gian dài. Để đạt được điều này, Claude Opus 4.6 giới thiệu các tính năng sau:
- Tư duy thích ứng (Adaptive thinking). Trước đây, nhà phát triển chỉ có lựa chọn nhị phân là bật hoặc tắt chế độ tư duy mở rộng. Giờ đây, với tư duy thích ứng, Claude có thể tự quyết định khi nào việc suy luận sâu hơn sẽ mang lại hiệu quả. Ở mức nỗ lực mặc định (cao), mô hình sẽ sử dụng tư duy mở rộng khi cần thiết, nhưng nhà phát triển có thể điều chỉnh mức độ nỗ lực để tăng hoặc giảm tính chọn lọc của quy trình này.
- Mức độ nỗ lực (Effort). Hiện có bốn mức độ nỗ lực để lựa chọn: thấp, trung bình, cao (mặc định) và tối đa. Các nhà phát triển được khuyến khích thử nghiệm nhiều tùy chọn khác nhau để tìm ra phương án phù hợp nhất.
- Nén ngữ cảnh (Context compaction - bản beta). Các cuộc hội thoại kéo dài và những tác vụ agentic thường chạm giới hạn cửa sổ ngữ cảnh. Tính năng nén ngữ cảnh sẽ tự động tóm tắt và thay thế dữ liệu ngữ cảnh cũ hơn khi cuộc hội thoại tiến gần đến một ngưỡng có thể tùy chỉnh, cho phép Claude thực hiện các tác vụ dài hơn mà không bị gián đoạn bởi giới hạn này.
- Ngữ cảnh 1 triệu token (bản beta). Opus 4.6 là mô hình thuộc dòng Opus đầu tiên hỗ trợ ngữ cảnh lên tới 1 triệu token. Mức giá cao cấp áp dụng cho các câu lệnh (prompt) vượt quá 200.000 token (10 USD/37,50 USD cho mỗi triệu token đầu vào/đầu ra); tính năng này chỉ khả dụng trên Claude Platform.
- Đầu ra 128.000 token. Opus 4.6 hỗ trợ đầu ra lên tới 128.000 token, cho phép Claude hoàn thành các tác vụ yêu cầu lượng dữ liệu đầu ra lớn mà không cần chia nhỏ thành nhiều yêu cầu riêng biệt.
- Suy luận chỉ tại Hoa Kỳ (US-only inference). Đối với các khối lượng công việc cần thực hiện tại Hoa Kỳ, tùy chọn suy luận chỉ tại Hoa Kỳ hiện đã khả dụng với mức giá token gấp 1,1 lần.
Cập nhật sản phẩm
Cả Claude và Claude Code đã bổ sung các tính năng giúp nhân sự tri thức và nhà phát triển giải quyết những tác vụ phức tạp hơn, đồng thời tận dụng tối đa các công cụ mà họ sử dụng hàng ngày.
Tính năng "nhóm agent" được giới thiệu trong Claude Code dưới dạng bản xem trước nghiên cứu (research preview). Giờ đây, bạn có thể khởi chạy nhiều agent hoạt động song song như một nhóm và phối hợp tự động - đây là giải pháp tối ưu cho các tác vụ có thể chia nhỏ thành những phần việc độc lập, thiên về đọc dữ liệu như rà soát codebase. Bạn có thể trực tiếp tiếp quản bất kỳ subagent nào bằng cách sử dụng tổ hợp phím Shift+Lên/Xuống hoặc tmux.
Claude hiện cũng hoạt động hiệu quả hơn với các công cụ văn phòng mà bạn đang sử dụng. Khi tích hợp vào Excel, Claude xử lý tốt các tác vụ phức tạp và tốn nhiều thời gian với hiệu suất được cải thiện; công cụ này có khả năng lập kế hoạch trước khi thực hiện, tiếp nhận dữ liệu phi cấu trúc rồi tự động xác định cấu trúc phù hợp mà không cần hướng dẫn, cũng như xử lý những thay đổi gồm nhiều bước chỉ trong một lần thực hiện. Khi kết hợp với Claude trong PowerPoint, bạn có thể xử lý và sắp xếp dữ liệu trong Excel trước, sau đó trực quan hóa chúng một cách sinh động trên PowerPoint. Claude nhận diện bố cục, phông chữ và slide master để đảm bảo tính nhất quán với bộ nhận diện thương hiệu, bất kể bạn đang xây dựng bài thuyết trình từ mẫu có sẵn hay tạo mới toàn bộ từ phần mô tả. Claude trong PowerPoint hiện đã có sẵn dưới dạng bản preview dành cho các gói dịch vụ Max, Team và Enterprise.
Hướng dẫn AI
AI Tools
Học IT
AI
Hàm Excel