Anthropic ra mắt Claude Opus 5

Anthropic vừa phát hành Claude Opus 5, mô hình tiệm cận sức mạnh của Claude Fable 5 nhưng chi phí chỉ bằng một nửa.

Khuya ngày 24/07/2026, công ty AI Anthropic ra mắt mô hình AI mới Claude Opus 5 và phát hành lên toàn bộ nền tảng của mình. Claude Opus 5 được Anthropic định hướng là mô hình cho các tác vụ hàng ngày với chi phí tiết kiệm hơn các mô hình khác.

Anthropic ra mắt Claude Opus 5 với giá bằng Opus 4.8

Ở các bài kiểm tra lập trình và công việc tri thức như Frontier-Bench hay GDPval-AA, Opus 5 dẫn đầu, dù vẫn xếp sau Mythos 5 trong nhóm tác vụ an ninh mạng. Trên Frontier-Bench v0.1, mô hình vượt mọi đối thủ và đạt hơn gấp đôi kết quả của Opus 4.8 với chi phí thấp hơn cho mỗi tác vụ. Ở CursorBench 3.2 tại mức nỗ lực cao nhất, Opus 5 chỉ kém Fable 5 khoảng 0,5%, nhưng chi phí mỗi tác vụ chỉ bằng một nửa.

Nhóm bài kiểm tra giải quyết vấn đề cho kết quả tương tự. Với ARC-AGI 3, phép thử buộc mô hình xử lý những bài toán chưa từng gặp, điểm của Opus 5 cao gấp ba lần mô hình xếp ngay sau. Ở Zapier AutomationBench, thang đo khả năng hoàn thành trọn vẹn một tác vụ công việc, tỉ lệ vượt qua của nó gấp khoảng 1,5 lần mô hình kế tiếp ở cùng mức chi phí. Ngay tại mức nỗ lực thấp nhất, Opus 5 vẫn giải được nhiều bài hơn bất kỳ mô hình nào khác. Trên OSWorld 2.0, bài kiểm tra khả năng điều khiển máy tính, nó vượt thành tích tốt nhất của Fable 5 với chi phí chỉ hơn một phần ba.

Opus 5 vượt trội hơn Fable 5 trong nhiều bài kiểm tra
Opus 5 vượt trội hơn Fable 5 trong nhiều bài kiểm tra

Về nghiên cứu khoa học, Opus 5 nhỉnh hơn Opus 4.8 ở tất cả các bài đánh giá khoa học sự sống. Mức cải thiện rõ nhất nằm ở hóa hữu cơ, chẳng hạn suy ra cấu trúc phân tử từ dữ liệu phổ, và ở nhóm bài về protein như dự đoán biến thể trong chuỗi protein tác động thế nào tới chức năng của nó.

Điểm khác biệt được Anthropic nhấn mạnh là khả năng tự kiểm chứng và kiên trì làm lại cho tới khi thành công. Trong một bài kiểm tra Frontier-Bench, mô hình nhận bản vẽ một chi tiết máy và phải viết mã dựng lại thành mô hình 3D bằng FreeCAD, nhưng cố tình không được cấp cách nào để xem trực tiếp bản vẽ. Opus 5 tự viết một quy trình thị giác máy tính để bóc hình học ra từ điểm ảnh thô, rồi dựng lại toàn bộ chi tiết. Nó lặp lại thành công nhiều lần, trong khi không mô hình đối thủ nào ở cùng điều kiện giải nổi sau năm lần thử.

Opus 5 là mô hình AI có hành vi lệch chuẩn thấp nhất trong số các mô hình đã phát hành của Anthropic
Opus 5 là mô hình AI có hành vi lệch chuẩn thấp nhất trong số các mô hình đã phát hành của Anthropic

Hai ví dụ khác cũng theo hướng đó. Với một lỗi có thật trong trình quản lý gói mã nguồn mở phổ biến, Opus 5 tìm ra nguyên nhân gốc và vá thêm một trường hợp mà bản vá của cộng đồng đã bỏ sót; một mô hình đối thủ chỉ chữa triệu chứng bề mặt rồi báo đã xong. Một kĩ sư tại công ty giao dịch dùng nó dựng luồng dữ liệu thị trường cho một sàn giao dịch mới chỉ trong một phiên làm việc, việc mà các mô hình trước không hoàn thành nổi dù đã có kế hoạch chi tiết. Không tìm được luồng dữ liệu trực tiếp để đối chiếu, mô hình tự dựng bộ kiểm thử riêng để xác nhận mã của mình đọc đúng dữ liệu của sàn.

Ở khâu căn chỉnh, đợt kiểm tra hành vi tự động trước khi triển khai xếp Opus 5 là mô hình bám sát Hiến pháp của Claude tốt nhất từ trước tới nay, hơn cả Opus 4.8, Sonnet 5 lẫn Fable 5. Nó đạt 2,3 điểm về hành vi lệch chuẩn tổng thể, thấp nhất trong các mô hình gần đây, đồng thời ít có hành vi che giấu ý định nhất và khó bị dụ vào mục đích xấu nhất.

Về an ninh, Anthropic khẳng định mô hình không đẩy biên năng lực ở các mảng lưỡng dụng rủi ro. Qua các đợt đánh giá cùng đối tác tư nhân và cơ quan nhà nước, Opus 5 vẫn đứng sau Mythos 5 ở cả nghiên cứu sinh học lẫn tấn công mạng. Anthropic chủ động không huấn luyện mô hình trên tác vụ an ninh mạng, nhưng năng lực chung đi lên kéo theo cả mảng này, tới mức nó gần chạm Mythos 5 ở khâu tìm lỗ hổng. Bài kiểm tra OSS-Fuzz cho thấy rõ giới hạn: hai mô hình phát hiện lỗ hổng ngang ngửa nhau nhưng điểm viết mã khai thác của Opus 5 còn cách Mythos 5 rất xa.

Opus 5 có khả năng tìm lỗ hổng bảo mật ngang ngửa Fable 5
Opus 5 có khả năng tìm lỗ hổng bảo mật ngang ngửa Fable 5

Bộ rào chắn đi kèm Claude Opus 5 cũng được nới ra so với Fable 5. Các bộ phân loại an ninh mạng của Opus 5 dễ thở hơn so với Fable 5, cho phép mô hình dò lỗ hổng trong mã nguồn nhưng chặn quét lỗ hổng dạng nhị phân, kiểm thử xâm nhập và tạo mã khai thác. Anthropic ước tính chúng can thiệp ít hơn khoảng 85% so với Fable 5. Trên Claude.ai, Claude Code và Claude Cowork, yêu cầu bị gắn cờ sẽ tự chuyển sang Opus 4.8, và người dùng API cũng có thể bật cơ chế này. Nhóm doanh nghiệp cùng nhà nghiên cứu thuộc Cyber Verification Program được dùng phiên bản Opus 5 ít ràng buộc hơn.

Ở mảng sinh học, do bộ rào chắn tương đương Opus 4.8, Claude Opus 5 trở thành mô hình phổ thông mạnh nhất của Anthropic cho nghiên cứu khoa học, dù vẫn hạn chế với các tác vụ nghiên cứu tự chủ kéo dài. Sau khi Opus 5 ra mắt, các yêu cầu liên quan tới sinh học bị chặn ở Fable 5 sẽ chuyển sang Opus 5 thay vì Opus 4.8.

Claude Opus 5 có giá 5 USD cho mỗi triệu token đầu vào và 25 USD cho mỗi triệu token đầu ra, ngang Opus 4.8. Các lập trình viên muốn sử dụng mô hình này có thể chọn claude-opus-5 thông qua Claude API. Tương tự Opus 4.8, Opus 5 cũng có chế độ Fast Mode chạy nhanh hơn khoảng 2,5 lần so với tốc độ mặc định (giá cũng gấp đôi giá mặc định).

Nhân dịp ra mắt mô hình AI mới, Anthropic còn mở thử nghiệm hai tính năng: đổi bộ công cụ ngay giữa một cuộc hội thoại mà không làm hỏng bộ nhớ đệm câu lệnh, và tự động chuyển yêu cầu bị gắn cờ sang mô hình khác thay vì chặn thẳng. Như các đời Opus trước, Opus 5 không kèm yêu cầu lưu trữ dữ liệu với truy cập phổ thông.

Thêm hanthienhai.com vào danh sách nguồn ưu tiên trên Google

Theo dõi
Thông báo của
guest
0 Comments
Cũ nhất
Mới nhất Được bỏ phiếu nhiều nhất