OpenAI ra mắt GPT-6 Astra

OpenAI vừa phát hành GPT-6 Astra, mô hình chạm ngưỡng rủi ro nghiêm trọng về an ninh mạng nên phải kèm theo loạt rào chắn mới.

Astra được OpenAI giới thiệu là mô hình thông minh nhất và bám sát ý định người dùng tốt nhất của hãng, dẫn đầu ở các mảng điều khiển máy tính, duyệt web, lập trình, an ninh mạng, khoa học và công việc chuyên môn. Mô hình này đang mở cho một nhóm tổ chức giới hạn, vài ngày tới sẽ đến tay toàn bộ người dùng ChatGPT Plus, Pro, Business và Enterprise, đồng thời sẽ có mặt trên OpenAI API, Microsoft Azure và AWS Bedrock.

Trên các bài kiểm tra năng lực, Astra đạt 97,6% ở FrontierMath Tier 4, 99,9% ở ARC-AGI-3 và 100% ở ExploitBench. Riêng con số ARC-AGI-3 là bước nhảy rất xa so với 7,8% của GPT-5.6 Sol, mô hình tiền nhiệm.

OpenAI ra mắt GPT-6 Astra

Điều khiển máy tính là năng lực được OpenAI nhấn mạnh nhất. Trong mô phỏng độ trễ trên OSWorld 2.0, Astra đạt 72,6% với khoảng 40 phút cho mỗi tác vụ, so với 65,7% và khoảng 75 phút của Sol, tức rút ngắn chừng 47% thời gian. Hãng đồng thời nâng cấp khung vận hành Codex, giúp mô hình hoàn thành tác vụ nhanh gấp 1,9 lần trải nghiệm Sol hiện tại trên bài kiểm tra Mind2Web. Ở mức năng lực này, mô hình có thể điền biểu mẫu trực tuyến, cập nhật hồ sơ khách hàng trong CRM, phân tích dữ liệu khoa học rồi dựng website và tự chạy kiểm thử giao diện.

OpenAI ra mắt GPT-6 Astra

Về an ninh mạng, Astra đạt ngưỡng Critical (nghiêm trọng) trong Preparedness Framework của OpenAI. Khi chạy không kèm rào chắn vận hành, mô hình đạt 100% ở ExploitBench so với 78,5% của Sol, và 42,4% ở ExploitGym so với 30,3%. Trên SRE-Bench, bài kiểm tra khả năng dịch ngược tệp thực thi để hiểu logic phần mềm khi không có mã nguồn, Astra giải được 88,0% nhiệm vụ ngay lần thử đầu và 99,2% trong bốn lần, so với 55,9% và 68,7% của mô hình cũ. Trong quá trình đánh giá, Astra còn tìm ra rồi khai thác hai lỗ hổng zero-day chưa từng được biết tới, và hãng cho biết đã báo cả hai cho đơn vị bảo trì phần mềm. Bản phát hành lần này từ chối các tác vụ như tạo mã khai thác mẫu, chỉ phục vụ những việc mang tính phòng thủ như rà soát và vá mã nguồn.

OpenAI ra mắt GPT-6 Astra

Ở mảng an toàn, OpenAI dựng một bài đánh giá mới lấy cảm hứng từ sự cố Hugging Face, đo xem mô hình có vượt ra ngoài phạm vi được giao khi gặp nhiệm vụ khó hoặc bất khả thi hay không. Sol vượt phạm vi trong 48% số trường hợp khi chạy không kèm rào chắn, còn Astra là 0%. Tỉ lệ mô hình mô tả sai về năng lực của chính nó cũng giảm từ 12,2% xuống 4,2%. Đổi lại, phần suy luận viết ra của Astra khó giám sát hơn Sol trong các bài kiểm tra cố tình yêu cầu mô hình né tránh giám sát, điều mà hãng thừa nhận là điểm lùi đáng lo.

Trên OpenAI API, mô hình mang mã gpt-6-astra với giá 10 USD cho mỗi triệu token đầu vào và 50 USD cho mỗi triệu token đầu ra. Chế độ Fast mode chạy nhanh gấp đôi mức tiêu chuẩn và tính giá gấp đôi.

“Trên ARC-AGI-3, Astra vượt mốc hiệu suất hành động của con người ở 96% số màn, gần như chạm mức ngang con người trên bài kiểm tra này. Đây không chỉ là mô hình tốt nhất chúng tôi từng thử nghiệm, mà còn là một bước chuyển đáng kể về hiệu năng của mô hình tiên phong”, ông Greg Kamradt của ARC Prize Foundation chia sẻ.

Thêm hanthienhai.com vào danh sách nguồn ưu tiên trên Google

Theo dõi
Thông báo của
guest
0 Comments
Cũ nhất
Mới nhất Được bỏ phiếu nhiều nhất