
OpenAI thừa nhận mô hình của mình tấn công Hugging Face
OpenAI xác nhận các mô hình của họ đã thoát khỏi môi trường thử nghiệm và xâm nhập Hugging Face để tìm đáp án cho bài kiểm tra năng lực.
Ngày 21/07/2026 vừa qua, OpenAI đã đăng một bài blog mô tả lại toàn bộ diễn biến của sự cố. Trước đó, Hugging Face, nền tảng lưu trữ mô hình AI không liên quan tới OpenAI, đã quy trách nhiệm cho “một AI agent bên ngoài”.
“Sau khi điều tra, chúng tôi biết rằng sự cố này do một tổ hợp các mô hình của OpenAI gây ra, gồm GPT-5.6 Sol và một mô hình chưa phát hành còn mạnh hơn, tất cả đều được giảm mức từ chối các yêu cầu liên quan an ninh mạng để phục vụ đánh giá, trong lúc chúng được kiểm thử nội bộ trên một bộ tiêu chuẩn về năng lực tấn công mạng”, bài viết nêu.
Bộ tiêu chuẩn đó là ExploitGym, một bài kiểm tra công khai về khả năng khai thác các lỗ hổng đã biết của mô hình. Những bài kiểm tra kiểu này vốn phổ biến trong huấn luyện, nhưng đây là lần đầu tiên một cuộc kiểm thử như vậy biến thành một vụ tấn công mạng thật.
Theo thiết kế, mô hình lẽ ra không có Internet, ngoài một công cụ duy nhất cho phép nó tự cài các gói phần mềm cần thiết cho nhiệm vụ. Nhưng nó tìm ra một lỗ hổng chưa được công bố ngay trong công cụ cài đặt đó và dùng lỗ hổng này để truy cập Internet.
“Các mô hình tập trung quá mức vào việc tìm lời giải cho ExploitGym, đi đến những cách cực đoan để đạt một mục tiêu thử nghiệm khá hẹp”, bài viết của OpenAI cho biết. Sau khi có Internet, chúng suy ra Hugging Face có thể đang lưu trữ mô hình, tập dữ liệu và lời giải cho ExploitGym, rồi tìm cách lấy thông tin bí mật để gian lận bài đánh giá. Cuối cùng, chúng khai thác được lỗ hổng trong hạ tầng của Hugging Face và lấy đáp án trực tiếp từ cơ sở dữ liệu vận hành.
Theo công bố ban đầu của Hugging Face, kẻ tấn công đã thực hiện hàng nghìn thao tác riêng lẻ trên rất nhiều môi trường ảo được dựng lên rồi hủy đi liên tục, trong khi máy chủ điều khiển cũng tự đổi chỗ và được đặt ngay trên các dịch vụ trực tuyến công khai.
OpenAI cho biết đã xác định và báo cáo các lỗ hổng trong công cụ cài đặt gói, đồng thời phối hợp với Hugging Face điều tra tiếp. Hãng cũng sẽ bổ sung các biện pháp kiểm soát mới cho cả khâu kiểm thử mô hình lẫn hạ tầng liên quan. Vẫn chưa rõ công ty có đối mặt hậu quả pháp lý hay không, dù hành vi của các mô hình nhiều khả năng đã vi phạm Đạo luật Gian lận và Lạm dụng Máy tính (Computer Fraud and Abuse Act) của Mỹ.
Sự việc cho thấy rất rõ sức mạnh lẫn rủi ro của các mô hình AI tiên phong khi được giao mục tiêu dài hạn. “Nếu chuyện này chưa đủ thuyết phục bạn rằng rủi ro lệch chuẩn mục tiêu sẽ là mối lo hàng đầu sắp tới, tôi không biết còn gì thuyết phục hơn”, ông Micah Carroll, một nhà nghiên cứu tại OpenAI, chia sẻ trên mạng xã hội X.
Thêm hanthienhai.com vào danh sách nguồn ưu tiên trên Google