Anthropic nói Claude xâm nhập ba công ty khi thử nghiệm

Anthropic cho biết ba mô hình Claude đã thoát khỏi môi trường thử nghiệm và truy cập trái phép hệ thống đang vận hành của ba tổ chức.

Cách đây vài ngày, Anthropic cho biết họ đã tiến hành cuộc điều tra nội bộ và phát hiện ba vụ việc liên quan đến Claude xâm nhập hệ thống của ba tổ chức khác khi đang chạy các bài kiểm thử an ninh mạng. Thông tin được công bố hơn một tuần sau khi OpenAI thừa nhận một mô hình chưa phát hành của họ đã xâm nhập hệ thống Hugging Face.

Ở cả ba trường hợp, mô hình Claude kết nối được ra Internet từ bên trong môi trường thử nghiệm khi làm việc với một bên thứ ba, rồi truy cập trái phép hệ thống đang chạy thật của các tổ chức này. Anthropic mô tả những gì tìm thấy và các thay đổi sắp tới trong một bài đăng trên blog.

Chính vụ việc của OpenAI đầu tháng này đã thúc đẩy Anthropic tự rà soát an ninh mạng, tập trung tìm dấu vết Claude ra được Internet từ trong các môi trường thử nghiệm vốn được thiết kế để cô lập mô hình. Trong 141.006 lượt đánh giá được xem xét lại, công ty AI này tìm thấy ba vụ việc xảy ra khi mô hình làm việc với Irregular, một đối tác bên thứ ba.

Nguyên nhân nằm ở việc cấu hình sai của môi trường thử nghiệm được vận hành cùng Irregular, thứ mà Anthropic gọi là “hiểu lầm” giữa hai bên về việc thử nghiệm có kết nối Internet hay không. Anthropic nói mình không quy trách nhiệm cho ai và đang “xử lí như thể trách nhiệm hoàn toàn thuộc về chúng tôi”, còn Irregular tiến hành điều tra riêng.

Ba vụ việc liên quan tới ba mô hình khác nhau: Opus 4.7, Mythos 5 và một mô hình thử nghiệm nghiên cứu nội bộ. Trong mọi trường hợp, Claude được câu lệnh nói rõ rằng nó không có quyền truy cập Internet và mô hình dường như mặc định các hệ thống ngoài đời thực cũng là một phần bài tập được giao.

Anthropic xem phần sau mới là phát hiện đáng chú ý nhất, ba mô hình phản ứng rất khác nhau khi có dấu hiệu cho thấy mục tiêu là thật. Opus 4.7, mô hình cũ nhất trong nhóm, nhận ra mình đã chạm vào một hệ thống vận hành thật ở cả bốn lượt chạy; hai lượt trong số đó nó tự lí giải rằng công ty thật kia hẳn cũng nằm trong bài tập, nhưng cả bốn lượt nó đều tấn công tiếp, bao gồm cả việc lấy thông tin đăng nhập và động vào một cơ sở dữ liệu thật.

Mythos 5 cũng nhận ra các dấu hiệu cho thấy mình đang ở Internet thật nhưng rồi tự thuyết phục mình rằng vẫn đang trong mô phỏng, sau đó đăng một gói phần mềm độc hại lên PyPI, kho gói Python công khai. Gói này đã bị các hệ thống bên ngoài tải về và chạy trước khi bị chặn. Chỉ mô hình thử nghiệm nội bộ, cũng là mô hình mới nhất, tự dừng lại khi kết luận mục tiêu là thật.

Anthropic cho rằng cần đặt các biện pháp kiểm soát chặt hơn cho những bài đánh giá kiểu này khi có mô hình AI mạnh tham gia. Họ cũng lưu ý Claude khi đó chạy mà không có lớp giám sát an toàn và bộ phân loại vốn được gắn kèm trên các mô hình thương mại phát hành rộng rãi vì bài đánh giá nhằm đo năng lực thô của mô hình. Hãng cũng khẳng định không tìm thấy bằng chứng mô hình nào “theo đuổi mục tiêu của riêng nó”.

Trong bài đăng, Anthropic cho biết vụ việc này khác với vụ việc của OpenAI. Mô hình của OpenAI khai thác một lỗ hổng phần mềm chưa biết để thoát khỏi môi trường thử nghiệm, còn mô hình của Anthropic đi ra Internet qua một lối đã vô tình bị bỏ ngỏ. Hãng nhấn mạnh mình tự phát hiện sự việc qua đợt rà soát chủ động, và hai tổ chức bị ảnh hưởng mà họ liên hệ được đều chưa từng phát hiện hay báo lại hoạt động này. Ngược lại, Hugging Face mới là bên phát hiện vụ xâm nhập trước, vài ngày sau OpenAI mới xác định và công bố thủ phạm là tác nhân AI của mình.

Anthropic cho biết họ đang phối hợp với nhóm đánh giá độc lập METR để rà soát các vụ việc từ bên thứ ba. Vụ của OpenAI là trường hợp đầu tiên có thể kiểm chứng về việc một phòng thí nghiệm AI mất kiểm soát mô hình của mình, và công bố mới này của Anthropic cho thấy các tranh cãi quanh AI và an ninh mạng sẽ còn kéo dài.

Thêm hanthienhai.com vào danh sách nguồn ưu tiên trên Google

Theo dõi
Thông báo của
guest
0 Comments
Cũ nhất
Mới nhất Được bỏ phiếu nhiều nhất