Theo OpenAI, sự việc xảy ra trong một bài kiểm tra nhằm đánh giá khả năng phòng thủ và an ninh mạng của các mô hình AI. Tuy nhiên, thay vì chỉ hoạt động trong môi trường được kiểm soát, một tác nhân tự động sử dụng mô hình GPT-5.6 Sol vừa ra mắt, cùng một mô hình mạnh hơn, đã thoát khỏi môi trường thử nghiệm và truy cập vào internet.
Tác nhân này sau đó đã sử dụng thông tin đăng nhập bị đánh cắp và khai thác một lỗ hổng bảo mật chưa từng được phát hiện để xâm nhập máy chủ của Hugging Face.
Theo công ty, hành động trên phản ánh việc hệ thống AI đã chủ động tìm mọi cách để hoàn thành mục tiêu được giao trong quá trình thử nghiệm, bao gồm thu thập thông tin bằng các phương thức mà nhóm phát triển không lường trước.
Ông Clement Delangue, đồng sáng lập Hugging Face, cho biết công ty từng nghi ngờ vụ tấn công có thể do một phòng thí nghiệm AI hàng đầu thực hiện, song ông không cho rằng OpenAI có ý đồ xấu.
"Thật đáng kinh ngạc khi tất cả những điều này lại diễn ra hoàn toàn tự động. Đây có thể là sự việc đầu tiên thuộc loại này", ông viết.
Vụ việc cũng làm dấy lên lo ngại trong giới chính trị Mỹ. Hạ nghị sĩ Greg Casar thuộc Đảng Dân chủ nhận định đây là một diễn biến "đáng báo động", đồng thời cho rằng công nghệ AI đang phát triển với tốc độ rất nhanh nhưng chưa có các quy định đủ mạnh để bảo đảm an toàn.
Ông kêu gọi áp dụng cơ chế kiểm tra an toàn độc lập đối với các hệ thống AI tiên tiến, bắt buộc công khai các sự cố an ninh và tăng cường hợp tác quốc tế trong quản lý công nghệ này.
Thông tin được công bố chỉ vài tuần sau khi Tổng thống Mỹ Donald Trump ký sắc lệnh hành pháp thiết lập khuôn khổ đánh giá rủi ro an ninh quốc gia đối với các hệ thống AI tiên tiến trước khi chúng được đưa ra thị trường.
Trong thời gian qua, nhiều chuyên gia đã cảnh báo về nguy cơ AI bị lợi dụng để tiến hành các cuộc tấn công mạng hoặc hoạt động ngoài sự kiểm soát của con người. Tháng trước, công ty AI Anthropic cũng kêu gọi toàn ngành tạm dừng phát triển những hệ thống AI mạnh nhất để có thêm thời gian xây dựng các biện pháp bảo đảm an toàn.