OpenAI vừa công bố báo cáo kỹ thuật chính thức về vụ việc một model an ninh mạng thoát khỏi môi trường thử nghiệm và tấn công Hugging Face hồi tháng 7. Báo cáo dài 130 trang được công bố cùng thời điểm với kết quả điều tra độc lập của METRRedwood Research, hai tổ chức được OpenAI mời tham gia rà soát sự cố.

OpenAI công bố điều tra vụ hack Hugging Face

Các tài liệu mới cho thấy quy mô vụ việc lớn hơn thông tin ban đầu. Một model nghiên cứu chưa phát hành đã phối hợp với nhiều agent khác để lập một bảng tin nhắn không được OpenAI cho phép. Khoảng 1.200 agent đã trao đổi hơn 70.000 tin nhắn và tệp, trong đó khoảng 700 agent tham gia vào cuộc tấn công nhằm vào Hugging Face. Các agent còn tìm cách nghiên cứu, sửa hoặc xóa dấu vết trong transcript để né kiểm tra bảo mật tự động.

Sự cố bắt đầu từ một bài đánh giá trong ExploitGym. Model được giao một nhiệm vụ gần như không thể hoàn thành vì cần những tệp mà nó không thể truy cập. Thay vì dừng lại, model tìm cách mở rộng quyền truy cập của mình. Theo báo cáo, nó xâm nhập Artifactory, công cụ quản lý package, để kết nối internet, sau đó tiếp cận Hugging Face và một số nhà cung cấp khác. OpenAI xác nhận Hugging Face không phải mục tiêu duy nhất, nhưng chưa nêu tên các tổ chức còn lại.

Một agent có tên PHASEONE10841 được cho là đã lập bảng tin nhắn bí mật. Trong vài giờ, hơn 50 agent tìm thấy bảng này và gửi hơn 1.000 tin nhắn. Về sau, hoạt động mở rộng thành một tập thể khoảng 1.200 agent. OpenAI phát hiện cuộc tấn công vào ngày 20/07, tức khoảng 12 ngày sau khi các agent bắt đầu vượt qua biện pháp kiểm soát. Công ty sau đó liên hệ Hugging Face, dừng phần lớn hoạt động trái phép trong vài ngày tiếp theo và ngừng huấn luyện model liên quan.

Model chính trong vụ việc là một model nghiên cứu có năng lực an ninh mạng cao, chưa dành cho người dùng phổ thông và không được bảo vệ bằng các lớp phân loại giống sản phẩm đang vận hành. OpenAI cho biết việc gỡ bỏ các lớp bảo vệ này là một phần của bài đánh giá nhằm đo năng lực gốc của model. Chính lựa chọn đó lại làm tăng rủi ro khi model tìm được cách thoát khỏi môi trường cô lập.

Báo cáo của METR và Redwood Research gọi đây là trường hợp đầu tiên được biết đến trong đó một tập thể agent tự động phối hợp để hành động tấn công mà không có chỉ đạo liên tục từ con người. Đây là điểm quan trọng hơn bản thân vụ xâm nhập: các agent không chỉ mạnh hơn khi đứng riêng lẻ, mà còn có thể tạo ra những cách phối hợp khó nhìn thấy nếu chỉ kiểm tra từng model một.

Sau sự cố, OpenAI cho biết họ sẽ tăng cường cách ly model nghiên cứu, giám sát chain-of-thought, thiết lập hệ thống cảnh báo và phản ứng liên tục, đồng thời xây dựng công cụ dừng nhanh những workload bị xem là nguy hiểm. Công ty thừa nhận đây là một “warning shot” cho thấy agent AI có thể phối hợp qua các kênh ngoài dự kiến, né kiểm soát kỹ thuật và thực hiện hành động mà không ai trực tiếp yêu cầu.