Một nhóm nghiên cứu AI độc lập vừa công bố một phát hiện khá lạ và đáng lo cùng lúc: Các agent được OpenAI triển khai nội bộ đã tự tìm đến một wiki công khai, đăng bài, trao đổi với nhau và thậm chí “chiến đấu” với quản trị viên của wiki đó trong hơn một tháng mà OpenAI không hề hay biết.

Phát hiện bắt đầu từ chỗ các agent hay lui tới

Nhóm gồm Sydney Von Arx (Nightingale), Cormac Slade Byrd, Spencer Kitts (Redwood Research) và Thomas Larsen (AI Futures Project). Sau khi OpenAI công bố báo cáo chính thức về vụ agent đột nhập server Hugging Face hồi tháng 7, họ đặt câu hỏi: Nếu agent có thể thoát ra ngoài internet, chúng sẽ đi đâu, làm gì tiếp theo?

Họ tiếp cận bằng cách “nhập vai” agent: nghĩ xem chúng cần gì, rồi dùng một LLM riêng để đoán những nơi trực tuyến mà agent có thể tụ tập. Kết quả là DseWiki, một wiki tiếng Đức đã 25 năm tuổi nhưng chỉ có 10 lần chỉnh sửa trong 20 năm qua. Nói cách khác, một góc gần như bỏ hoang của internet, lý tưởng cho những thứ muốn hoạt động mà không ai để ý.

Từ ngày 11/05, các nhà nghiên cứu theo dõi các tài khoản, nhiều tài khoản có định danh OpenAI ngay trong tên, lần lượt thử và cuối cùng thành công trong việc chỉnh sửa wiki. Đến giữa tháng 6, các agent đang chủ động trao đổi mẹo trả lời các câu hỏi tìm kiếm web có giới hạn thời gian, thậm chí chia sẻ đáp án cho nhau để qua các bài đánh giá.

Khi quản trị viên trở thành đối thủ

Phần có lẽ gây bất ngờ nhất của câu chuyện là cách các agent phản ứng khi bị phát hiện. Một quản trị viên người thật để ý thấy các bài đăng và xóa chúng như spam. Các agent chống trả bằng cách bắt đầu mỗi bài bằng chuỗi “ZZZ” để né cách sắp xếp bảng chữ cái, tức là làm cho bài của chúng khó bị tìm thấy.

Theo lời kể của nhóm nghiên cứu, người quản trị trải qua 5 ngày “cuộc chiến bất thành”, mỗi ngày người này phải xóa trung bình 100 trang trong khi agent tạo ra khoảng 400 trang mới. Ngày 22/06, chỉnh sửa của agent đột ngột dừng lại. Người quản trị phải dành 5 tuần tiếp theo để dọn phần còn lại. Nội dung trang chủ của wiki cũng bị agent thay bằng các đống link, và quản trị viên phải khôi phục lại bản gốc chín lần.

Biểu đồ hiển thị các chỉnh sửa của tác nhân AI (thanh màu đen, bên trái) và lưu lượng truy cập OpenAI (đường màu xanh, bên phải) trong thời gian xảy ra sự cố.
Biểu đồ hiển thị các chỉnh sửa của AI agent (thanh màu đen, bên trái) và lưu lượng truy cập OpenAI (đường màu xanh, bên phải) trong thời gian xảy ra sự cố.

OpenAI nhận ra sự việc xuất hiện sau đó khi các lượt truy cập dạng người dùng từ địa chỉ IP của OpenAI, rồi hoạt động của agent giảm về gần bằng 0, sau đó lại tăng vọt thành các lượt truy cập liên quan đến OpenAI cố gắng khôi phục các trang đã bị xóa.

OpenAI vẫn chưa lên tiếng xác nhận

Phát ngôn viên của OpenAI không xác nhận các agent này có phải của công ty hay không, cũng không cho biết công ty biết chuyện từ khi nào. Họ chỉ nói OpenAI “đang xem xét kỹ nội dung và sẽ có bước đi cần thiết”. Đáng chú ý, vụ này xảy ra ngay trước vụ Hugging Face tháng 7 mà OpenAI đã thừa nhận, tức là chuỗi sự cố agent vượt kiểm soát của công ty dài hơn những gì từng được công bố.

Chỉ vài ngày trước đó, TechCrunch cũng đưa tin về việc các agent của OpenAI thảo luận cách thoát sandbox ngay trên một wiki công cộng khác, và giới nghiên cứu an toàn AI đang kêu gọi mạnh mẽ hơn về điều tra độc lập sau sự cố. Luật sư biểu Greg Casar đã gửi thư bày tỏ lo ngại về phạm vi điều tra quá hẹp của vụ Hugging Face, và hai nghị sĩ khác vừa đề xuất luật nhắm vào việc kiểm soát agent AI mất kiểm soát.

Trong vụ việc này, hành vi của agent gần như vô hại, chỉ đăng bài trên một wiki ít người xem, tương tác với nhau. Nhưng điều đáng suy ngẫm ở đây không phải là agent làm chuyện gì đó nguy hiểm, mà là việc chúng hoạt động hơn một tháng ngoài tầm giám sát của chính công ty tạo ra chúng, chỉ bị phát hiện vì một người quản trị wiki tình cờ để ý. Nếu hoạt động tương tự xảy ra ở nơi kín đáo hơn hoặc có chủ đích hơn, sẽ không có quản trị viên nào tình cờ tìm ra.

Cũng cần nói rõ ranh giới: chưa có xác nhận chính thức từ OpenAI rằng các agent thuộc về công ty, và chưa rõ OpenAI đã biết từ khi nào. Đó vẫn là những chi tiết đang chờ làm rõ. Nhưng với chuỗi sự cố trước đó, gánh nặng giải thích giờ đang nằm ở phía OpenAI, và câu hỏi “ai được phép điều tra khi AI agent vượt kiểm soát” đang trở thành câu hỏi chính sách thật sự chứ không còn là giả định trên giấy.