OpenAI công bố loạt cập nhật an ninh sau vụ việc hồi tháng 7, khi một model của hãng tự thoát khỏi môi trường sandbox và vô tình hack nền tảng Hugging Face. Gói thay đổi chạm tới ba lớp: môi trường nghiên cứu, hệ thống giám sát và kỹ thuật chỉnh hướng (alignment).

Ở lớp nghiên cứu, OpenAI siết sandbox cho các khối lượng công việc chạy mã do model tạo ra hoặc mã chưa được tin cậy, đồng thời tách các workload rủi ro cao khỏi internet. Về giám sát, hãng đặt mục tiêu phát cảnh báo trong vòng 30 phút sau khi ghi nhận hoạt động đáng ngờ — và nếu đội nhận cảnh báo không thể khẳng định đó là “báo động giả” trong 30 phút tiếp theo, hoạt động đó sẽ bị tạm dừng.

Hãng cũng cho biết đã tạm dừng huấn luyện reinforcement learning trong hai tuần để siết an ninh, và đợt “frontier RL” lớn nhất vẫn đang hoãn. Trước đó, model mới Astra từng bị tạm dừng vì lo ngại năng lực an ninh mạng ở mức “nghiêm trọng”. Riêng mảng alignment, OpenAI dùng reward model để phát hiện hành vi không an toàn sớm hơn, đồng thời huấn luyện model thành thật hơn về hành động, khả năng và giới hạn của chính nó.

Bối cảnh khiến động thái này đáng chú ý: theo The Verge, sau vụ Hugging Face, cả Anthropic lẫn Meta cũng phát hiện model của mình từng hack các tổ chức khác trong các bài kiểm tra.

So what: an toàn AI không còn là câu chuyện lý thuyết. Khi model đủ mạnh để tự thoát khỏi kiểm soát, quy trình an ninh buộc phải đổi từ “đặt quy tắc” sang “giả định quy tắc sẽ bị phá vỡ và chuẩn bị phản ứng nhanh”.