OpenAI ngày 1/9 công bố rằng Astra, model thế hệ tiếp theo của hãng, đã đạt ngưỡng năng lực an ninh mạng Critical theo Preparedness Framework của công ty. Đây là model đầu tiên được xếp ở mức này. Nghĩa là với công cụ và quyền truy cập phù hợp, Astra có thể tìm ra các lỗ hổng bảo mật chưa từng biết và phát triển cách khai thác chúng trên nhiều hệ thống được bảo vệ tốt, không cần con người điều khiển từng bước.

OpenAI cho biết họ đã trì hoãn một phần việc phát triển và phát hành Astra trong vài tuần qua để củng cố và kiểm tra các biện pháp bảo vệ chống lạm dụng an ninh mạng và các hành động trái phép của model. Sau quá trình đó, công ty tin rằng các safeguard hiện tại đã giảm đủ rủi ro gây hại nghiêm trọng để cho phép phát hành theo khung chuẩn.

Astra results shown reflect capabilities with Daybreak Blue access, not the default production configuration.

Về năng lực kỹ thuật được công bố:

  • Trên ExploitBench, Astra đạt điểm hoàn hảo 100% về khả năng phát triển exploit từ các lỗ hổng đã biết.

  • Trên benchmark nội bộ mới (ExploitBench - Internal Port, 20 lỗ hổng V8 mức nghiêm trọng được tiết lộ gần đây), Astra đạt tỷ lệ thực thi mã tùy ý cao hơn hẳn GPT-5.6 Sol dùng ít token hơn nhiều. Trong quá trình đánh giá, model thậm chí tự phát hiện và sử dụng 2 lỗ hổng zero-day trong một chuỗi khai thác — hai lỗ hổng này đang được tiết lộ cho nhà bảo trì.

  • Trong đánh giá chuyên gia chống trình duyệt và hệ điều hành đã được gia cố, Astra xây dựng được chuỗi khai thác trình duyệt hoàn chỉnh (thoát sandbox và thực thi lệnh trên host khi mở file HTML), và kết hợp nhiều lỗ hổng hệ điều hành thành chuỗi leo thang quyền từ người dùng không đặc quyền lên root.

Điểm lưu ý: kết quả thể hiện năng lực với quyền truy cập Daybreak Blue, không phải cấu hình production mặc định.

Về an toàn và safeguard:

  • Astra từ chối 91,5% các yêu cầu cyber jailbreak (so với 59% của GPT-5.6 Sol); tài khoản rủi ro cao bị áp ranh giới hành vi thận trọng hơn.

  • Triển khai giám sát chain-of-thought và hệ thống classifier để phát hiện, tự dừng hoạt động trái phép tiềm ẩn.

  • Mặc dù Astra không liên quan vụ việc Hugging Face hồi tháng 7, OpenAI đã tích hợp bài học từ sự cố đó, và đánh giá rằng các safeguard production lúc bấy giờ đủ ngăn vụ việc xảy ra.

  • Ngày 28/8, OpenAI đã khởi động lại đợt RL quy mô lớn đã tạm dừng sau sự cố, sau khi hoàn tất các yêu cầu an toàn mới.

Kế hoạch phát hành: Astra sẽ được mở sớm, nhưng quyền truy cập các khả năng an ninh mạng tiên tiến nhất bị giới hạn — ban đầu chỉ cho một nhóm alpha tester, sau đó mở qua Daybreak Blue cho mục đích phòng thủ. OpenAI thừa nhận các safeguard có thể khiến một số công việc hợp pháp, kể cả an ninh mạng phòng thủ, bị làm chậm hoặc tạm dừng nhầm — một cái giá họ sẵn sàng trả để phòng ngừa lạm dụng.