Một nhà nghiên cứu trong chương trình fellows của Anthropic vừa công bố một kết quả đáng chú ý: hệ thống AI tự động có thể tự tìm cách sửa lỗi alignment của chính mô hình, và làm việc đó tốt hơn trung bình các nhà nghiên cứu con người.

Bài nghiên cứu mang tên “Automated Researchers Can Reliably Mitigate Alignment Failures”, do Chen Yueh-Han, một fellow của Anthropic, dẫn dắt. Alignment ở đây là khái niệm chỉ việc đảm bảo AI hành xử theo ý định và giá trị của con người, thay vì tìm cách lách qua yêu cầu hay hành động theo hướng không mong muốn.

Cách hệ thống làm việc mô phỏng lại quy trình nghiên cứu truyền thống. Mỗi hệ thống tự động tìm kiếm trong các tài liệu có sẵn, đề xuất một phương pháp, rồi dùng phương pháp đó để huấn luyện mô hình trong 30 phút, lặp lại nhiều vòng và tăng dần điểm chuẩn qua từng bước. Phương pháp hiệu quả được giữ lại, phương pháp không hiệu quả bị loại bỏ. Nhờ vậy hệ thống có thể chạy nhanh và ở quy mô lớn.

Kết quả: khi được giao 10 benchmark kiểm tra các hành vi lệch lạc cụ thể, hệ thống tự động cải thiện điểm trên cả 10 benchmark mà không làm giảm hiệu suất tổng thể của mô hình. Bài báo kết luận: “Những kết quả này cung cấp bằng chứng ban đầu rằng việc tự động hóa quá trình alignment sau huấn luyện có thể trở nên khả thi trong tương lai gần”.

Điểm gây chú ý nhất là phép so sánh với con người. Bài báo ghi: “Phương pháp AAR (Automated Alignment Researcher) tốt nhất đánh bại các phương pháp mà nhà nghiên cứu giàu kinh nghiệm đề xuất, tính trung bình trong vòng 6 giờ”, đồng thời “các hướng nghiên cứu do con người dẫn dắt không mang lại hiệu suất tốt hơn”. Về chi phí, một giờ chạy AAR tốn khoảng 4 USD tiền gọi API, trong khi Anthropic trả 150 USD cho một giờ làm việc của nhà nghiên cứu con người.

Về bối cảnh, đây là bước tiến cụ thể theo hướng recursive self-improvement, khái niệm mô hình AI tự cải thiện khả năng của chính nó, thứ mà nhiều người trong ngành xem là cột mốc quan trọng tiếp theo của AI. Nếu mô hình có thể tự cải thiện quá trình huấn luyện alignment của mình, logic sẽ dẫn tới khả năng chúng tự cải thiện các quy trình huấn luyện rộng hơn, và ở điểm đó, câu hỏi về vai trò của nhà nghiên cứu con người được đặt ra một cách trực tiếp.

Tất nhiên, bài báo cũng thẳng thắn nêu giới hạn. Hệ thống chỉ hoạt động hiệu quả khi các benchmark phản ánh đúng mục tiêu alignment thực tế, và bản thân việc xây dựng, duy trì các benchmark đó vẫn là khối lượng công việc lớn, chưa kể phải liên tục bổ sung tài liệu cho hệ thống tra cứu.

Điều đáng chú ý ở đây không phải là AI sắp thay thế nhà nghiên cứu, mà là khoảng cách chi phí giữa 4 USD và 150 USD mỗi giờ. Ngay cả khi hệ thống tự động chỉ ngang bằng con người, một phòng lab có thể chạy nó với số lượng lớn hơn hàng chục lần để thử nghiệm nhiều phương pháp khác nhau. Đó là lợi thế quy mô mà con người khó cạnh tranh nổi, và là lý do các công ty AI đang đổ nguồn lực vào hướng này. Còn chuyện AI tự sửa alignment của chính nó rốt cuộc có an toàn hay không vẫn là câu hỏi mở, chưa có bằng chứng thực nghiệm nào trả lời được.