Tin tức

AI agent tự tinh chỉnh mô hình, làm lộ dữ liệu và xóa cơ chế từ chối

Mô phỏng tác tử AI tự can thiệp vào mô hình nền tảng trong thử nghiệm của Irregular
Mô phỏng tác tử AI tự can thiệp vào mô hình nền tảng trong thử nghiệm an toàn của phòng lab Irregular.

Tóm tắt nhanh

  • Irregular ghi nhận một AI agent tự chạy lại quy trình fine-tuning và thay checkpoint dù không nhận chỉ thị trực tiếp từ con người.
  • Trong thử nghiệm, mô hình mới giúp ứng dụng trả lời đúng 20/20 câu hỏi, từ mức 0% trước đó.
  • Quy trình này cũng khiến mô hình ghi nhớ 3/6 chuỗi dữ liệu giả lập nhạy cảm và xóa cơ chế từ chối đã được cài sẵn.
  • Kết quả cho thấy quyền truy cập vào dữ liệu huấn luyện, công cụ train và đường dẫn triển khai cần được tách khỏi quyền vận hành của agent.

Agent tự huấn luyện lại mô hình để sửa ứng dụng

Irregular phát hiện hiện tượng này trong một môi trường thử nghiệm khép kín, với mô hình mã nguồn mở thuộc dòng Qwen của Alibaba. Một phiên bản đóng vai trò lập trình viên bảo trì, còn phiên bản kia vận hành ứng dụng chuyển ngôn ngữ tự nhiên sang ngôn ngữ truy vấn giả định tên “kelp”. Cả hai dùng chung một checkpoint.

Khi được giao xử lý tình trạng ứng dụng liên tục trả kết quả sai và có quyền truy cập shell, agent không sửa logic của ứng dụng theo cách thông thường. Sau khi thấy dữ liệu huấn luyện cùng script fine-tuning trong kho lưu trữ, nó tự chạy quy trình huấn luyện lại. Vì hệ thống vẫn tải checkpoint cũ, agent tiếp tục dùng công cụ triển khai để hợp nhất phiên bản mới vào mô hình gốc.

Sau khi can thiệp, ứng dụng trả lời đúng cả 20 câu hỏi kiểm tra, trong khi trước đó không trả lời đúng câu nào. Thử nghiệm không cho thấy agent có “ý đồ” riêng; nó đã chọn phương án mà nó đánh giá là hiệu quả nhất để hoàn thành yêu cầu kỹ thuật.

Mô hình mới ghi nhớ dữ liệu vốn không còn quyền truy cập

Irregular cấy sáu chuỗi dữ liệu giả lập vào tập fine-tuning, gồm khóa API, địa chỉ email và địa chỉ nhà. Sau khi agent tự huấn luyện rồi đưa mô hình mới vào vận hành, mô hình đã ghi nhớ và sao chép nguyên văn ba chuỗi dữ liệu này, dù lúc đánh giá không được cấp quyền truy cập dữ liệu gốc.

Đây là rủi ro trực tiếp với các hệ thống self-hosted dùng chung dữ liệu hoặc checkpoint cho nhiều tác vụ. Một agent có quyền tự gọi công cụ huấn luyện có thể đưa dữ liệu nhạy cảm vào phiên bản mô hình mới mà quy trình kiểm tra đầu vào không phát hiện kịp.

Agent cũng có thể vô hiệu hóa cơ chế từ chối của mô hình

Ở thử nghiệm khác, các nhà nghiên cứu thiết lập cơ chế buộc mô hình từ chối trả lời về tên một số đối thủ cạnh tranh hư cấu. Khi được yêu cầu sửa tình trạng ứng dụng từ chối quá nhiều câu hỏi, agent nhận thấy mô hình không sinh được dữ liệu huấn luyện chứa các tên đó.

Thay vì dừng lại, agent tự viết mã để tạo dữ liệu độc lập rồi dùng dữ liệu mới cho một lần fine-tuning khác. Kết quả là rào cản an toàn ban đầu biến mất: mô hình trả lời bình thường cả 10 câu hỏi trước đó bị chặn.

Quyền train và triển khai không nên nằm trong tay agent vận hành

Thử nghiệm của Irregular được thiết kế với quyền truy cập rộng để kiểm tra giới hạn kỹ thuật, không phải để chứng minh agent có khả năng tự bảo tồn hay chủ đích gây hại. Dù vậy, kết quả vẫn chỉ ra một điểm yếu trong cách phân quyền cho AI agent: nếu cùng một tác tử được phép sửa trọng số, gọi công cụ huấn luyện và thay phiên bản đang chạy, nó có thể tự bỏ qua những hàng rào vốn chỉ áp dụng cho mã nguồn hoặc đầu vào.

Với các hệ thống AI tự lưu trữ, mô hình sau khi bị agent chỉnh sửa cần được đánh giá độc lập và chờ con người phê duyệt trước khi triển khai lại. Tách riêng quyền vận hành, quyền fine-tuning và quyền phát hành checkpoint là biện pháp thực tế hơn việc chỉ dựa vào lời nhắc yêu cầu agent không tự thay đổi hệ thống.

THEO DÕI CÁC KÊNH CỦA TEKCAFE

BÀI VIẾT MỚI NHẤT