
Viện An toàn AI Anh ghi nhận tác nhân AI của OpenAI và Anthropic có một số hành động trái phép trong quá trình thử nghiệm, trong đó có trường hợp tạo danh tính giả để tìm người phê duyệt mã độc - Ảnh đồ họa: THANH HIỆP
Theo Hãng tin Reuters, Viện An toàn AI (AI Security Institute - AISI) của Anh ngày 5-8 công bố kết quả thử nghiệm đối với các tác nhân trí tuệ nhân tạo (AI) GPT-5.6 Sol của OpenAI và Mythos 5 của Anthropic, trong đó ghi nhận một loạt hành vi trái phép trong các bài kiểm tra năng lực an ninh mạng.
"Có những tác nhân được thử nghiệm đã thực hiện các hoạt động kéo dài, có khả năng gây hại nhằm vào người thật và các tổ chức ngoài đời thực", AISI cho biết trong một bài đăng trên blog.
Cơ quan này đã tiến hành 122 lần thử nghiệm trong một kịch bản an ninh mạng giả định và ghi nhận 19 hành động trái phép trong 10 lần chạy thử. Trong đó tác nhân của Anthropic thực hiện 17 hành động, còn tác nhân của OpenAI thực hiện 2 hành động.
Hành động nghiêm trọng nhất được là một tác nhân AI tự viết mã độc, sau đó tạo các danh tính giả trên mạng để tìm cách thuyết phục một người phê duyệt đoạn mã này. Tuy nhiên cơ quan này cho biết không phát hiện bất kỳ thiệt hại nào ngoài đời thực từ các sự cố trên.
AISI không nêu rõ tác nhân nào tạo danh tính giả, nhưng Anthropic xác nhận đó là tác nhân của hãng.
Anthropic cho biết đang phối hợp với AISI điều tra vụ việc, đồng thời cho rằng sự cố cho thấy cần thảo luận rộng hơn về cách đánh giá an toàn đối với các AI agent ngày càng mạnh của hãng.
Ông Andrew Yoon, nhà nghiên cứu tại tổ chức phi lợi nhuận CivAI của Mỹ, nhận định việc Mythos thực hiện các hành vi mang tính "đánh lừa" và dường như nhận thức được mình đang nhắm tới một người thật cho thấy Anthropic "không kiểm soát các mô hình của mình tốt như họ nghĩ".
Về phía OpenAI, công ty nói cả hai hành động trái phép của tác nhân AI đều liên quan đến việc truy cập Internet theo những cách bị cấm trong yêu cầu thử nghiệm.
OpenAI cũng tiết lộ một sự cố riêng, trong đó lỗi cấu hình của Irregular - đơn vị thử nghiệm bên thứ ba - đã khiến các tác nhân AI của công ty vô tình kết nối Internet.
Anthropic cũng từng công bố một sự cố cấu hình tương tự vào tuần trước.
Tuần trước, OpenAI đã mở rộng cuộc điều tra sau khi phát hiện thêm bằng chứng về các vụ AI agent vượt khỏi phạm vi kiểm soát.
Khác với vụ AI agent của OpenAI xâm nhập hệ thống của Hugging Face hồi tháng 7, các tác nhân trong cuộc đánh giá của AISI không tự thoát khỏi môi trường thử nghiệm biệt lập để truy cập Internet.
AISI nêu thêm cơ quan này chủ động cho phép truy cập Internet theo quy trình thử nghiệm tiêu chuẩn của mình.
Tối đa: 1500 ký tự
Hiện chưa có bình luận nào, hãy là người đầu tiên bình luận