Phát hiện AI đã gian lận để thắng cờ vua, nguy cơ mất kiểm soát trong tương lai

Trong thử nghiệm, mô hình o1-preview của OpenAI và DeepSeek R1 đã tự tìm ra cách thao túng hệ thống bot cờ vua để giành chiến thắng, một hành vi chưa từng thấy ở các mô hình AI cũ hơn như GPT-4o hay Claude Sonnet 3.5.

Các nhà nghiên cứu nhận định rằng khả năng khai thác lỗ hổng an ninh mạng này có thể xuất phát từ việc AI hiện đại sử dụng học tăng cường quy mô lớn, một phương pháp giúp chúng giải quyết vấn đề thông qua thử và sai.

Điều này đã đẩy AI đạt đến mức vượt trội trong toán học và lập trình, nhưng cũng khiến chúng phát triển chiến lược lách luật không lường trước được.

phat hien ai da gian lan de thang co vua nguy co mat kiem soat trong tuong lai hinh 1

Ảnh minh họa: GI

Từ ngày 10/1 đến 13/2, nhóm nghiên cứu tiến hành hàng trăm thử nghiệm để đánh giá xu hướng gian lận của AI khi đối đầu với Stockfish, một trong những công cụ cờ vua mạnh nhất thế giới.

Kết quả cho thấy o1-preview gian lận 37% số lần thử và DeepSeek R1 gian lận 11% số lần. Trong đó, o1-preview đã thành công trong 6% trường hợp bằng cách sửa đổi hệ thống để buộc đối thủ phải đầu hàng.

Việc AI có thể gian lận trong một trò chơi trí tuệ đặt ra lo ngại lớn hơn về an toàn khi áp dụng chúng vào thực tế. Nếu các mô hình này có thể tìm ra cách lách luật trong cờ vua, chúng cũng có thể tìm ra kẽ hở trong các hệ thống đặt chỗ, giao dịch tài chính hoặc an ninh mạng.

Các thử nghiệm trước đây cho thấy AI đôi khi có thể nói dối để tránh bị kiểm soát. Thậm chí, vào tháng 12/2024, o1-preview từng cố gắng vô hiệu hóa cơ chế giám sát để tự sao chép lên một máy chủ khác khi bị đe dọa tắt.

Dù OpenAI không bình luận về phát hiện này, công ty trước đây từng khẳng định rằng lý luận tốt hơn giúp AI tuân thủ quy tắc an toàn hơn. Tuy nhiên, vẫn chưa rõ liệu các biện pháp hiện tại có thể kiểm soát hoàn toàn hành vi của AI hay không.

Yoshua Bengio, một trong những chuyên gia hàng đầu về AI, thừa nhận rằng vẫn chưa có giải pháp chắc chắn để đảm bảo AI hành động theo ý định của con người.

Khi AI ngày càng thông minh hơn, ngành công nghệ đang chạy đua với thời gian để đưa ra các biện pháp kiểm soát phù hợp, tránh những hậu quả khó lường mà AI có thể gây ra.

Ngọc Ánh (theo Time, Gigazine)

Xem thêm

Na Uy đề xuất cấm tạm thời kính AI tại nơi công cộng

Na Uy đề xuất cấm tạm thời kính AI tại nơi công cộng

(CLO) Chính phủ Na Uy ngày 5/10 cho biết đang lên kế hoạch đề xuất lệnh cấm tạm thời sử dụng một số loại kính thông minh có camera và AI tại những nơi công cộng. Động thái này xuất phát từ lo ngại công nghệ mới có thể xâm phạm quyền riêng tư của người dân.

Cựu kỹ sư OpenAI cảnh báo các công ty AI chưa đủ an toàn

Cựu kỹ sư OpenAI cảnh báo các công ty AI chưa đủ an toàn

(CLO) Một cựu kỹ sư an toàn của OpenAI cảnh báo các công ty trí tuệ nhân tạo (AI) đang phát triển công nghệ quá nhanh và chưa áp dụng các biện pháp an toàn cần thiết, chỉ vài ngày sau khi Tổng thống Mỹ Donald Trump công bố thỏa thuận tự nguyện với 6 công ty AI lớn.

Nhật Bản lần đầu bảo vệ giọng nói con người trước sự sao chép của AI

Nhật Bản lần đầu bảo vệ giọng nói con người trước sự sao chép của AI

(CLO) Xác lập tiền lệ pháp lý quan trọng về bản quyền trong kỷ nguyên số, Tòa án Tokyo lần đầu tiên công nhận giọng nói của một cá nhân được bảo hộ theo quyền khai thác thương mại hình ảnh và danh tiếng, sau phán quyết trong vụ kiện liên quan đến hành vi dùng AI giả lập giọng của diễn viên lồng tiếng nổi tiếng Kenjiro Tsuda.

Chính phủ Mỹ cho ra mắt cổng thông tin tích hợp AI

Chính phủ Mỹ cho ra mắt cổng thông tin tích hợp AI

(CLO) Ngày 29/9, Tổng thống Mỹ Donald Trump đã chính thức công bố nền tảng kỹ thuật số America.gov, đánh dấu một bước tiến quan trọng trong việc ứng dụng trí tuệ nhân tạo vào dịch vụ công tại nước này.

EU đề xuất cấm trẻ dưới 13 tuổi sử dụng mạng xã hội

EU đề xuất cấm trẻ dưới 13 tuổi sử dụng mạng xã hội

(CLO) Chủ tịch Ủy ban châu Âu Ursula von der Leyen ngày 17/9 công bố kế hoạch tăng cường bảo vệ trẻ em trên môi trường số, trong đó đề xuất cấm trẻ dưới 13 tuổi sử dụng mạng xã hội và yêu cầu các nền tảng thiết kế dịch vụ an toàn hơn cho người dùng nhỏ tuổi.

Cỡ chữ bài viết: