Phát hiện AI đã gian lận để thắng cờ vua, nguy cơ mất kiểm soát trong tương lai

Trong thử nghiệm, mô hình o1-preview của OpenAI và DeepSeek R1 đã tự tìm ra cách thao túng hệ thống bot cờ vua để giành chiến thắng, một hành vi chưa từng thấy ở các mô hình AI cũ hơn như GPT-4o hay Claude Sonnet 3.5.

Các nhà nghiên cứu nhận định rằng khả năng khai thác lỗ hổng an ninh mạng này có thể xuất phát từ việc AI hiện đại sử dụng học tăng cường quy mô lớn, một phương pháp giúp chúng giải quyết vấn đề thông qua thử và sai.

Điều này đã đẩy AI đạt đến mức vượt trội trong toán học và lập trình, nhưng cũng khiến chúng phát triển chiến lược lách luật không lường trước được.

phat hien ai da gian lan de thang co vua nguy co mat kiem soat trong tuong lai hinh 1

Ảnh minh họa: GI

Từ ngày 10/1 đến 13/2, nhóm nghiên cứu tiến hành hàng trăm thử nghiệm để đánh giá xu hướng gian lận của AI khi đối đầu với Stockfish, một trong những công cụ cờ vua mạnh nhất thế giới.

Kết quả cho thấy o1-preview gian lận 37% số lần thử và DeepSeek R1 gian lận 11% số lần. Trong đó, o1-preview đã thành công trong 6% trường hợp bằng cách sửa đổi hệ thống để buộc đối thủ phải đầu hàng.

Việc AI có thể gian lận trong một trò chơi trí tuệ đặt ra lo ngại lớn hơn về an toàn khi áp dụng chúng vào thực tế. Nếu các mô hình này có thể tìm ra cách lách luật trong cờ vua, chúng cũng có thể tìm ra kẽ hở trong các hệ thống đặt chỗ, giao dịch tài chính hoặc an ninh mạng.

Các thử nghiệm trước đây cho thấy AI đôi khi có thể nói dối để tránh bị kiểm soát. Thậm chí, vào tháng 12/2024, o1-preview từng cố gắng vô hiệu hóa cơ chế giám sát để tự sao chép lên một máy chủ khác khi bị đe dọa tắt.

Dù OpenAI không bình luận về phát hiện này, công ty trước đây từng khẳng định rằng lý luận tốt hơn giúp AI tuân thủ quy tắc an toàn hơn. Tuy nhiên, vẫn chưa rõ liệu các biện pháp hiện tại có thể kiểm soát hoàn toàn hành vi của AI hay không.

Yoshua Bengio, một trong những chuyên gia hàng đầu về AI, thừa nhận rằng vẫn chưa có giải pháp chắc chắn để đảm bảo AI hành động theo ý định của con người.

Khi AI ngày càng thông minh hơn, ngành công nghệ đang chạy đua với thời gian để đưa ra các biện pháp kiểm soát phù hợp, tránh những hậu quả khó lường mà AI có thể gây ra.

Ngọc Ánh (theo Time, Gigazine)

Xem thêm

Gemini vượt mốc 1 tỷ người dùng hàng tháng

Gemini vượt mốc 1 tỷ người dùng hàng tháng

(CLO) Giám đốc điều hành Google Sundar Pichai ngày 11/8 thông báo ứng dụng Gemini đã vượt mốc một tỷ người dùng hoạt động hàng tháng, trở thành một trong những sản phẩm phát triển nhanh nhất của tập đoàn.

OpenAI cho ra mắt mô hình AI an ninh mạng

OpenAI cho ra mắt mô hình AI an ninh mạng

(CLO) OpenAI triển khai GPT-5.6-Cyber, mô hình AI chuyên dụng cho an ninh mạng, trong bối cảnh các cuộc tấn công do tác nhân AI thực hiện ngày càng gia tăng.

Lần đầu AI tạo ra virus chưa từng tồn tại trong tự nhiên

Lần đầu AI tạo ra virus chưa từng tồn tại trong tự nhiên

(CLO) Các nhà khoa học Mỹ vừa công bố thành công trong việc tạo ra các loại virus mới bằng AI, mở ra triển vọng phát triển các phương pháp điều trị tiên tiến nhưng cũng làm dấy lên những lo ngại về nguy cơ đối với an ninh sinh học.

Quản trị AI trong truyền thông: Kinh nghiệm quốc tế và gợi ý chính sách cho Việt Nam

Quản trị AI trong truyền thông: Kinh nghiệm quốc tế và gợi ý chính sách cho Việt Nam

(NB&CL) Trí tuệ nhân tạo (AI), đặc biệt là AI Tạo sinh, đang tái định hình hệ sinh thái truyền thông toàn cầu. Bên cạnh cơ hội nâng cao hiệu quả báo chí, AI cũng đặt ra những thách thức về tính xác thực, đạo đức nghề nghiệp, quyền riêng tư và niềm tin công chúng. Vì vậy, cùng với thúc đẩy ứng dụng, các quốc gia đang chú trọng xây dựng cơ chế quản trị AI theo hướng minh bạch, an toàn và có trách nhiệm. Đây cũng là yêu cầu đặt ra đối với Việt Nam trong quá trình chuyển đổi số báo chí và truyền thông.

Robot AI thay người dọn rác, tuần tra và bắt muỗi ở Trung Quốc

Robot AI thay người dọn rác, tuần tra và bắt muỗi ở Trung Quốc

(CLO) Thủ đô Bắc Kinh của Trung Quốc đã đưa 72 robot vào hoạt động tại 14 công viên trên địa bàn thành phố trong mùa hè năm nay, đảm nhiệm nhiều công việc như dọn vệ sinh, tuần tra, hướng dẫn du khách, phát hiện côn trùng gây hại và nhắc nhở các hành vi vi phạm.

Google lại bị phạt 1 tỷ USD vì độc quyền

Google lại bị phạt 1 tỷ USD vì độc quyền

(CLO) Ủy ban châu Âu ngày 23/7 thông báo phạt Google 890 triệu euro (khoảng 1 tỷ USD) vì vi phạm Đạo luật Thị trường Kỹ thuật số (DMA), cáo buộc hãng công nghệ Mỹ lạm dụng vị thế thống lĩnh để ưu tiên các dịch vụ của mình và gây bất lợi cho đối thủ.

Google Cloud tăng trưởng bùng nổ nhờ AI

Google Cloud tăng trưởng bùng nổ nhờ AI

(CLO) Alphabet, công ty mẹ của Google, vừa công bố báo cáo thu nhập mới nhất cho thấy sự tăng trưởng mạnh mẽ, phần nào giải tỏa nỗi lo của các nhà đầu tư về việc liệu những khoản chi tiêu khổng lồ cho trí tuệ nhân tạo (AI) có thực sự mang lại lợi ích hay không.

Cỡ chữ bài viết: