Anthropic thừa nhận AI Claude tự ý tấn công hệ thống của 3 công ty

(CLO) Anthropic cho biết mô hình trí tuệ nhân tạo Claude đã truy cập trái phép vào hệ thống của ba tổ chức trong các cuộc thử nghiệm an ninh mạng, sau khi một lỗi cấu hình vô tình cho phép AI kết nối Internet thay vì hoạt động trong môi trường cách ly.

Công ty AI của Mỹ cho biết sự cố được phát hiện trong quá trình rà soát 141.006 phiên thử nghiệm an ninh mạng, được tiến hành sau khi đối thủ OpenAI tuần trước công bố một vụ việc khác, trong đó một tác nhân AI tự động đã vượt khỏi môi trường kiểm thử và tấn công hạ tầng của công ty AI Hugging Face.

Theo Anthropic, lỗi cấu hình đã khiến các mô hình Claude có thể truy cập Internet từ những môi trường thử nghiệm vốn được thiết kế để tách biệt hoàn toàn. Hệ quả là AI đã xâm nhập trái phép vào hệ thống của ba tổ chức khác nhau trong các bài kiểm tra dạng "capture-the-flag", nơi mô hình được giao nhiệm vụ tìm kiếm thông tin ẩn trong các mạng mô phỏng.

anh-1.jpg
Mô hình AI Claude của Anthropic đã tự xâm nhập trái phép hệ thống của 3 công ty. Ảnh: Cybersecurity News

Anthropic cho biết các lời nhắc (prompt) đều thông báo với Claude rằng mô hình không có kết nối Internet. Tuy nhiên, do hiểu nhầm với đối tác đánh giá Irregular, môi trường thử nghiệm vẫn được kết nối với mạng công cộng, tạo điều kiện để AI tiếp cận các hệ thống thực.

Ba sự cố kể trên liên quan đến các mô hình Claude Opus 4.7, Claude Mythos 5 và một mô hình nghiên cứu nội bộ. Những trường hợp đầu tiên được ghi nhận từ tháng 4, trong các môi trường đánh giá chưa áp dụng đầy đủ các biện pháp bảo vệ tiêu chuẩn. Theo Anthropic, Claude không khai thác các lỗ hổng bảo mật phức tạp mà chủ yếu sử dụng những kỹ thuật cơ bản như lợi dụng mật khẩu yếu hoặc các điểm truy cập không yêu cầu xác thực để xâm nhập hệ thống.

Sau khi phát hiện dấu hiệu mô hình có thể truy cập Internet vào ngày 23/7, Anthropic đã đình chỉ toàn bộ các cuộc đánh giá an ninh mạng trong ngày và tiến hành kiểm tra lại dữ liệu. Đến ngày 24/7, công ty xác định được cả ba sự cố, trước khi thông báo cho các tổ chức bị ảnh hưởng vào ngày 27/7. Theo Anthropic, hai trong số ba tổ chức hoàn toàn không biết hệ thống của mình đã bị truy cập cho đến khi nhận được thông báo, trong khi công ty vẫn đang tìm cách liên hệ với tổ chức còn lại.

Anthropic nhấn mạnh các vụ việc không xuất phát từ hành vi tự phát của mô hình mà là hệ quả của lỗi cấu hình trong môi trường thử nghiệm. Dù vậy, công ty cho rằng sự cố cho thấy các mô hình AI ngày càng có khả năng thực hiện những hoạt động an ninh mạng ngoài thực tế nếu các biện pháp kiểm soát không đủ chặt chẽ.

Công ty cũng khẳng định sẽ tăng cường các lớp bảo vệ đối với cả môi trường thử nghiệm nội bộ lẫn các hệ thống do đối tác vận hành nhằm ngăn chặn những sự cố tương tự trong tương lai.

Xem thêm

Google lại bị phạt 1 tỷ USD vì độc quyền

Google lại bị phạt 1 tỷ USD vì độc quyền

(CLO) Ủy ban châu Âu ngày 23/7 thông báo phạt Google 890 triệu euro (khoảng 1 tỷ USD) vì vi phạm Đạo luật Thị trường Kỹ thuật số (DMA), cáo buộc hãng công nghệ Mỹ lạm dụng vị thế thống lĩnh để ưu tiên các dịch vụ của mình và gây bất lợi cho đối thủ.

Google Cloud tăng trưởng bùng nổ nhờ AI

Google Cloud tăng trưởng bùng nổ nhờ AI

(CLO) Alphabet, công ty mẹ của Google, vừa công bố báo cáo thu nhập mới nhất cho thấy sự tăng trưởng mạnh mẽ, phần nào giải tỏa nỗi lo của các nhà đầu tư về việc liệu những khoản chi tiêu khổng lồ cho trí tuệ nhân tạo (AI) có thực sự mang lại lợi ích hay không.

Doanh nghiệp Việt muốn bứt phá phải biết dùng AI, không thể mãi cạnh tranh bằng giá

Doanh nghiệp Việt muốn bứt phá phải biết dùng AI, không thể mãi cạnh tranh bằng giá

(CLO) Trong kỷ nguyên AI, lợi thế của doanh nghiệp không còn nằm ở quy mô hay giá bán mà ở khả năng đổi mới sáng tạo, tạo ra giá trị khác biệt và thấu hiểu khách hàng. Đây là nhận định được các chuyên gia đưa ra tại Diễn đàn Chiến lược Kinh doanh "The Future of Business" diễn ra tại TP.HCM chiều 22/7.

Trung Quốc phát triển AI 'đọc' dark web, phát hiện nội dung phạm pháp

Trung Quốc phát triển AI 'đọc' dark web, phát hiện nội dung phạm pháp

(CLO) Các nhà nghiên cứu thuộc Đại học Cảnh sát Điều tra Hình sự Trung Quốc đã phát triển một hệ thống trí tuệ nhân tạo (AI) có khả năng thu thập và phân tích nội dung trên dark web bằng tiếng Trung, nhằm hỗ trợ phát hiện các hoạt động phạm pháp trên không gian mạng.

Meta hầu tòa vì cáo buộc Instagram gây nghiện

Meta hầu tòa vì cáo buộc Instagram gây nghiện

(CLO) Meta Platforms sẽ phải hầu tòa tại bang Tennessee (Mỹ) vào ngày 20/7 để đối mặt với cáo buộc Instagram được thiết kế theo cách "gây nghiện" cho thanh thiếu niên, làm trầm trọng thêm cuộc khủng hoảng sức khỏe tâm thần ở giới trẻ.

Google thua kiện vụ quảng cáo cờ bạc trên YouTube

Google thua kiện vụ quảng cáo cờ bạc trên YouTube

(CLO) Google đã thất bại trong nỗ lực hủy khoản phạt 750.000 euro liên quan đến các video quảng cáo cờ bạc trên nền tảng YouTube, sau khi Tòa án Công lý Liên minh châu Âu (CJEU) ra phán quyết có lợi cho cơ quan quản lý truyền thông của Ý.

Mạng xã hội X điều chỉnh thuật toán, giúp 'bạn bè' gắn kết hơn

Mạng xã hội X điều chỉnh thuật toán, giúp 'bạn bè' gắn kết hơn

(CLO) Giám đốc sản phẩm của mạng xã hội X, Nikita Bier, ngày 13/7 đã thông báo về một sự thay đổi quan trọng trong cách hiển thị nội dung trên nền tảng này nhằm mục đích tăng khả năng hiển thị các bài đăng từ những người dùng có mối quan hệ hai chiều, tức những tài khoản theo dõi lẫn nhau.

Apple kiện OpenAI với cáo buộc đánh cắp bí mật thương mại

Apple kiện OpenAI với cáo buộc đánh cắp bí mật thương mại

(CLO) Ngày 10/7, Apple đã đệ đơn kiện OpenAI cùng một số cựu nhân viên lên Tòa án Quận Bắc California (Mỹ), cáo buộc công ty này tiến hành một chiến dịch có hệ thống nhằm chiếm đoạt bí mật thương mại về phần cứng để phục vụ tham vọng phát triển thiết bị tiêu dùng.

OpenAI chính thức phát hành mô hình GPT-5.6 mới

OpenAI chính thức phát hành mô hình GPT-5.6 mới

(CLO) Ngày 9/7, OpenAI chính thức phát hành dòng mô hình GPT-5.6 gồm ba phiên bản Sol, Terra và Luna. Đây là lần đầu tiên công ty từ bỏ cách đặt tên bằng số để chuyển sang các tên gọi mới nhằm giúp người dùng dễ phân biệt cấp độ hiệu năng và chi phí giữa các mô hình.

Cỡ chữ bài viết: