Hàng loạt công ty AI bị cáo buộc thu thập dữ liệu trái phép

(CLO) Nhiều công ty trí tuệ nhân tạo đã bị cáo buộc tích cực thu thập dữ liệu từ các trang web để đào tạo hệ thống của mình, có khả năng vi phạm các quy định trong quá trình thu thập.

Các nhà phát triển AI dựa vào việc thu thập lượng lớn dữ liệu được lấy từ nhiều nguồn khác nhau để tạo ra các mô hình ngôn ngữ lớn. Đây là công nghệ đằng sau các chatbot như ChatGPT của OpenAI và đối thủ Claude của Anthropic.

Anthropic được thành lập bởi một nhóm cựu nghiên cứu viên của OpenAI với lời hứa phát triển các hệ thống AI "có trách nhiệm".

Tuy nhiên, Matt Barrie, giám đốc điều hành của Freelancer.com đã cáo buộc công ty có trụ sở tại San Francisco này xâm nhập dữ liệu vào cổng thông tin dành cho nhà báo tự do, nơi có hàng triệu lượt truy cập mỗi ngày.

hang loat cong ty ai bi cao buoc thu thap du lieu trai phep hinh 1

Anthropic đã tạo ra một số chatbot tiên tiến nhất thế giới, cạnh tranh với ChatGPT của OpenAI, Ảnh: Jakub Porzycki

Theo dữ liệu được chia sẻ với Financial Times, Freelancer.com đã có 3,5 triệu lượt truy cập từ một "trình thu thập dữ liệu" web được liên kết với Anthropic trong vòng 4 giờ. 

Barrie cho biết thêm rằng lượt truy cập từ các bot này vẫn tiếp tục tăng ngay cả sau khi Freelancer.com cố gắng từ chối các yêu cầu truy cập, sử dụng các giao thức web chuẩn để hướng dẫn trình thu thập thông tin. Sau đó, Barrie quyết định chặn hoàn toàn lưu lượng truy cập từ các địa chỉ internet của Anthropic.

Kyle Wiens, giám đốc điều hành của iFixit.com, cho biết trang web sửa chữa điện tử của ông đã nhận được 1 triệu lượt truy cập từ các bot Anthropic trong vòng 24 giờ. "Chúng tôi có rất nhiều báo động (do lưu lượng truy cập cao)", ông nói.

Wiens cho biết, điều khoản dịch vụ của iFixit cấm sử dụng dữ liệu của họ cho mục đích học máy. "Thông điệp đầu tiên của tôi gửi đến Anthropic là: nếu bạn sử dụng dữ liệu này để đào tạo mô hình của mình, thì đó là bất hợp pháp. Thông điệp thứ hai của tôi là: đây không phải là hành vi lịch sự trên internet", ông nói.

Thu thập dữ liệu không phải hoạt động mới nhưng nó đã tăng mạnh trong hai năm qua do cuộc chạy đua AI. Điều đó đã gây ra chi phí mới cho các trang web.

Cơ quan giám sát bảo vệ dữ liệu của châu Âu đang điều tra về việc mạng xã hội X quyết định cho phép dữ liệu của người dùng được tự động đưa vào công ty khởi nghiệp trí tuệ nhân tạo xAI.

Cụ thể, ngày 26/7, người dùng X phát hiện rằng họ đã vô tình cho phép các bài đăng cũng như các tương tác của mình với chatbot Grok được sử dụng để "đào tạo và tinh chỉnh" các hệ thống của xAI.

Động thái này được thực hiện mà không có sự đồng ý chia sẻ dữ liệu rõ ràng của người dùng. Cài đặt không thể thay đổi trên ứng dụng di động của X, chỉ có thể thay đổi trên phiên bản máy tính.

Các chuyên gia về quyền riêng tư đã đặt câu hỏi liệu động thái của X có vi phạm các quy tắc của Quy định bảo vệ dữ liệu chung của EU hay không, trong đó yêu cầu các công ty thu thập hoặc sử dụng dữ liệu cá nhân trước tiên phải có được sự đồng ý của cá nhân và tiết lộ lý do thực hiện việc đó. Nếu cơ quan quản lý của Ireland mở cuộc điều tra, X có thể phải đối mặt với các khoản tiền phạt hoặc hình phạt. 

Tháng trước, Meta đã tạm dừng kế hoạch đào tạo AI của mình trên dữ liệu từ nền tảng Facebook và Instagram tại châu Âu sau khi nhận được yêu cầu từ DPC Ireland về các vấn đề liên quan đến tuân thủ GDPR. Meta cho biết, điều này đánh dấu "một bước thụt lùi đối với sự đổi mới và cạnh tranh của châu Âu trong phát triển AI".

Ngọc Ánh (theo FT)

Xem thêm

Google lại bị phạt 1 tỷ USD vì độc quyền

Google lại bị phạt 1 tỷ USD vì độc quyền

(CLO) Ủy ban châu Âu ngày 23/7 thông báo phạt Google 890 triệu euro (khoảng 1 tỷ USD) vì vi phạm Đạo luật Thị trường Kỹ thuật số (DMA), cáo buộc hãng công nghệ Mỹ lạm dụng vị thế thống lĩnh để ưu tiên các dịch vụ của mình và gây bất lợi cho đối thủ.

Google Cloud tăng trưởng bùng nổ nhờ AI

Google Cloud tăng trưởng bùng nổ nhờ AI

(CLO) Alphabet, công ty mẹ của Google, vừa công bố báo cáo thu nhập mới nhất cho thấy sự tăng trưởng mạnh mẽ, phần nào giải tỏa nỗi lo của các nhà đầu tư về việc liệu những khoản chi tiêu khổng lồ cho trí tuệ nhân tạo (AI) có thực sự mang lại lợi ích hay không.

Doanh nghiệp Việt muốn bứt phá phải biết dùng AI, không thể mãi cạnh tranh bằng giá

Doanh nghiệp Việt muốn bứt phá phải biết dùng AI, không thể mãi cạnh tranh bằng giá

(CLO) Trong kỷ nguyên AI, lợi thế của doanh nghiệp không còn nằm ở quy mô hay giá bán mà ở khả năng đổi mới sáng tạo, tạo ra giá trị khác biệt và thấu hiểu khách hàng. Đây là nhận định được các chuyên gia đưa ra tại Diễn đàn Chiến lược Kinh doanh "The Future of Business" diễn ra tại TP.HCM chiều 22/7.

Trung Quốc phát triển AI 'đọc' dark web, phát hiện nội dung phạm pháp

Trung Quốc phát triển AI 'đọc' dark web, phát hiện nội dung phạm pháp

(CLO) Các nhà nghiên cứu thuộc Đại học Cảnh sát Điều tra Hình sự Trung Quốc đã phát triển một hệ thống trí tuệ nhân tạo (AI) có khả năng thu thập và phân tích nội dung trên dark web bằng tiếng Trung, nhằm hỗ trợ phát hiện các hoạt động phạm pháp trên không gian mạng.

Meta hầu tòa vì cáo buộc Instagram gây nghiện

Meta hầu tòa vì cáo buộc Instagram gây nghiện

(CLO) Meta Platforms sẽ phải hầu tòa tại bang Tennessee (Mỹ) vào ngày 20/7 để đối mặt với cáo buộc Instagram được thiết kế theo cách "gây nghiện" cho thanh thiếu niên, làm trầm trọng thêm cuộc khủng hoảng sức khỏe tâm thần ở giới trẻ.

Google thua kiện vụ quảng cáo cờ bạc trên YouTube

Google thua kiện vụ quảng cáo cờ bạc trên YouTube

(CLO) Google đã thất bại trong nỗ lực hủy khoản phạt 750.000 euro liên quan đến các video quảng cáo cờ bạc trên nền tảng YouTube, sau khi Tòa án Công lý Liên minh châu Âu (CJEU) ra phán quyết có lợi cho cơ quan quản lý truyền thông của Ý.

Mạng xã hội X điều chỉnh thuật toán, giúp 'bạn bè' gắn kết hơn

Mạng xã hội X điều chỉnh thuật toán, giúp 'bạn bè' gắn kết hơn

(CLO) Giám đốc sản phẩm của mạng xã hội X, Nikita Bier, ngày 13/7 đã thông báo về một sự thay đổi quan trọng trong cách hiển thị nội dung trên nền tảng này nhằm mục đích tăng khả năng hiển thị các bài đăng từ những người dùng có mối quan hệ hai chiều, tức những tài khoản theo dõi lẫn nhau.

Apple kiện OpenAI với cáo buộc đánh cắp bí mật thương mại

Apple kiện OpenAI với cáo buộc đánh cắp bí mật thương mại

(CLO) Ngày 10/7, Apple đã đệ đơn kiện OpenAI cùng một số cựu nhân viên lên Tòa án Quận Bắc California (Mỹ), cáo buộc công ty này tiến hành một chiến dịch có hệ thống nhằm chiếm đoạt bí mật thương mại về phần cứng để phục vụ tham vọng phát triển thiết bị tiêu dùng.

OpenAI chính thức phát hành mô hình GPT-5.6 mới

OpenAI chính thức phát hành mô hình GPT-5.6 mới

(CLO) Ngày 9/7, OpenAI chính thức phát hành dòng mô hình GPT-5.6 gồm ba phiên bản Sol, Terra và Luna. Đây là lần đầu tiên công ty từ bỏ cách đặt tên bằng số để chuyển sang các tên gọi mới nhằm giúp người dùng dễ phân biệt cấp độ hiệu năng và chi phí giữa các mô hình.

Cỡ chữ bài viết: