Dark web (web tối) là phần ẩn của internet, chỉ có thể truy cập bằng các công cụ đặc biệt. Nhờ cơ chế mã hóa và ẩn danh, đây thường là nơi diễn ra các hoạt động như mua bán dữ liệu cá nhân, thông tin tài chính, dịch vụ phạm pháp và nhiều loại nội dung bất hợp pháp khác.
Theo nghiên cứu công bố hồi tháng 5 trên Tạp chí Hệ thống Máy tính Trung Quốc, hầu hết các công trình trước đây chỉ tập trung phân tích nội dung trên dark web bằng tiếng Anh, trong khi dữ liệu tiếng Trung gần như chưa được nghiên cứu.
Để tiếp cận các diễn đàn trên dark web, nhóm nghiên cứu đã xây dựng một hệ thống có thể tự đăng nhập, vượt qua các bước xác thực và thu thập dữ liệu mà không bị các website phát hiện.
Nhờ đó, họ thu thập được hơn 10.000 bài đăng và dữ liệu từ 8 diễn đàn, trang web tiếng Trung trên dark web. Sau khi thu thập, AI chuyển toàn bộ nội dung, kể cả hình ảnh như ảnh thẻ ngân hàng hay giấy tờ, thành văn bản để phân tích.
Nhóm nghiên cứu ban đầu gắn nhãn thủ công cho khoảng 1.800 mẫu dữ liệu để "dạy" AI nhận biết các loại nội dung.
Sau nhiều vòng huấn luyện, hệ thống đã phân loại hơn 12.000 bài đăng thành nhiều nhóm, như mua bán thông tin tài chính, mua bán dữ liệu định danh cá nhân, rao bán dịch vụ bất hợp pháp, nội dung khiêu dâm, nội dung cực đoan hoặc bạo lực.
Ngoài việc xác định loại nội dung, AI còn chấm điểm mức độ rủi ro của từng bài đăng. Các bài viết chỉ chứa từ ngữ nhạy cảm nhưng chưa vi phạm pháp luật được xếp ở mức rủi ro thấp. Trong khi đó, những nội dung liên quan đến đánh cắp danh tính, cung cấp công cụ phạm tội hoặc liên quan đến trẻ vị thành niên sẽ được chấm điểm cao hơn.
Nhóm nghiên cứu cho biết hệ thống đã được kiểm thử trên một bộ dữ liệu độc lập và cho kết quả phân loại có độ chính xác cao.
Theo các tác giả nghiên cứu, AI có thể giúp giảm đáng kể khối lượng công việc của con người trong việc rà soát nội dung trên dark web, đồng thời tạo nền tảng cho các nghiên cứu và công cụ phân tích chuyên sâu hơn trong tương lai.