Từ những câu hỏi về độc giả
Là một báo điện tử ra đời trong môi trường số, VnExpress sớm tổ chức và sử dụng dữ liệu trong hoạt động vận hành. Theo bà Nguyễn Thu Hương, Phó Tổng Biên tập VnExpress, ngay từ những ngày đầu thành lập, tòa soạn đã phải tìm lời giải cho những câu hỏi mà các công cụ phân tích phổ biến như Google Analytics chưa thể trả lời đầy đủ.
“Tại sao pageview tăng/giảm? Độc giả là ai? Họ đến và đi vì điều gì? Làm thế nào kéo họ quay lại và tương tác?”, bà Hương chia sẻ.
Từ nhu cầu đó, VnExpress xây dựng ba hệ thống gồm VnExpress Analytics để phân tích nội dung, Audience Data Platform để quản lý dữ liệu độc giả và hệ thống dữ liệu quảng cáo.
Theo bà Hương, việc tự xây dựng hệ thống xuất phát từ yêu cầu về chi phí, bảo mật và khả năng tùy biến theo thực tế vận hành của tòa soạn. Chi phí thuê các hệ thống bên ngoài có thể lên tới 50.000-100.000 USD mỗi năm, trong khi việc làm chủ hệ thống giúp VnExpress chủ động hơn trong tổ chức và khai thác dữ liệu.
Dữ liệu để cá nhân hoá sản phẩm
Một trong những hướng sử dụng dữ liệu mà VnExpress theo đuổi là cá nhân hóa trải nghiệm độc giả.
“Mong muốn của chúng tôi là với 45 triệu độc giả, chúng tôi sẽ có 45 triệu phiên bản báo, đi cùng là những phiên bản quảng cáo khác nhau trên cơ sở phân loại từng tệp độc giả”, bà Hương nói.
Để thực hiện mục tiêu này, VnExpress tổ chức dữ liệu theo ba bước: chuẩn hóa và gắn nhãn, tập trung hóa dữ liệu và duy trì vòng lặp phản hồi liên tục.
Ở bước đầu tiên, dữ liệu từ phóng viên và hành vi của độc giả được phân loại ngay từ luồng vào. Mỗi bài viết được hệ thống và biên tập viên gắn các lớp siêu dữ liệu như chủ đề, nhân vật, địa danh, thương hiệu, nhu cầu của độc giả và định dạng nội dung.
Theo bà Hương, việc gắn nhãn giúp AI hiểu được bản chất nội dung để phân phối đúng người, đúng kênh.
Ở bước thứ hai, VnExpress tập trung dữ liệu về một kho theo mô hình Data Lakehouse. Các nguồn dữ liệu như bình luận, video, hình ảnh và những dữ liệu khác được đưa về một hệ thống tập trung, với các tầng từ dữ liệu thô, dữ liệu đã làm sạch đến dữ liệu sẵn sàng cho phân tích.
Bước thứ ba là vòng lặp phản hồi liên tục. Khi AI đưa ra gợi ý bài viết cho độc giả hoặc đề xuất chỉnh sửa tiêu đề cho biên tập viên, phản ứng sau đó của độc giả và biên tập viên tiếp tục trở thành dữ liệu mới. Những dữ liệu này được thu thập để phục vụ quá trình tái huấn luyện, giúp mô hình được điều chỉnh theo thực tế sử dụng.
Dữ liệu cũng được VnExpress sử dụng để theo dõi “sức khỏe” của sản phẩm. Bà Hương nhấn mạnh, các chỉ số cần được theo dõi và báo cáo định kỳ theo tuần, tháng, quý, qua đó giúp tòa soạn nhận biết những thay đổi trong hành vi độc giả và hiệu quả của sản phẩm. Việc tự xây dựng hệ thống cũng cho phép tòa soạn chủ động lựa chọn những chỉ số phù hợp với nhu cầu vận hành, thay vì chỉ phụ thuộc vào các chỉ số có sẵn từ nền tảng bên ngoài. Bà cho rằng việc sử dụng dữ liệu cần được thực hiện liên tục, qua quá trình thử nghiệm, chấp nhận sai và điều chỉnh.
AI-first bắt đầu từ nền tảng dữ liệu
Việc VnExpress sử dụng dữ liệu từ sớm đã tạo thuận lợi khi tòa soạn triển khai AI.
Theo bà Nguyễn Thu Hương báo có nguồn tài nguyên sạch, đồng bộ được lưu trữ liền mạch, gần như không đứt gãy. Đây là nguồn tài nguyên quan trọng để đào tạo AI.
Bên cạnh nguồn dữ liệu, bà Hương cho rằng tư duy sản xuất và quản trị vận hành của VnExpress cũng sớm thích nghi với công nghệ.
“Tại VnExpress, công nghệ không phải là công cụ hỗ trợ mà là hạ tầng cốt lõi. Quy trình tác nghiệp của tòa soạn được thiết kế chung quanh hệ thống quản trị nội dung do Báo làm chủ”, bà cho hay.
Theo bà, điều này giúp quá trình đưa AI vào hoạt động tác nghiệp diễn ra thuận lợi hơn. Đội ngũ phóng viên, biên tập viên đã quen với việc làm việc dựa trên dữ liệu và đo lường hiệu suất bằng các chỉ số cụ thể.
VnExpress cũng có đội ngũ kỹ sư công nghệ làm việc cùng người làm nội dung, qua đó có thể tự triển khai, thử nghiệm và điều chỉnh các giải pháp theo những bài toán riêng của tòa soạn.
Một số ứng dụng được bà Hương nêu gồm cá nhân hóa giao diện theo thời gian thực dựa trên mô hình hành vi của độc giả, tự động hóa luồng phân phối nội dung đa kênh và tích hợp các trợ lý AI vào quy trình biên tập, trong đó có tự động gắn siêu dữ liệu và cấu trúc nội dung theo chuẩn SEO riêng của tòa soạn.
Bà Hương không xem AI là một xu hướng công nghệ nhất thời:“Chúng tôi không nhìn AI như một làn sóng thời thượng mà xem đó là sự tiến hóa tất yếu. AI là công cụ giải phóng sức lao động cho nhà báo, giúp họ tập trung vào những giá trị cốt lõi nhất: sáng tạo nội dung chất lượng cao, có chiều sâu nhân văn và mang lại giá trị thiết thực cho cộng đồng”
Dữ liệu phải sạch, cập nhật và có kiểm soát
Trong quá trình tổ chức dữ liệu phục vụ AI, VnExpress chú trọng các yêu cầu về thời gian thực, chất lượng, khả năng mở rộng, bảo mật và quyền riêng tư.
Theo bà Hương, dữ liệu phục vụ báo chí cần được cập nhật đủ nhanh để phản ánh hành vi của độc giả. Nếu hệ thống mất quá nhiều thời gian xử lý, những gợi ý nội dung có thể trở nên lỗi thời. Chất lượng dữ liệu cũng phải được kiểm soát, bởi dữ liệu nhiễu, sai lệch hoặc trùng lặp có thể dẫn đến những phân tích sai hướng hoặc ảnh hưởng đến các chuẩn mực báo chí.
Hạ tầng dữ liệu đồng thời phải đủ linh hoạt để đáp ứng những thời điểm lượng truy cập tăng đột biến, đặc biệt khi xảy ra các sự kiện lớn. Bảo mật dữ liệu cá nhân của độc giả và tài nguyên nội dung của tòa soạn cũng là yêu cầu quan trọng trong toàn bộ quá trình.
“Chúng tôi trân trọng từng bài viết, từng cái click chuột của độc giả, coi đó là những viên gạch để xây dựng nên một tòa soạn thông minh hơn, phục vụ công chúng tốt hơn mỗi ngày”, bà Hương chia sẻ.