VnExpress: Làm chủ dữ liệu để hiểu độc giả và tối ưu sản phẩm

(NB&CL) Với VnExpress, xây dựng năng lực dữ liệu bắt đầu từ nhu cầu trả lời những câu hỏi rất cụ thể về độc giả và sản phẩm: Vì sao pageview tăng hoặc giảm? Độc giả là ai? Họ đến và đi vì điều gì? Làm thế nào để kéo họ quay lại và tương tác? Sau nhiều năm xây dựng hệ thống riêng, dữ liệu trở thành một phần trong cách tòa soạn phân tích nội dung, hiểu độc giả và vận hành sản phẩm.

Từ những câu hỏi về độc giả

Là một báo điện tử ra đời trong môi trường số, VnExpress sớm tổ chức và sử dụng dữ liệu trong hoạt động vận hành. Theo bà Nguyễn Thu Hương, Phó Tổng Biên tập VnExpress, ngay từ những ngày đầu thành lập, tòa soạn đã phải tìm lời giải cho những câu hỏi mà các công cụ phân tích phổ biến như Google Analytics chưa thể trả lời đầy đủ.

“Tại sao pageview tăng/giảm? Độc giả là ai? Họ đến và đi vì điều gì? Làm thế nào kéo họ quay lại và tương tác?”, bà Hương chia sẻ.

Từ nhu cầu đó, VnExpress xây dựng ba hệ thống gồm VnExpress Analytics để phân tích nội dung, Audience Data Platform để quản lý dữ liệu độc giả và hệ thống dữ liệu quảng cáo.

Theo bà Hương, việc tự xây dựng hệ thống xuất phát từ yêu cầu về chi phí, bảo mật và khả năng tùy biến theo thực tế vận hành của tòa soạn. Chi phí thuê các hệ thống bên ngoài có thể lên tới 50.000-100.000 USD mỗi năm, trong khi việc làm chủ hệ thống giúp VnExpress chủ động hơn trong tổ chức và khai thác dữ liệu.

a9.png
Dữ liệu trở thành nền tảng hỗ trợ các quyết định về nội dung, phát triển sản phẩm và trải nghiệm độc giả tại VnExpress. Ảnh: VnExpress.

Dữ liệu để cá nhân hoá sản phẩm

Một trong những hướng sử dụng dữ liệu mà VnExpress theo đuổi là cá nhân hóa trải nghiệm độc giả.

“Mong muốn của chúng tôi là với 45 triệu độc giả, chúng tôi sẽ có 45 triệu phiên bản báo, đi cùng là những phiên bản quảng cáo khác nhau trên cơ sở phân loại từng tệp độc giả”, bà Hương nói.

Để thực hiện mục tiêu này, VnExpress tổ chức dữ liệu theo ba bước: chuẩn hóa và gắn nhãn, tập trung hóa dữ liệu và duy trì vòng lặp phản hồi liên tục.

Ở bước đầu tiên, dữ liệu từ phóng viên và hành vi của độc giả được phân loại ngay từ luồng vào. Mỗi bài viết được hệ thống và biên tập viên gắn các lớp siêu dữ liệu như chủ đề, nhân vật, địa danh, thương hiệu, nhu cầu của độc giả và định dạng nội dung.

Theo bà Hương, việc gắn nhãn giúp AI hiểu được bản chất nội dung để phân phối đúng người, đúng kênh.

Ở bước thứ hai, VnExpress tập trung dữ liệu về một kho theo mô hình Data Lakehouse. Các nguồn dữ liệu như bình luận, video, hình ảnh và những dữ liệu khác được đưa về một hệ thống tập trung, với các tầng từ dữ liệu thô, dữ liệu đã làm sạch đến dữ liệu sẵn sàng cho phân tích.

Bước thứ ba là vòng lặp phản hồi liên tục. Khi AI đưa ra gợi ý bài viết cho độc giả hoặc đề xuất chỉnh sửa tiêu đề cho biên tập viên, phản ứng sau đó của độc giả và biên tập viên tiếp tục trở thành dữ liệu mới. Những dữ liệu này được thu thập để phục vụ quá trình tái huấn luyện, giúp mô hình được điều chỉnh theo thực tế sử dụng.

Dữ liệu cũng được VnExpress sử dụng để theo dõi “sức khỏe” của sản phẩm. Bà Hương nhấn mạnh, các chỉ số cần được theo dõi và báo cáo định kỳ theo tuần, tháng, quý, qua đó giúp tòa soạn nhận biết những thay đổi trong hành vi độc giả và hiệu quả của sản phẩm. Việc tự xây dựng hệ thống cũng cho phép tòa soạn chủ động lựa chọn những chỉ số phù hợp với nhu cầu vận hành, thay vì chỉ phụ thuộc vào các chỉ số có sẵn từ nền tảng bên ngoài. Bà cho rằng việc sử dụng dữ liệu cần được thực hiện liên tục, qua quá trình thử nghiệm, chấp nhận sai và điều chỉnh.

a8.png
VnExpress xây dựng các hệ thống dữ liệu nội bộ nhằm chủ động phân tích hành vi độc giả, tối ưu nội dung và quảng cáo thay vì phụ thuộc hoàn toàn vào nền tảng bên ngoài. Ảnh: Vnexpress

AI-first bắt đầu từ nền tảng dữ liệu

Việc VnExpress sử dụng dữ liệu từ sớm đã tạo thuận lợi khi tòa soạn triển khai AI.

Theo bà Nguyễn Thu Hương báo có nguồn tài nguyên sạch, đồng bộ được lưu trữ liền mạch, gần như không đứt gãy. Đây là nguồn tài nguyên quan trọng để đào tạo AI.

Bên cạnh nguồn dữ liệu, bà Hương cho rằng tư duy sản xuất và quản trị vận hành của VnExpress cũng sớm thích nghi với công nghệ.

“Tại VnExpress, công nghệ không phải là công cụ hỗ trợ mà là hạ tầng cốt lõi. Quy trình tác nghiệp của tòa soạn được thiết kế chung quanh hệ thống quản trị nội dung do Báo làm chủ”, bà cho hay.

Theo bà, điều này giúp quá trình đưa AI vào hoạt động tác nghiệp diễn ra thuận lợi hơn. Đội ngũ phóng viên, biên tập viên đã quen với việc làm việc dựa trên dữ liệu và đo lường hiệu suất bằng các chỉ số cụ thể.

VnExpress cũng có đội ngũ kỹ sư công nghệ làm việc cùng người làm nội dung, qua đó có thể tự triển khai, thử nghiệm và điều chỉnh các giải pháp theo những bài toán riêng của tòa soạn.

Một số ứng dụng được bà Hương nêu gồm cá nhân hóa giao diện theo thời gian thực dựa trên mô hình hành vi của độc giả, tự động hóa luồng phân phối nội dung đa kênh và tích hợp các trợ lý AI vào quy trình biên tập, trong đó có tự động gắn siêu dữ liệu và cấu trúc nội dung theo chuẩn SEO riêng của tòa soạn.

Bà Hương không xem AI là một xu hướng công nghệ nhất thời:“Chúng tôi không nhìn AI như một làn sóng thời thượng mà xem đó là sự tiến hóa tất yếu. AI là công cụ giải phóng sức lao động cho nhà báo, giúp họ tập trung vào những giá trị cốt lõi nhất: sáng tạo nội dung chất lượng cao, có chiều sâu nhân văn và mang lại giá trị thiết thực cho cộng đồng”

Dữ liệu phải sạch, cập nhật và có kiểm soát

Trong quá trình tổ chức dữ liệu phục vụ AI, VnExpress chú trọng các yêu cầu về thời gian thực, chất lượng, khả năng mở rộng, bảo mật và quyền riêng tư.

Theo bà Hương, dữ liệu phục vụ báo chí cần được cập nhật đủ nhanh để phản ánh hành vi của độc giả. Nếu hệ thống mất quá nhiều thời gian xử lý, những gợi ý nội dung có thể trở nên lỗi thời. Chất lượng dữ liệu cũng phải được kiểm soát, bởi dữ liệu nhiễu, sai lệch hoặc trùng lặp có thể dẫn đến những phân tích sai hướng hoặc ảnh hưởng đến các chuẩn mực báo chí.

Hạ tầng dữ liệu đồng thời phải đủ linh hoạt để đáp ứng những thời điểm lượng truy cập tăng đột biến, đặc biệt khi xảy ra các sự kiện lớn. Bảo mật dữ liệu cá nhân của độc giả và tài nguyên nội dung của tòa soạn cũng là yêu cầu quan trọng trong toàn bộ quá trình.

“Chúng tôi trân trọng từng bài viết, từng cái click chuột của độc giả, coi đó là những viên gạch để xây dựng nên một tòa soạn thông minh hơn, phục vụ công chúng tốt hơn mỗi ngày”, bà Hương chia sẻ.

Xem thêm

Vì sao dữ liệu đang trở thành “nguồn lực chiến lược” của báo chí?

Vì sao dữ liệu đang trở thành “nguồn lực chiến lược” của báo chí?

(NB&CL) Trong kỷ nguyên số và AI, một cơ quan báo chí không chỉ cần sản xuất nội dung nhanh, hay mà còn phải biết tổ chức, chuẩn hóa, kết nối và khai thác tài sản dữ liệu của mình. Từ kho nội dung đã xuất bản, dữ liệu độc giả, hình ảnh, video, âm thanh đến dữ liệu phục vụ sản xuất nội dung, tất cả cần được nhìn nhận như một hạ tầng chiến lược. Tòa soạn nào làm chủ được dữ liệu sẽ có nền tảng để làm chủ công nghệ, đổi mới sản phẩm và nâng cao năng lực cạnh tranh. Đó cũng chính là vấn đề được đặt ra tại chuyên đề này.

Bảo vệ bản quyền trên môi trường số: Tạo điều kiện để các sản phẩm sáng tạo trở thành nguồn lực phát triển

Bảo vệ bản quyền trên môi trường số: Tạo điều kiện để các sản phẩm sáng tạo trở thành nguồn lực phát triển

(CLO) Sự phát triển của trí tuệ nhân tạo, nền tảng số và dữ liệu lớn đang khiến tài sản trí tuệ văn hóa được tạo ra, lan truyền và khai thác với tốc độ chưa từng có, đồng thời làm gia tăng nguy cơ sao chép, phát tán và xâm phạm bản quyền. Định danh, truy vết, bảo vệ quyền và biến tài sản trí tuệ thành nguồn lực kinh tế đang trở thành yêu cầu cấp thiết của quá trình phát triển văn hóa số.

Tòa soạn cần làm gì khi nhà sáng tạo nội dung ngày càng mạnh?

Tòa soạn cần làm gì khi nhà sáng tạo nội dung ngày càng mạnh?

(CLO) Sự phát triển của các nhà sáng tạo nội dung đang buộc các tòa soạn và thương hiệu truyền thông truyền thống phải nhìn lại vai trò của mình. Khi một cá nhân có thể tự sản xuất, phân phối và xây dựng cộng đồng riêng trên YouTube, Instagram hay TikTok, lợi thế của tòa soạn không còn đơn giản nằm ở khả năng đưa nội dung đến công chúng.

Khi thông tin trở nên dư thừa, báo chí còn lại gì?

Khi thông tin trở nên dư thừa, báo chí còn lại gì?

(CLO) Khi mạng xã hội phá vỡ độc quyền thông tin, còn AI khiến nội dung có thể được tạo ra với tốc độ và quy mô chưa từng có, vấn đề vì thế không còn nằm ở việc báo chí có thể đưa ra bao nhiêu thông tin, mà ở câu hỏi khó hơn: giữa một thế giới đã dư thừa thông tin, báo chí còn tạo ra giá trị gì?

SCMP dùng AI để giành lại độc giả giữa cuộc dịch chuyển khỏi website báo chí

SCMP dùng AI để giành lại độc giả giữa cuộc dịch chuyển khỏi website báo chí

(CLO) Trí tuệ nhân tạo (AI) đang đặt các tòa soạn trước hai lựa chọn quan trọng, hoặc chỉ dùng công nghệ để tăng tốc những quy trình hiện có, hoặc tận dụng AI để thay đổi căn bản cách báo chí tiếp cận độc giả. Theo ông Jun Zhang, Giám đốc Công nghệ của báo South China Morning Post (SCMP), các tòa soạn nên chọn hướng thứ hai.

Cơ quan Báo và Phát thanh, Truyền hình Hà Nội ký kết hợp tác truyền thông với Công ty Xổ số điện toán Việt Nam

Cơ quan Báo và Phát thanh, Truyền hình Hà Nội ký kết hợp tác truyền thông với Công ty Xổ số điện toán Việt Nam

Chiều 20-8, Cơ quan Báo và Phát thanh, Truyền hình Hà Nội và Công ty TNHH MTV Xổ số điện toán Việt Nam (Vietlott) ký thỏa thuận hợp tác truyền thông giai đoạn 2026-2030, hướng tới phát huy thế mạnh đa nền tảng, lan tỏa thông tin chính thống và các hoạt động trách nhiệm xã hội của doanh nghiệp.

Đưa văn hóa giữ nước và hình tượng Bộ đội Cụ Hồ tỏa sáng trong kỷ nguyên số

Đưa văn hóa giữ nước và hình tượng Bộ đội Cụ Hồ tỏa sáng trong kỷ nguyên số

(NB&CL) Thực hiện Nghị quyết số 80-NQ/TW của Bộ Chính trị về phát triển văn hóa Việt Nam, Trung tâm Phát thanh - Truyền hình Quân đội đang thể hiện một cách tiếp cận mới: dùng sức mạnh của truyền thông đa phương tiện để gìn giữ bản sắc và tạo dựng “sức mạnh mềm” từ hình tượng Bộ đội Cụ Hồ. Từ những câu chuyện về người lính trong đời sống hôm nay đến các sản phẩm số về lịch sử, di sản và văn hóa giữ nước, những giá trị ấy đang được kể lại bằng ngôn ngữ của kỷ nguyên số.

Cỡ chữ bài viết: