Tòa soạn không thiếu dữ liệu, mà thiếu năng lực khai thác

(NB&CL) Một tòa soạn có thể tích lũy hàng triệu bài viết, hình ảnh, video sau nhiều năm hoạt động nhưng chưa chắc đã sở hữu một kho dữ liệu có giá trị. Khi thông tin còn phân tán, thiếu cấu trúc và khó kết nối, dữ liệu dù nhiều vẫn chưa thể trở thành nguồn lực tạo ra những giá trị mới.

Vì sao dữ liệu vẫn “đứng yên” sau khi số hóa?

Một phóng viên ảnh có thể chụp tới 1.000 bức trong một sự kiện, nhưng tòa soạn chỉ sử dụng vài bức để xuất bản. Những hình ảnh còn lại sẽ được lưu ở đâu, ai quản lý, ai có quyền khai thác và làm thế nào để tiếp tục tạo ra giá trị từ nguồn tư liệu đó? Câu chuyện này cho thấy một vấn đề lớn hơn trong quản trị dữ liệu ở các tòa soạn: Có dữ liệu chưa đồng nghĩa với việc có thể khai thác dữ liệu. Nếu thông tin được lưu trữ nhưng thiếu cấu trúc, không có quy chuẩn chung và khó kết nối, một khối lượng lớn tư liệu vẫn có thể nằm im trong hệ thống.

Theo ông Nguyễn Phong Anh, Chuyên gia dự án Nâng cao năng lực AI cho giảng viên và sinh viên (Dự án do Meta (Hoa Kỳ) và Đại học KH&XHNV Hà Nội tổ chức), một trong những ngộ nhận phổ biến hiện nay là coi số hóa đồng nghĩa với việc đã có một kho dữ liệu có thể khai thác. Thực tế, số hóa mới chỉ là bước đầu; điều quan trọng hơn là dữ liệu phải được chuẩn hóa để có thể kết nối và chia sẻ.

Theo ông, chuẩn hóa giúp đưa dữ liệu về cùng một bộ tiêu chuẩn thống nhất, tạo ra một “ngôn ngữ chung” để các hệ thống có thể hiểu, trao đổi và xử lý dữ liệu. Với các cơ quan báo chí, đây cũng là điều kiện để kho thông tin được tích lũy qua nhiều năm hoạt động thực sự trở thành một tài sản có thể khai thác.

a4.png
Trong mô hình tòa soạn hiện đại, dữ liệu không còn chỉ phục vụ xuất bản mà trở thành nền tảng kết nối toàn bộ quy trình sản xuất, phân phối và khai thác nội dung. Trong ảnh là Tòa soạn Báo Tuổi trẻ Ảnh: NVCC.

“Đối với các cơ quan báo chí, lượng thông tin được tích lũy qua nhiều năm hoạt động sẽ chỉ thực sự trở thành tài sản khi được tổ chức theo những chuẩn chung. Khi đó, kho dữ liệu mới có thể phục vụ việc kết nối, phân tích và triển khai các công nghệ như Big Data hay trí tuệ nhân tạo”, ông Phong Anh chia sẻ.

Tuy nhiên, chuẩn hóa không phải điều kiện duy nhất. Ông Nguyễn Phong Anh nhấn mạnh, để dữ liệu có thể khai thác hiệu quả, tòa soạn còn phải bảo đảm quy mô, tốc độ cập nhật, tính chính xác, khả năng truy vấn, cùng hạ tầng lưu trữ và công nghệ làm sạch, phân loại.

“Hiện nay, nhiều cơ quan báo chí vẫn chưa số hóa hết dữ liệu giấy, tốc độ cập nhật còn chậm, tính chính xác chưa cao. Việc lưu trữ dữ liệu của cả một cơ quan cũng gặp khó khăn về kinh phí, tầm nhìn và trình độ công nghệ”, ông cho biết.

Như vậy, khoảng cách giữa “có dữ liệu”“khai thác được dữ liệu” không chỉ nằm ở việc tòa soạn đã lưu trữ bao nhiêu thông tin, mà còn ở cách thông tin đó được tổ chức, cập nhật và kết nối.

Một kho dữ liệu lớn nhưng thiếu cấu trúc có thể vẫn khó tìm kiếm như một kho tư liệu nằm rải rác ở nhiều ổ cứng, thư mục và hệ thống khác nhau.

Để mỗi tác phẩm là một đơn vị dữ liệu

Nếu dữ liệu muốn được khai thác lâu dài, câu chuyện không thể bắt đầu từ kho lưu trữ mà phải bắt đầu ngay từ quá trình tạo lập tác phẩm báo chí.

Nhà báo Lê Xuân Trung, Phó Tổng Biên tập Báo điện tử Tuổi Trẻ nhận định, chuẩn hóa dữ liệu trong tòa soạn không đơn thuần là số hóa kho bài viết cũ, mà trước hết là thống nhất cấu trúc dữ liệu cho mọi tác phẩm.

“Nếu áp nguyên tắc “đúng - đủ - sạch - sống - thống nhất - dùng chung” vào một tòa soạn, chuẩn hóa dữ liệu không chỉ là số hóa kho bài viết cũ, mà trước hết là thống nhất cấu trúc dữ liệu cho mọi tác phẩm”, ông Lê Xuân Trung chia sẻ.

a5.png
Mỗi bài viết, hình ảnh, video hay tư liệu thu thập được đều có thể trở thành tài sản chiến lược nếu được chuẩn hóa và quản trị ngay từ đầu. Trong ảnh là PV Báo Tuổi trẻ đang tác nghiệp tại tòa soạn. Ảnh: NVCC.

Theo ông, từ tên tác giả, chuyên mục, từ khóa, thời gian, địa danh, nhân vật đến nguồn tin đều cần được xây dựng theo một bộ quy tắc chung, thay vì để mỗi phóng viên hay mỗi phòng ban lưu trữ theo cách riêng. Cùng với đó, tòa soạn cũng cần thống nhất cách gọi tên cơ quan, dự án, vụ việc, nhân vật hay địa danh để bảo đảm khả năng truy xuất chính xác khi cần tìm kiếm hoặc kết nối dữ liệu.

Bên cạnh việc chuẩn hóa dữ liệu mới, các tòa soạn cũng cần làm sạch kho dữ liệu đã tích lũy qua nhiều năm bằng cách loại bỏ dữ liệu trùng lặp, sửa lỗi và bổ sung các thẻ dữ liệu còn thiếu. Ông Trung nhấn mạnh, đó là điều kiện để kho nội dung có thể được tìm kiếm, phân tích và tái sử dụng hiệu quả.

Đáng chú ý, ông cho rằng điểm nghẽn lớn nhất của quá trình này không nằm ở công nghệ mà ở nhận thức và quy trình làm báo.

“Tư duy phổ biến là “viết xong bài là xong việc”, trong khi thực ra bài viết chỉ thực sự hoàn chỉnh khi được gắn đúng dữ liệu đi kèm”, ông nói.

Phó Tổng biên tập Báo điện tử Tuổi trẻ cho biết, phóng viên ngày nay không chỉ tạo ra một tác phẩm báo chí mà còn tạo ra một “đơn vị dữ liệu”, trong đó thông tin về nhân vật, địa điểm, chủ đề và mối liên hệ với các nội dung khác cần được khai báo đầy đủ ngay từ đầu. Biên tập viên cũng không chỉ kiểm duyệt nội dung mà còn phải kiểm soát tính chính xác và sự thống nhất của dữ liệu trước khi xuất bản.

Để việc chuẩn hóa được thực hiện đồng bộ, ông Lê Xuân Trung cho rằng mỗi tòa soạn cần xây dựng một bộ từ điển dữ liệu (taxonomy) dùng chung cho các nhóm thông tin như chuyên mục, nhân vật, địa danh và sự kiện. Khi các quy tắc đã được thiết lập, chuẩn hóa dữ liệu sẽ trở thành một phần của quy trình sản xuất báo chí, thay vì là công việc được thực hiện sau khi tác phẩm đã xuất bản.

Từ kho lưu trữ đến tài sản dữ liệu

Mục tiêu cuối cùng của chuẩn hóa dữ liệu không chỉ là giúp tòa soạn tìm lại một bài báo nhanh hơn, mà là biến kho nội dung được tích lũy qua nhiều năm thành một nguồn dữ liệu có thể truy xuất, phân tích và tái sử dụng.

“Khi dữ liệu về bài viết, nhân vật, địa danh, sự kiện và các mối liên hệ được tổ chức theo chuẩn, mỗi tác phẩm sẽ không còn kết thúc vòng đời sau khi xuất bản mà có thể tiếp tục được kết nối với các nội dung khác, phục vụ những tuyến bài mới, những sản phẩm mới và nhiều hình thức khai thác khác của tòa soạn”, ông Lê Xuân Trung lý giải.

Ông nhấn mạnh, đây là nền tảng để các cơ quan báo chí ứng dụng AI hiệu quả hơn. Một kho dữ liệu sạch, có cấu trúc và được chuẩn hóa sẽ giúp các công cụ AI được huấn luyện, tinh chỉnh với độ chính xác cao hơn, thay vì phải xử lý những nguồn dữ liệu phân tán và thiếu thống nhất.

Trong bối cảnh các công cụ AI ngày càng phổ biến và dần trở nên tương đồng giữa các tòa soạn, lợi thế cạnh tranh sẽ không còn nằm ở tốc độ sản xuất nội dung, mà ở khả năng sở hữu, tổ chức và khai thác hiệu quả một kho dữ liệu có hệ thống, có chiều sâu.

Xem thêm

Tương lai ngành truyền thông: AI làm tin thường nhật, nhà báo tập trung tạo nội dung khác biệt

Tương lai ngành truyền thông: AI làm tin thường nhật, nhà báo tập trung tạo nội dung khác biệt

(CLO) Sau một tuần tham dự Hội nghị bàn tròn CEO của INMA tại Vail (Mỹ), với sự góp mặt của khoảng 40 lãnh đạo các tổ chức báo chí, nhiều quan điểm về tương lai ngành truyền thông đã được đưa ra, trong đó nổi bật là việc tự động hóa các công việc thường nhật và tăng đầu tư vào những nội dung tạo khác biệt.

Khi AI ngày càng mạnh, tòa soạn phải mạnh lên từ bên trong

Khi AI ngày càng mạnh, tòa soạn phải mạnh lên từ bên trong

(CLO) Rời xa giai đoạn thí điểm rời rạc, báo chí đang bước vào kỷ nguyên ứng dụng AI sâu vào quy trình và hạ tầng. Cuộc đua công nghệ giờ đây không thuộc về ai sở hữu nhiều công cụ hơn, mà được định đoạt bởi năng lực biến dữ liệu và tri thức tòa soạn thành sức mạnh nội tại.

Luật Báo chí 2025: Cơ quan báo chí được liên kết sản xuất nội dung, bổ sung nguồn thu mới

Luật Báo chí 2025: Cơ quan báo chí được liên kết sản xuất nội dung, bổ sung nguồn thu mới

(CLO) Luật Báo chí 2025 cho phép cơ quan báo chí liên kết với cơ quan báo chí khác, tổ chức, cá nhân trong và ngoài nước để cùng sản xuất nội dung. Luật cũng bổ sung các nguồn thu từ bán quyền đọc, nghe, xem, cấp phép khai thác, sử dụng tác phẩm báo chí; đồng thời quy định cụ thể hơn về xuất nhập khẩu sản phẩm báo chí.

Bản quyền báo chí giữa 'cơn lốc' sao chép và khai thác dữ liệu

Bản quyền báo chí giữa 'cơn lốc' sao chép và khai thác dữ liệu

(CLO) Một bài báo có thể mất nhiều ngày tác nghiệp, xác minh, biên tập nhưng chỉ cần vài phút để bị sao chép. Video bị cắt ghép, livestream lại; dữ liệu bị tự động "cào" cho các hệ thống công nghệ. Công nghệ giúp báo chí lan xa hơn, nhưng cũng khiến tài sản trí tuệ của tòa soạn dễ bị khai thác hơn bao giờ hết.

Tòa soạn của tương lai sẽ được điều hành bằng dữ liệu

Tòa soạn của tương lai sẽ được điều hành bằng dữ liệu

(NB&CL) Cuộc cạnh tranh của báo chí đang thay đổi. Trong kỷ nguyên AI, khoảng cách giữa các tòa soạn sẽ không còn được tạo ra bởi việc ứng dụng thêm một công nghệ mới, mà bởi năng lực quản trị, khả năng tổ chức dữ liệu và những lựa chọn chiến lược được thực hiện từ hôm nay. Khi công nghệ dần trở thành điều kiện phổ biến, dữ liệu sẽ là yếu tố quyết định năng lực cạnh tranh và vị thế của mỗi cơ quan báo chí.

Chuyên gia Lê Quốc Vinh: 'Đổi mới sáng tạo lớn nhất của báo chí là thực hiện tốt hơn vai trò hạ tầng niềm tin'

Chuyên gia Lê Quốc Vinh: 'Đổi mới sáng tạo lớn nhất của báo chí là thực hiện tốt hơn vai trò hạ tầng niềm tin'

(CLO) “Trong một thế giới mà thông tin ngày càng dư thừa nhưng niềm tin ngày càng khan hiếm, đổi mới sáng tạo lớn nhất của báo chí có lẽ không nằm ở việc sản xuất thêm nội dung, mà ở việc thực hiện tốt hơn vai trò hạ tầng niềm tin cho phát triển” - ông Lê Quốc Vinh, Chủ tịch Le Group of Companies, nhấn mạnh khi đề xuất cách tiếp cận 'Báo chí Hạ tầng Niềm tin'.

VnExpress: Làm chủ dữ liệu để hiểu độc giả và tối ưu sản phẩm

VnExpress: Làm chủ dữ liệu để hiểu độc giả và tối ưu sản phẩm

(NB&CL) Với VnExpress, xây dựng năng lực dữ liệu bắt đầu từ nhu cầu trả lời những câu hỏi rất cụ thể về độc giả và sản phẩm: Vì sao pageview tăng hoặc giảm? Độc giả là ai? Họ đến và đi vì điều gì? Làm thế nào để kéo họ quay lại và tương tác? Sau nhiều năm xây dựng hệ thống riêng, dữ liệu trở thành một phần trong cách tòa soạn phân tích nội dung, hiểu độc giả và vận hành sản phẩm.

AI mạnh đến đâu, phụ thuộc dữ liệu đến đó

AI mạnh đến đâu, phụ thuộc dữ liệu đến đó

(NB&CL) AI đang đi rất nhanh từ một công nghệ được báo chí thử nghiệm sang một năng lực được tích hợp vào hoạt động tác nghiệp. Nhưng phía sau những mô hình ngôn ngữ ngày càng mạnh vẫn tồn tại một điều kiện nền tảng: AI chỉ thực sự tạo ra giá trị khi nó được cung cấp dữ liệu đủ tốt, đủ ngữ cảnh và có thể sử dụng một cách đáng tin cậy.

Vì sao dữ liệu đang trở thành “nguồn lực chiến lược” của báo chí?

Vì sao dữ liệu đang trở thành “nguồn lực chiến lược” của báo chí?

(NB&CL) Trong kỷ nguyên số và AI, một cơ quan báo chí không chỉ cần sản xuất nội dung nhanh, hay mà còn phải biết tổ chức, chuẩn hóa, kết nối và khai thác tài sản dữ liệu của mình. Từ kho nội dung đã xuất bản, dữ liệu độc giả, hình ảnh, video, âm thanh đến dữ liệu phục vụ sản xuất nội dung, tất cả cần được nhìn nhận như một hạ tầng chiến lược. Tòa soạn nào làm chủ được dữ liệu sẽ có nền tảng để làm chủ công nghệ, đổi mới sản phẩm và nâng cao năng lực cạnh tranh. Đó cũng chính là vấn đề được đặt ra tại chuyên đề này.

Cỡ chữ bài viết: