Mô hình AI mới của OpenAI xuất hiện nhiều thông tin sai lệch

(CLO) Hai mô hình AI mới của OpenAI là o3 và o4-mini đạt nhiều tiến bộ trong lập trình và toán học, nhưng chúng lại tạo ra thông tin sai lệch, hay còn gọi là lỗi “tưởng tượng” hay "ảo giác", nhiều hơn các mô hình trước đây.

Trong lĩnh vực AI, “ảo giác” là khi mô hình đưa ra thông tin không đúng sự thật hoặc tự bịa đặt chi tiết. Đây là một thách thức lớn, ngay cả với các hệ thống tiên tiến nhất. Thông thường, các mô hình mới sẽ giảm thiểu hiện tượng này so với phiên bản cũ. Tuy nhiên, o3 và o4-mini lại đi ngược xu hướng.

openai-106-3840x2160.jpeg
Hai mô hình o3 và o4-mini đang tạo ra nhiều lỗi tưởng tượng hơn mô hình cũ của chính OpenAI. Ảnh minh hoạ.

Theo thử nghiệm nội bộ của OpenAI, o3 tạo ra thông tin sai lệch trong 33% câu trả lời trên PersonQA – một bài kiểm tra đánh giá độ chính xác về thông tin liên quan đến con người. Con số này cao gấp đôi so với các mô hình lý luận trước đó như o1 (16%) và o3-mini (14.8%). O4-mini thậm chí còn tệ hơn, với tỷ lệ tưởng tượng lên tới 48%.

Điều đáng chú ý là OpenAI chưa lý giải được nguyên nhân. Trong báo cáo kỹ thuật, công ty cho biết cần thêm nghiên cứu để hiểu tại sao các mô hình lý luận mới lại dễ tưởng tượng hơn. Một giả thuyết là vì o3 và o4-mini đưa ra nhiều “tuyên bố” hơn, chúng vừa tạo ra thông tin chính xác hơn, vừa dễ mắc sai lầm hơn.

Ông Neil Chowdhury, nhà nghiên cứu và là cựu nhân viên OpenAI, cho rằng kỹ thuật học tăng cường (reinforcement learning) được sử dụng cho dòng mô hình o-series có thể làm trầm trọng thêm vấn đề tưởng tượng. Thông thường, các bước xử lý sau huấn luyện giúp giảm thiểu lỗi này, nhưng với o3 và o4-mini, hiệu quả dường như không đủ.

Tỷ lệ tưởng tượng cao có thể khiến o3 kém hữu ích hơn kỳ vọng, đặc biệt trong các ứng dụng đòi hỏi độ chính xác cao.

Dù gặp vấn đề về độ chính xác, o3 và o4-mini vẫn ghi điểm trong một số lĩnh vực. Ông Kian Katanforoosh, giáo sư tại Đại học Stanford và CEO của startup Workera, cho biết đội ngũ của ông đã thử nghiệm o3 trong quy trình lập trình và đánh giá nó vượt trội so với các đối thủ. Tuy nhiên, ông cũng lưu ý rằng o3 thường tạo ra các liên kết website không hoạt động, gây khó khăn cho người dùng.

Hiện tượng tưởng tượng có thể giúp AI đưa ra ý tưởng sáng tạo, nhưng nó lại là rào cản lớn trong các ngành như luật hoặc y tế, nơi sai sót dù nhỏ cũng có thể gây hậu quả nghiêm trọng. Chẳng hạn, một công ty luật sẽ không hài lòng nếu AI đưa thông tin sai vào hợp đồng khách hàng.

OpenAI thừa nhận rằng việc giảm "ảo giác" là một thách thức liên tục. Người phát ngôn Niko Felix nhấn mạnh: “Chúng tôi không ngừng nghiên cứu để cải thiện độ chính xác và độ tin cậy của các mô hình”.

(theo TC, OpenAI)

Xem thêm

Google lại bị phạt 1 tỷ USD vì độc quyền

Google lại bị phạt 1 tỷ USD vì độc quyền

(CLO) Ủy ban châu Âu ngày 23/7 thông báo phạt Google 890 triệu euro (khoảng 1 tỷ USD) vì vi phạm Đạo luật Thị trường Kỹ thuật số (DMA), cáo buộc hãng công nghệ Mỹ lạm dụng vị thế thống lĩnh để ưu tiên các dịch vụ của mình và gây bất lợi cho đối thủ.

Google Cloud tăng trưởng bùng nổ nhờ AI

Google Cloud tăng trưởng bùng nổ nhờ AI

(CLO) Alphabet, công ty mẹ của Google, vừa công bố báo cáo thu nhập mới nhất cho thấy sự tăng trưởng mạnh mẽ, phần nào giải tỏa nỗi lo của các nhà đầu tư về việc liệu những khoản chi tiêu khổng lồ cho trí tuệ nhân tạo (AI) có thực sự mang lại lợi ích hay không.

Doanh nghiệp Việt muốn bứt phá phải biết dùng AI, không thể mãi cạnh tranh bằng giá

Doanh nghiệp Việt muốn bứt phá phải biết dùng AI, không thể mãi cạnh tranh bằng giá

(CLO) Trong kỷ nguyên AI, lợi thế của doanh nghiệp không còn nằm ở quy mô hay giá bán mà ở khả năng đổi mới sáng tạo, tạo ra giá trị khác biệt và thấu hiểu khách hàng. Đây là nhận định được các chuyên gia đưa ra tại Diễn đàn Chiến lược Kinh doanh "The Future of Business" diễn ra tại TP.HCM chiều 22/7.

Trung Quốc phát triển AI 'đọc' dark web, phát hiện nội dung phạm pháp

Trung Quốc phát triển AI 'đọc' dark web, phát hiện nội dung phạm pháp

(CLO) Các nhà nghiên cứu thuộc Đại học Cảnh sát Điều tra Hình sự Trung Quốc đã phát triển một hệ thống trí tuệ nhân tạo (AI) có khả năng thu thập và phân tích nội dung trên dark web bằng tiếng Trung, nhằm hỗ trợ phát hiện các hoạt động phạm pháp trên không gian mạng.

Meta hầu tòa vì cáo buộc Instagram gây nghiện

Meta hầu tòa vì cáo buộc Instagram gây nghiện

(CLO) Meta Platforms sẽ phải hầu tòa tại bang Tennessee (Mỹ) vào ngày 20/7 để đối mặt với cáo buộc Instagram được thiết kế theo cách "gây nghiện" cho thanh thiếu niên, làm trầm trọng thêm cuộc khủng hoảng sức khỏe tâm thần ở giới trẻ.

Google thua kiện vụ quảng cáo cờ bạc trên YouTube

Google thua kiện vụ quảng cáo cờ bạc trên YouTube

(CLO) Google đã thất bại trong nỗ lực hủy khoản phạt 750.000 euro liên quan đến các video quảng cáo cờ bạc trên nền tảng YouTube, sau khi Tòa án Công lý Liên minh châu Âu (CJEU) ra phán quyết có lợi cho cơ quan quản lý truyền thông của Ý.

Mạng xã hội X điều chỉnh thuật toán, giúp 'bạn bè' gắn kết hơn

Mạng xã hội X điều chỉnh thuật toán, giúp 'bạn bè' gắn kết hơn

(CLO) Giám đốc sản phẩm của mạng xã hội X, Nikita Bier, ngày 13/7 đã thông báo về một sự thay đổi quan trọng trong cách hiển thị nội dung trên nền tảng này nhằm mục đích tăng khả năng hiển thị các bài đăng từ những người dùng có mối quan hệ hai chiều, tức những tài khoản theo dõi lẫn nhau.

Apple kiện OpenAI với cáo buộc đánh cắp bí mật thương mại

Apple kiện OpenAI với cáo buộc đánh cắp bí mật thương mại

(CLO) Ngày 10/7, Apple đã đệ đơn kiện OpenAI cùng một số cựu nhân viên lên Tòa án Quận Bắc California (Mỹ), cáo buộc công ty này tiến hành một chiến dịch có hệ thống nhằm chiếm đoạt bí mật thương mại về phần cứng để phục vụ tham vọng phát triển thiết bị tiêu dùng.

OpenAI chính thức phát hành mô hình GPT-5.6 mới

OpenAI chính thức phát hành mô hình GPT-5.6 mới

(CLO) Ngày 9/7, OpenAI chính thức phát hành dòng mô hình GPT-5.6 gồm ba phiên bản Sol, Terra và Luna. Đây là lần đầu tiên công ty từ bỏ cách đặt tên bằng số để chuyển sang các tên gọi mới nhằm giúp người dùng dễ phân biệt cấp độ hiệu năng và chi phí giữa các mô hình.

Cỡ chữ bài viết: