AI RACE— Cuộc đua AI
Doanh nghiệp

Toàn Cảnh Các Toán Học Tranh Cãi: Các Nhà Toán Học Yêu Cầu OpenAI Chứng Minh Không Dùng Công Trình Của Họ

Hai nhà toán học cáo buộc OpenAI dùng dữ liệu chưa công khai trong các khám phá toán học, đòi công ty minh bạch nguồn dữ liệu huấn luyện.

18:00 10/09/2026
Toàn Cảnh Các Toán Học Tranh Cãi: Các Nhà Toán Học Yêu Cầu OpenAI Chứng Minh Không Dùng Công Trình Của Họ

Sự kiện nổi bật

Vào đầu tháng 9 năm 2026, cộng đồng toán học quốc tế lại một lần nữa xôn xao khi một nhà toán học người Đức, Andreas Thom, công khai cáo buộc OpenAI đã “đánh lừa” và không minh bạch về nguồn dữ liệu dùng để huấn luyện các mô hình trí tuệ nhân tạo (AI) của mình. Thom cho rằng những cuộc trò chuyện của ông với chatbot ChatGPT trước khi OpenAI công bố một loạt “đột phá” trong lĩnh vực toán học – trong đó có kết quả về các nhóm phi‑sofic – có khả năng đã được đưa vào bộ dữ liệu huấn luyện, từ đó giúp AI đạt được thành tựu. Yêu cầu của ông là OpenAI phải công khai chứng minh rằng không có dữ liệu người dùng, đặc biệt là các công trình chưa công bố, đã được sử dụng.

Chi tiết các cáo buộc và phản hồi

Tháng 8/2026, OpenAI công bố 10 khám phá toán học mới, trong đó có một kết quả liên quan đến “nhóm phi‑sofic” – một khái niệm về các cấu trúc vô hạn không thể xấp xỉ bằng các cấu trúc hữu hạn. OpenAI thừa nhận rằng kết quả này “dựa rất nhiều vào công trình trước đây của Andreas Thom và đồng nghiệp Gábor Kun”. Tuy nhiên, phần mô tả ban đầu của công ty không đề cập tới các đóng góp gần đây của hai nhà toán học này, dẫn tới làn sóng chỉ trích mạnh mẽ trong giới học thuật.

  • Kết quả “phi‑sofic” gây tranh cãi

Thom cho biết, vào khoảng cuối năm 2025, ông và một số đồng nghiệp đã thử nghiệm ChatGPT để thảo luận các vấn đề liên quan tới nhóm phi‑sofic. Khi OpenAI công bố kết quả, Thom nhận thấy AI “nắm bắt chi tiết kỹ thuật của chúng tôi” – những phương pháp mà lúc bấy giờ chưa phải là con đường giải quyết dễ dàng nhất. Điều này khiến ông nghi ngờ rằng các đoạn hội thoại với ChatGPT có thể đã được thu thập và đưa vào bộ dữ liệu huấn luyện, dù OpenAI chưa công khai.

  • Mối liên hệ với ChatGPT

Để làm rõ, Thom đã gửi email tới hai nhà nghiên cứu của OpenAI: Sébastien Bubeck và Mark Sellke (cũng là thống kê gia tại Harvard). Nội dung thư hỏi liệu các cuộc trò chuyện của mình với ChatGPT có “được đưa vào dữ liệu huấn luyện hoặc được truy cập trong quá trình suy luận” của mô hình hay không. Trả lời nhận được chỉ đề cập tới việc liệu các đoạn hội thoại có thể được truy cập trực tiếp hay không, mà không giải thích liệu chúng đã được “hòa nhập” vào kho dữ liệu khổng lồ mà OpenAI dùng để cải thiện mô hình. “Không có bất kỳ định tính, giải thích hay bằng chứng nào được cung cấp,” Thom viết, “điều này ít nhất cũng là một hành vi không trung thực.”

  • Liên lạc với các nhà nghiên cứu OpenAI

Theo Thom, chỉ OpenAI mới có khả năng kiểm tra toàn bộ pipeline dữ liệu huấn luyện để xác định liệu công trình của ông có bị sử dụng hay không. Vì vậy, nếu công ty phủ nhận việc sử dụng dữ liệu người dùng, họ phải “cung cấp toàn bộ bộ dữ liệu cần thiết và làm rõ các thiết lập, điều kiện sử dụng dữ liệu” để chứng minh lời nói của mình.

  • Yêu cầu minh bạch

Tranh cãi này xuất hiện ngay sau một vụ việc tương tự liên quan tới giải Millennium Prize. Khi OpenAI công bố giải pháp cho bài toán Navier‑Stokes (một trong bảy vấn đề Millenium), công ty khẳng định “không sử dụng bất kỳ dữ liệu người dùng cụ thể nào” và cho rằng họ chỉ tiếp cận các công trình khi chúng đã được công bố công khai. Tuy nhiên, trong thông cáo, OpenAI cũng lưu ý “mặc dù khả năng này thấp, chúng tôi không thể loại trừ khả năng dữ liệu đã được vô danh hoá từ việc sử dụng sản phẩm của chúng tôi đã góp phần cải thiện mô hình.” Thom cho rằng việc “vô danh hoá” chỉ xóa tên, không xóa nội dung trí tuệ, và do đó vẫn là vi phạm đạo đức.

  • Liên quan đến giải Millennium Prize

Nhiều nhà toán học khác, bao gồm giáo sư Tristan Buckmaster (NYU), cũng bày tỏ lo ngại rằng các mô hình AI có thể “ăn cắp” các ý tưởng chưa công bố và sau đó dùng chúng để “đua tranh” trong việc công bố kết quả. Họ lo rằng nếu những lo ngại này không được giải quyết, lĩnh vực toán học có thể trở nên “bí mật hơn”, khiến các nhà nghiên cứu ngại chia sẻ các gợi ý hoặc dự đoán quan trọng vì sợ bị AI “cướp” công trình.

  • Phản hồi của các nhà khoa học

The Verge đã gửi yêu cầu bình luận tới OpenAI, nhưng tính đến thời điểm viết bài, công ty vẫn chưa có phản hồi chính thức nào.

  • OpenAI chưa phản hồi

Bối cảnh rộng hơn và các hệ lụy

Tranh cãi này không chỉ là một vụ việc cá nhân mà còn phản ánh xu hướng chung của ngành AI: khi các mô hình ngày càng mạnh mẽ, câu hỏi về nguồn dữ liệu và quyền sở hữu trí tuệ trở nên cấp bách hơn. OpenAI, cùng với các đối thủ như Anthropic và Google DeepMind, đang dần “xâm nhập” vào các lĩnh vực truyền thống của khoa học thuần túy, trong đó có toán học. Việc công khai dữ liệu huấn luyện đã trở thành một tiêu chuẩn đạo đức mà nhiều nhà nghiên cứu yêu cầu, nhưng các công ty vẫn còn do dự vì lý do bảo mật thương mại và quy mô khổng lồ của dữ liệu.

Nếu OpenAI không giải quyết được các cáo buộc này, hậu quả có thể là sự mất niềm tin của cộng đồng học thuật, khiến các nhà khoa học giảm bớt sự hợp tác với các nền tảng AI. Đồng thời, nó cũng đặt ra câu hỏi về cách thức các giải thưởng danh tiếng như Millennium Prize sẽ được đánh giá trong tương lai khi AI có thể “đóng góp” vào các giải pháp. Các nhà khoa học cảnh báo rằng, nếu không có cơ chế kiểm tra và minh bạch, chúng ta có thể bước vào một kỷ nguyên mà các khám phá quan trọng được “đánh cắp” và tái sử dụng mà không có sự công nhận đúng đắn.

Trong khi đó, OpenAI vẫn duy trì quan điểm “không sử dụng dữ liệu người dùng cụ thể”, nhưng lời giải thích mơ hồ về “dữ liệu đã được vô danh hoá” khiến nhiều người nghi ngờ. Đòi hỏi công khai toàn bộ bộ dữ liệu huấn luyện và quy trình xử lý thông tin không chỉ là yêu cầu đạo đức mà còn là cách duy nhất để khôi phục niềm tin giữa các nhà nghiên cứu và các công ty AI.

---

Bài viết dựa trên báo cáo của The Verge ngày 10/9/2026, do phóng viên Robert Hart thực hiện.

◗ Nguồn

The Verge10-09

Tin liên quan