Tin AI mới

Oxford cho OpenAI dùng tài liệu để huấn luyện AI

Oxford cho OpenAI dùng tài liệu để huấn luyện AI

TL;DR: Oxford đã cho OpenAI sử dụng một phần tài liệu lịch sử được số hóa từ Bodleian Library để bổ sung dữ liệu huấn luyện AI, dù thông báo hợp tác ban đầu chủ yếu nhấn mạnh mục tiêu số hóa và mở rộng quyền tiếp cận tài liệu.

Tài liệu nội bộ của Đại học Oxford cho thấy các bản quét từ Bodleian Library đã được dùng để “bổ sung vào bộ dữ liệu huấn luyện của OpenAI”. Đây là chi tiết đáng chú ý trong thỏa thuận công bố từ tháng 3/2025, khi Oxford nói sẽ dùng phần mềm của OpenAI để số hóa văn bản và hỗ trợ sinh viên, nhà nghiên cứu tiếp cận kho tư liệu tốt hơn.

Thông báo thời điểm đó không nêu rõ các tài liệu số hóa cũng sẽ phục vụ việc huấn luyện mô hình của công ty đứng sau ChatGPT. Theo Oxford, quy mô văn bản liên quan là nhỏ, chỉ gồm tài liệu đã hết bản quyền; thư viện vẫn giữ quyền với các bản quét và dự kiến công bố chúng trực tuyến trong vài tháng tới.

Từ số hóa thư viện đến dữ liệu huấn luyện

Các mô hình AI tạo sinh học cách xử lý và tạo văn bản bằng cách nhận diện mẫu trong lượng dữ liệu rất lớn. Vì vậy, nguồn tài liệu lịch sử chưa được số hóa có giá trị với các nhà phát triển mô hình, nhất là khi internet ngày càng chứa nhiều nội dung do AI tạo ra, từ văn bản đến video hoạt hình do AI tạo, có thể làm giảm giá trị của dữ liệu web đối với việc huấn luyện.

Đến tháng 6/2025, 125.000 hình ảnh quét từ các luận án lịch sử trong bộ sưu tập Bodleian đã được chia sẻ với OpenAI. Nguồn này gồm các luận án tiến sĩ của trường đại học tại châu Âu và Mỹ trong thế kỷ 19 và 20.

Các hạng mục đã số hóa còn có bộ sưu tập hiếm gồm 10.000 bản ballad thế kỷ 16, chứa lời ca và ký âm từng được lưu hành trên đường phố thời Tudor. Nhân sự Oxford cũng đã thảo luận khả năng số hóa hồ sơ nhà nước Ireland thế kỷ 18, thư riêng của nhà văn Ireland Marie Edgeworth và sổ ghi chép về penicillin của nhà khoa học Dorothy Hodgkin.

Oxford nói dữ liệu nhỏ và không độc quyền

Đại diện Oxford cho biết lợi ích chính của trường trong hợp tác là số hóa, đồng thời phủ nhận nhận định rằng yếu tố huấn luyện máy đã bị che giấu với công chúng và sinh viên. Theo trường, nhân sự đã cởi mở về việc dự án cũng đóng góp dữ liệu huấn luyện.

Oxford nhấn mạnh tài liệu được số hóa là nội dung hết bản quyền, quy mô ở mức khiêm tốn và OpenAI không có quyền sử dụng độc quyền. Bodleian giữ quyền với các bản quét, trong khi các hiện vật gốc vẫn được bảo toàn. Điều này khác với một số hoạt động mua sách cũ để quét của ngành AI, nơi sách có thể bị tháo gáy hoặc phá hủy trong quá trình số hóa.

Về phía OpenAI, công ty nói mục tiêu là giúp các mô hình AI lưu giữ tri thức lịch sử của thế giới và phản ánh nhiều nền văn hóa, lịch sử cũng như góc nhìn hơn. Oxford là thành viên tại Anh duy nhất của NextGenAI, dự án mà OpenAI cũng đã ký thỏa thuận với các thư viện và tổ chức nghiên cứu tại Mỹ.

Lo ngại nội bộ về uy tín và môi trường

Biên bản họp nội bộ của Oxford ghi nhận một số nhân viên, bao gồm thành viên ủy ban quản trị Bodleian, bày tỏ lo ngại về rủi ro uy tín khi hợp tác với OpenAI. Các cuộc trao đổi cũng đề cập tác động đối với cam kết môi trường của trường, bởi công nghệ AI tiêu tốn nhiều năng lượng.

Thỏa thuận có thể tạo điều kiện để Oxford số hóa ở quy mô lớn hơn trong kho lưu trữ gồm khoảng 23 triệu hiện vật của Bodleian. Biên bản cũng nhắc tới ý tưởng phát triển chatbot “Ask the Bod”, dù chưa có thông tin cho thấy sản phẩm này đã được triển khai.

Vì sao đáng chú ý?

Câu chuyện cho thấy ranh giới giữa số hóa di sản để phục vụ công chúng và cung cấp dữ liệu cho mô hình thương mại đang trở thành vấn đề cần được giải thích rõ hơn. Việc tài liệu đã hết bản quyền không tự động giải quyết mọi câu hỏi về minh bạch, quyền kiểm soát bản quét, tiêu thụ năng lượng hay uy tín của tổ chức lưu trữ.

Với các thư viện và trường đại học, hợp tác với công ty AI có thể đem lại nguồn lực số hóa mà họ khó tự đầu tư. Tuy nhiên, trường hợp Oxford cho thấy mục đích sử dụng dữ liệu là một phần quan trọng của thỏa thuận, đặc biệt khi tài liệu văn hóa và học thuật được đưa vào chuỗi cung ứng cho các mô hình AI phổ biến.

Skills Bridge tổng hợp