Giám đốc điều hành Microsoft gọi AI là ‘vụ trộm lao động lớn nhất trong lịch sử loài người’, hồ sơ mới chưa được xác minh tiết lộ

Thông tin mới chưa được xác thực trong vụ kiện bản quyền mà tờ New York Times đưa ra chống lại OpenAI và Microsoft ba năm trước tiết lộ một sự thừa nhận rằng việc quét AI tương đương với hành vi trộm cắp và các sản phẩm AI gây ra mối đe dọa lớn cho các ấn phẩm.

Theo vụ kiện, một giám đốc điều hành hàng đầu của Microsoft đã mô tả riêng các hoạt động đào tạo AI của công ty là “hành vi trộm cắp” và ban lãnh đạo của OpenAI cho biết các mô hình AI của họ gây ra “mối đe dọa hiện hữu” đối với các nhà xuất bản và nhà báo có công việc đào tạo họ.

Tài liệu chưa được niêm phong cũng nêu chi tiết cách các công ty được cho là đã lấy và sử dụng nội dung đó bằng cách vượt qua các bức tường thanh toán mà không bị phát hiện, xây dựng tập dữ liệu đào tạo thông qua việc quét hàng loạt và cố tình loại bỏ thông báo bản quyền khỏi dữ liệu đào tạo.

Điều đáng chú ý là phần lớn thông tin mới đến từ bản tóm tắt của chính The Times, chứ không phải từ các tang vật cơ bản vẫn được niêm phong. Các trích dẫn dưới đây được trình bày mà không có bối cảnh ban đầu của chúng.

Hồ sơ chưa được xác minh là bước leo thang mới nhất trong vụ kiện kéo dài ba năm, trong đó The New York Times ban đầu cáo buộc các công ty đã vi phạm luật bản quyền khi đào tạo các mô hình AI tổng quát về nội dung của nó.

Câu hỏi liệu các công ty AI có thể sử dụng hợp pháp tài liệu có bản quyền để đào tạo AI hay không vẫn chưa có câu trả lời rõ ràng, nhưng các thẩm phán phần lớn ủng hộ lập luận của các công ty AI rằng việc đào tạo cấu thành “sử dụng hợp pháp”. Quy tắc pháp lý này cho phép mọi người sử dụng tác phẩm có bản quyền mà không được phép trong một số trường hợp nhất định, chẳng hạn như tác phẩm nhại lại, đưa tin hoặc chỉ trích. Đầu tháng này, chính quyền Trump đã đóng góp một bản tóm tắt ngắn gọn để bảo vệ việc OpenAI sử dụng trái phép tài liệu có bản quyền để đào tạo LLM của mình.

Tuy nhiên, một số lời thừa nhận mới đi ngược lại quan điểm bảo vệ quyền sử dụng hợp lý của OpenAI, đặc biệt là yêu cầu của quy tắc rằng việc sử dụng không thay thế hoặc gây tổn hại cho thị trường của tác phẩm gốc.

Ví dụ: dữ liệu của chính Microsoft cho thấy “công cụ trả lời” Copilot của họ đã khiến tỷ lệ nhấp chuột vào tên miền của The New York Times giảm tới 93% so với tìm kiếm Bing truyền thống. Một bài thuyết trình nội bộ của Microsoft do Giám đốc Khoa học Ứng dụng của Microsoft, Brent Hecht, viết vào tháng 1 năm 2024 đã mô tả sự suy giảm này là một “vòng lặp diệt vong” sẽ “làm tổn hại đến hiệu suất của các mô hình của chúng tôi và toàn bộ trang web cùng một lúc”.

Tài liệu của Microsoft được trích dẫn trong hồ sơ cho biết: “Rất bất thường khi một sản phẩm cuối cùng đe dọa nền tảng kinh tế của các nhà cung cấp thiết yếu của nó, nhưng đó là tình huống mà chúng tôi đã tạo ra cho hoạt động kinh doanh LLM của mình đối với ‘chuỗi cung ứng nội dung’ của nó”.

Giám đốc điều hành Microsoft Satya Nadella cũng đã làm chứng trong một phiên điều trần hồi đầu năm nay rằng “bất kỳ thứ gì có tường phí đều phải được cấp phép cho bất kỳ ai muốn sử dụng nó… để căn cứ hoặc đào tạo” và nói rõ rằng, nếu ông ấy “được biết rằng OpenAI đã thu thập và đào tạo về thông tin đằng sau tường phí”, thì ông ấy sẽ “gọi (quyền của Microsoft) yêu cầu OpenAI đào tạo lại các mô hình của mình”.

Những lời thừa nhận khác chống lại các trụ cột khác nhau của bài kiểm tra tính sử dụng hợp lý: Nick Turley, Trưởng bộ phận ChatGPT của OpenAI, đã viết trong thông tin liên lạc nội bộ rằng các nhà xuất bản phải đối mặt với “mối đe dọa hiện hữu” từ các sản phẩm như chatbot, vốn “có tính chất thay thế phần lớn” và “sẽ ngày càng có nhiều tính chất thay thế hơn khi chúng trở nên tốt hơn”.

Chủ tịch OpenAI Greg Brockman mô tả các mô hình này là “xuất sắc về tin tức”. Nadella đã tuyên thệ vào đầu năm nay rằng việc trò chuyện bằng chatbot “đã thay thế… việc cung cấp cho bạn thông tin ngay trên trang web trên nền tảng AI thay vì phải truy cập vào nguồn cơ bản”.

Loại ngôn ngữ đó nói lên cách công nghệ có thể cạnh tranh trực tiếp, thay vì biến đổi tác phẩm gốc.

Một tài liệu của Microsoft nêu rõ rằng có một “rủi ro thực sự” rằng AI có thể tạo ra có thể “làm gián đoạn đáng kể việc làm của chính những người tạo ra dữ liệu mà mô hình nền tảng đã được đào tạo”.

Quy mô tuyệt đối của việc sao chép thật đáng kinh ngạc. Các tài liệu lần đầu tiên tiết lộ rằng chỉ riêng bộ dữ liệu đào tạo giữa kỳ của OpenAI đã chứa hơn 91.692 bản sao tác phẩm được NYT, Daily News và Trung tâm Báo cáo Điều tra xuất bản. Một tập dữ liệu có nguồn gốc từ Common Crawl đã bao gồm hơn 2 triệu tài liệu chỉ riêng từ nytimes.com.

Trong một bản ghi nhớ nội bộ vào tháng 1 năm 2023, Hecht gọi đây là “vụ trộm đáng kinh ngạc với quy mô chưa từng có” và “vụ trộm lao động lớn nhất trong lịch sử nhân loại”.

Hồ sơ trình bày chi tiết mới về cách OpenAI và Microsoft tiến hành thu thập nội dung của nguyên đơn, bao gồm cả việc lấy nội dung đó khỏi Bing Index.

“OpenAI đã giao toàn bộ tập dữ liệu đào tạo GPT-3 cho Microsoft, tập dữ liệu này được Microsoft sử dụng để đánh giá cách triển khai các mô hình của OpenAI trong các sản phẩm thương mại của chính họ,” hồ sơ viết. “Tương tự, Microsoft cũng cung cấp dữ liệu đào tạo cho OpenAI thông qua các sáng kiến ​​có tên Project Taxi và Project Mango.”

Các công ty bị cáo buộc đã tập hợp dữ liệu Project Mango thành một tập dữ liệu huấn luyện chứa bản sao của ít nhất 160.903 tác phẩm độc đáo từ các nhà xuất bản tin tức.

Để tận dụng tối đa khả năng thu thập dữ liệu của mình, các nhân viên của OpenAI được cho là đã nghĩ ra một kế hoạch để vượt qua các bức tường thanh toán mà không bị phát hiện. Hồ sơ cho thấy rằng khi nhà nghiên cứu Nick Ryder của OpenAI nói với Brockman về một “vụ hack để vượt qua tường phí của Newtime”, Brockman đã trả lời: “à hay quá”.

Các nhân viên của OpenAI cũng bị cáo buộc đã xây dựng các tập dữ liệu đào tạo như WebText và WebText2 dựa vào nội dung tin tức cóp nhặt một cách không cân xứng. Họ cũng bị cáo buộc đã lấy hàng triệu bài viết từ Common Crawl, một kho lưu trữ dữ liệu thu thập dữ liệu web mở, miễn phí. Các phát hiện cũng mô tả những nỗ lực có chủ ý nhằm loại bỏ các thông báo bản quyền khỏi dữ liệu đào tạo trước khi nó đến mô hình, vì các nhà nghiên cứu “không muốn mô hình xuất ra” “thông báo bản quyền” cho người dùng.

OpenAI và Microsoft đã không trả lời yêu cầu bình luận.

Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể kiếm được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập biên tập của chúng tôi.

Bài viết liên quan

Chuyên Mục: Tin tức
Bài trước
Ngay cả Vua Anh cũng có sự do dự về AI
Bài sau
Giới hạn 100 robotxi của Zoox do Amazon sở hữu ở Nevada sắp biến mất