Tòa án liên bang Mỹ đã phê chuẩn thỏa thuận 1,5 tỷ USD giữa Anthropic và nhóm tác giả kiện công ty này vì cáo buộc dùng sách lậu để huấn luyện Claude. Đây là khoản dàn xếp bản quyền lớn nhất được biết đến trong lĩnh vực AI tạo sinh.
Vụ việc chưa chốt được câu hỏi pháp lý cốt lõi về fair use khi huấn luyện mô hình AI, nhưng đã tạo ra một mốc định giá rủi ro rất cụ thể cho ngành. Với các công ty AI, nhà đầu tư và nhà xuất bản, chi phí dữ liệu huấn luyện có thể trở thành một biến số tài chính thực sự.
- Anthropic đạt thỏa thuận 1,5 tỷ USD trong vụ kiện bản quyền liên quan đến dữ liệu huấn luyện Claude.
- Vụ kiện chưa giải quyết dứt điểm việc huấn luyện AI bằng tài liệu có bản quyền có được xem là fair use hay không.
- Thỏa thuận này có thể trở thành thước đo chi phí pháp lý mới cho các công ty AI đang phụ thuộc vào dữ liệu huấn luyện.
Thỏa thuận 1,5 tỷ USD của Anthropic là gì?
Anthropic đã đồng ý chi 1,5 tỷ USD để dàn xếp vụ kiện bản quyền do các tác giả khởi xướng, với cáo buộc công ty dùng sách lậu để huấn luyện các mô hình Claude. Tòa án liên bang Mỹ đã phê chuẩn thỏa thuận này vào ngày 20/7/2026.
Đây là khoản dàn xếp bản quyền lớn nhất được biết đến trong lĩnh vực AI tạo sinh. Tuy nhiên, thỏa thuận không đồng nghĩa với việc tòa án đã đưa ra phán quyết dứt khoát về tính hợp pháp của toàn bộ hoạt động huấn luyện AI bằng tài liệu có bản quyền.
Fair use vẫn là điểm chưa ngã ngũ
Fair use là khái niệm trung tâm của tranh chấp và vẫn chưa được xác định rõ trong bối cảnh huấn luyện AI. Câu hỏi chính là liệu việc dùng tài liệu có bản quyền để huấn luyện mô hình có được coi là sử dụng hợp lý hay không.
Văn phòng Bản quyền Mỹ cho rằng đánh giá fair use phụ thuộc vào từng trường hợp cụ thể, gồm mục đích sử dụng, bản chất tác phẩm, phần được dùng và tác động đến thị trường của tác phẩm gốc. Vì vậy, tranh luận pháp lý về AI training chưa thể kết thúc chỉ bằng một công thức chung.
There’s uncertainty about how lawsuits will come out in this area.
– Peter Henderson, đồng tác giả nghiên cứu Foundation Models and Fair Use
Một số nghiên cứu do Peter Henderson đồng dẫn dắt cũng cho thấy GPT-4 có thể tạo ra các đoạn văn dài từ một số tác phẩm cụ thể ngay cả khi prompt chỉ được chỉnh sửa rất ít. Những kết quả như vậy đã được dùng để lập luận rằng một số mô hình AI có thể ghi nhớ biểu đạt được bảo hộ, thay vì chỉ học mẫu từ dữ liệu.
Vì sao vụ Anthropic được xem là mốc tham chiếu?
Vụ kiện bắt đầu từ năm 2023, khi một số tác giả cáo buộc Anthropic huấn luyện hệ thống bằng sách bất hợp pháp. Đến năm 2025, công ty chấp nhận dàn xếp 1,5 tỷ USD sau khi thẩm phán William Alsup kết luận rằng việc huấn luyện AI có thể được xem là fair use, dù các cáo buộc khác liên quan đến việc thu thập sách lậu vẫn có thể tiếp tục.
Việc thỏa thuận được phê chuẩn vào ngày 20/7/2026 khiến đây trở thành một điểm chuẩn mới cho các tranh chấp tương tự, dù nó không nhất thiết tạo ra tiền lệ ràng buộc cho mọi vụ việc khác.
Anthropic cũng diễn ra trong lúc nhiều vụ kiện lớn khác vẫn đang mở tại tòa án Mỹ, gồm kiện của The New York Times נגד OpenAI và Microsoft, nhiều vụ kiện của nhà văn nhằm vào Meta, cùng các tranh chấp do nhà xuất bản và tổ chức truyền thông khởi xướng. Chính vì vậy, kết quả của vụ Anthropic sẽ được các bên khác theo dõi rất sát.
Rủi ro bản quyền đang trở thành chi phí kinh doanh của AI
Rủi ro bản quyền không còn là một mối lo pháp lý mơ hồ mà đang được chuyển thành một khoản chi có thể đo lường. Với các doanh nghiệp AI đã phải chi hàng tỷ USD cho chip, hạ tầng đám mây và năng lực tính toán, dữ liệu huấn luyện có thể trở thành một lợi thế cạnh tranh mới nếu nó đủ sạch về mặt pháp lý.
Thỏa thuận của Anthropic cho thấy các công ty AI có thể phải trả giá rất lớn cho sự bất định quanh dữ liệu đầu vào. Trong bối cảnh đó, việc có nguồn dữ liệu đủ vững về quyền sử dụng có thể quan trọng không kém hiệu năng mô hình.
Cho đến khi tòa án xác định rõ ranh giới giữa fair use và cấp phép, Anthropic nhiều khả năng vẫn sẽ là một mốc tham chiếu cho mức giá của rủi ro trong ngành AI.
Tổng kết
Khoản dàn xếp 1,5 tỷ USD của Anthropic không chấm dứt tranh luận pháp lý về huấn luyện AI, nhưng đã đẩy rủi ro bản quyền từ phạm vi lý thuyết sang một con số cụ thể. Với thị trường AI, đây là tín hiệu cho thấy dữ liệu huấn luyện và chi phí pháp lý đang trở thành hai biến số không thể tách rời.



