- अमेरिकी संघीय अदालत ने Claude की ट्रेनिंग के लिए इस्तेमाल की गई पायरेटेड किताबों से जुड़े Anthropic के कॉपीराइट class action मुकदमे में लगभग $1.5 billion की सुलह को मंजूरी दी
- Anthropic हजारों लेखकों और प्रकाशकों को प्रति किताब लगभग $3,000 देगा, और 4,82,000 से अधिक लक्षित किताबों में से 91% से अधिक पर अधिकार दावा दर्ज किया गया
- पहले के फैसले में माना गया था कि कॉपीराइट वाली किताबों का उपयोग कर AI ट्रेनिंग करना अपने आप में गैरकानूनी नहीं है, लेकिन piracy sites से लाखों किताबें हासिल करना अनुचित था
- वादियों की ओर से इस सुलह को ज्ञात कॉपीराइट मुआवजों में अब तक का सबसे बड़ा बताया गया, और प्रतिभागियों को मुआवजा यथाशीघ्र वितरित करने की योजना है
- 2024 में Andrea Bartz समेत 3 लेखकों द्वारा शुरू किया गया यह मुकदमा अदालत में चल रहे दर्जनों AI कॉपीराइट मुकदमों में पहली बड़ी सुलह बन गया
$1.5 billion की सुलह को मंजूरी
- संघीय जिला अदालत की जज Araceli Martínez-Olguín ने Anthropic और हजारों लेखकों के बीच class action सुलह को मंजूरी दी, जिसके तहत प्रति किताब लगभग $3,000 का भुगतान किया जाएगा
- सुलह की कुल राशि $1.5 billion है, और यह Claude chatbot की ट्रेनिंग में इस्तेमाल की गई पायरेटेड किताबों से संबंधित है
- अदालत ने माना कि यह सुलह प्रभावित लेखकों और प्रकाशकों को वास्तविक राहत प्रदान करती है
- 4,82,000 से अधिक लक्षित किताबों में से लगभग 91% के लिए लेखक या प्रकाशक ने अधिकार दावा किया, इसलिए वे भुगतान के पात्र बने
मुआवजे का आकार और भुगतान प्रक्रिया
- वादियों की ओर से वकील Justin Nelson ने कहा कि यह सुलह ज्ञात कॉपीराइट मुआवजों में अब तक की सबसे बड़ी है
- वादी पक्ष class action के प्रतिभागियों को मुआवजा यथाशीघ्र वितरित करने की योजना बना रहा है
AI ट्रेनिंग और अवैध रूप से हासिल सामग्री में अंतर करने वाला फैसला
- सेवानिवृत्त अमेरिकी संघीय जिला अदालत के जज William Alsup ने सितंबर 2025 में इस सुलह को प्रारंभिक मंजूरी दी
- पहले के फैसले ने AI ट्रेनिंग और किताबों की प्राप्ति को अलग-अलग देखा
- कॉपीराइट वाली किताबों से AI chatbot को ट्रेनिंग देना अपने आप में गैरकानूनी नहीं माना गया
- Anthropic द्वारा piracy sites के जरिए लाखों किताबें हासिल करना अनुचित माना गया
- Anthropic की legal VP Aparna Sridhar ने इसे एक महत्वपूर्ण फैसला बताया, जिसने पुष्टि की कि किताबों का उपयोग कर AI ट्रेनिंग कॉपीराइट कानून के तहत fair use है
- कंपनी ने कहा कि पात्र लेखकों और प्रकाशकों में 91% से अधिक ने अपने भुगतान हिस्से का दावा किया है, और उसे मामले के समापन की उम्मीद है
मुकदमे की शुरुआत और दायरा
- बेस्टसेलिंग thriller लेखिका Andrea Bartz ने 2024 में दो अन्य लेखकों के साथ मिलकर पहली बार यह मुकदमा दायर किया
- यह सुलह अदालत में अभी भी चल रहे दर्जनों AI कॉपीराइट मुकदमों में पहली बड़ी सुलह है
1 टिप्पणियां
Hacker News की राय
सिर्फ $1.5 billion का one-time settlement होने से कुछ नहीं बदलेगा। अगर AI मौजूदा विचारों को ज्यों का त्यों दोहराता है, तो उसके लिए usage fee देने का कानून बनना चाहिए। अगर LLM इंसानों द्वारा बनाई चीज़ों को तुरंत कॉपी करके सभी subscribers तक पहुँचा सकता है, तो व्यवस्था बदलनी चाहिए
फ़ैसले के अनुसार, Anthropic शायद pirated किताबों को भी LLM में इनपुट कर सकता था अगर बाद में उन्हें delete करने की योजना होती। समस्या यह थी कि pirated प्रतियों को सर्वर की केंद्रीय लाइब्रेरी में स्थायी रूप से संग्रहीत किया गया था, और उनमें ऐसी किताबें भी थीं जो वास्तव में training में इस्तेमाल ही नहीं हुईं। $1.5 billion इस अवैध लाइब्रेरी के लिए settlement है, और training में उपयोग हुआ या नहीं, यह कानूनी रूप से अप्रासंगिक है। हालांकि, अगर यह कोई AI कंपनी न होती तो शायद बहुत कम रकम में settlement हो जाता
समय हो तो judge का motion denial response पढ़ने लायक है
publishers और authors के लिए महत्वपूर्ण हिस्सा यह है कि eligible हर किताब पर $3,000 दिए जाएंगे। अगर यह एक पारंपरिक publishing contract है जिसमें एक ही लेखक शामिल है, तो रकम आधी-आधी बँटेगी। Judge ने class action counsel fee को 12.5% यानी $187.5 million से घटाकर 6.8% यानी $101 million कर दिया, जो लगभग आधी कटौती है, और unreimbursed litigation expenses $2.6 million थे। तीन lead plaintiffs को सिर्फ $15,000 each मिलेंगे
इससे उस मशहूर Reddit शख्स की याद आती है जिसने content public किया था लेकिन उससे पैसा भी नहीं कमाया, और आखिरकार आत्महत्या की ओर धकेल दिया गया
यह conspiracy theory जैसा लग सकता है, लेकिन संभव है कि MIT private network की पड़ताल करते समय उसने कुछ ऐसी अंधेरी बातें खोज ली हों जो सार्वजनिक होने पर कई लोगों के लिए विनाशकारी होतीं। Jeffrey Epstein ने MIT और Media Lab को भारी दान दिया था, इसलिए संभव है कि मुख्यधारा की ‘suicide’ कहानी के पीछे कोई और गहरी कहानी रही हो
Judge Alsup के मूल फ़ैसले में कहा गया था कि piracy के लिए ज़िम्मेदारी है, लेकिन किताबों से LLM training fair use है। रुचि हो तो फ़ैसला पढ़ा जा सकता है
समझ नहीं आता कि Kim Dotcom की तरह इन्हें जेल क्यों नहीं भेजा जाता। यह भी समझ नहीं आता कि federal agents Dario की खिड़की तोड़कर अंदर क्यों नहीं घुसते। इन्होंने सिर्फ piracy नहीं की, बल्कि उसे फिर से बेचकर मुनाफ़ा भी कमाया
जो लोग मानते हैं कि सिर्फ Anthropic ही समस्या है, उन्हें यह हकीकत भी जाननी चाहिए कि ज़्यादातर लेखक median income से कम कमाते हैं और उनकी सालाना आय 20,000 डॉलर से कम होती है। प्रकाशक advance देकर बाद में बिक्री से उसे पूरी तरह recoup करने तक लेखक को अतिरिक्त आय नहीं देते, और ज़्यादातर लेखक उस सीमा तक पहुँच ही नहीं पाते
हो सकता है यह बेहतर हो कि प्रकाशक लेखकों को पर्याप्त भुगतान करें और 2~3 साल में एक किताब लें। संबंधित आँकड़े Authors Guild सर्वे में देखे जा सकते हैं
बहुत-सी किताबें अपना advance भी वापस नहीं निकाल पातीं, इसलिए अगर लेखकों को सिर्फ royalty मिलती तो वे शायद और कम कमाते। Advance बढ़ाने से contracts की संख्या घटती है, क्योंकि पूँजी सीमित है। लिखना तो लगभग हर कोई कर सकता है, इसलिए supply असीमित है, लेकिन demand बहुत सीमित है। लिंक किए गए आँकड़ों में भी प्रकाशक के साथ छपे लेखकों की median income self-published लेखकों से अधिक है, इसलिए यह भी कहा जा सकता है कि प्रकाशक लेखकों का आर्थिक मूल्य बढ़ाते हैं। अंत में, ज़्यादातर किताबें भी संगीत या फ़िल्मों की तरह बड़ी आर्थिक कीमत बनाए बिना डूब जाती हैं, इसलिए सिर्फ ‘लेखकों को ज़्यादा भुगतान करो’ इसका जवाब नहीं है
अगर यही काम कोई व्यक्ति करता तो जेल जाता, लेकिन कंपनी करे तो बस छोटा-सा जुर्माना देकर और ज़्यादा कंटेंट निगलने का लाइसेंस मिल जाता है
असली बात यह नहीं है कि किताबें Claude की training में इस्तेमाल हुईं, बल्कि यह है कि वे pirated copies थीं
books3 इसलिए बनाया गया था ताकि यह स्पष्ट हो सके कि क्या AI कंपनियाँ किताबों पर training कर सकती हैं। यह संभावना कम थी कि निष्कर्ष यह निकलेगा कि ‘सिर्फ training के लिए piracy भी चल सकती है’, लेकिन अगर पर्याप्त compute resources हों तो इससे व्यक्तिगत hackers भी अपने AI models train कर सकते थे। Compute resources, उदाहरण के लिए, Google TRC से मिल सकते हैं। अब कोई सार्थक काम करने के लिए करोड़ों डॉलर चाहिए। मैंने सुना था कि Eleuther ने कभी public domain training data इकट्ठा किया था; जिज्ञासा है कि क्या उसने इतना बड़ा corpus बनाया कि किताबों की training की अहमियत कम हो सके
आज के LLM शासक लगभग मानवता के कुल ज्ञान को चुराकर उसे अपनी तय की हुई कीमत पर दोबारा बेचने का अधिकार माँग रहे हैं। जब इन्होंने पहली बार अपना लक्ष्य सार्वजनिक किया था, तब इन्हें समाज से बहिष्कृत होकर कंगाल हो जाना चाहिए था, लेकिन इंसानों से नफ़रत करने वाले और computer slaves से आदेश मानने वाली दुनिया चाहने वाले अमीर लोग बहुत ज़्यादा हैं
लगता है इस मामले को निपटाने से पहले MPAA और RIAA से सलाह लेना भूल गए। एक किताब पर 3,000 डॉलर—क्या मज़ाकिया नतीजा है। Napster में एक गाने पर कितना लगता था, यह जानना दिलचस्प होगा
जो कुछ मामले समझौते से आगे मुकदमे तक गए, उनमें 1,000 से ज़्यादा गानों में से लगभग 15 गाने चुनकर दावा किया गया। statutory damages प्रति उल्लंघित कृति कम-से-कम 750 डॉलर थे, इसलिए यह पहले दिए गए समझौता प्रस्ताव से लगभग 3~5 गुना बनता था। ज़्यादातर लोगों को वकीलों ने बताया कि उनके जीतने की संभावना नहीं है, फिर उन्होंने RIAA से गंभीर बातचीत कर समझौता कर लिया। जो बहुत थोड़े लोग अंत तक अड़े रहे, उन्होंने मुकदमा बुरी तरह लड़ा और न्यूनतम से कहीं अधिक हर्जाने के फ़ैसले झेले; RIAA ने उनसे कम रकम की पेशकश की थी, फिर भी लड़ते रहने का नतीजा अच्छा नहीं निकला
यह समझौता कई मायनों में Anthropic के IPO प्रोत्साहन को बढ़ाता है। समझौते की संरचना ही Anthropic के बने रहने को मानकर चलती है; 1.5 बिलियन डॉलर किस्तों में दिए जाएँगे और वकीलों की फ़ीस भी उसी शेड्यूल पर दी जाएगी
class-action plaintiffs व्यवहार में Anthropic के creditors बन जाते हैं, इसलिए उन्हें सीधे फ़ायदे के लिए यह ज़रूरी है कि भुगतान अवधि भर कंपनी solvent रहे। सिविल मुकदमों का उद्देश्य क्षतिपूर्ति होता है, और इतना बड़ा फ़ैसला जो भुगतान करने वाले को दिवालिया कर दे, वह निश्चित रूप से लेखकों के लिए और बुरा होता