1 पॉइंट द्वारा GN⁺ 6 시간 전 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • अमेरिकी संघीय अदालत ने Claude की ट्रेनिंग के लिए इस्तेमाल की गई पायरेटेड किताबों से जुड़े Anthropic के कॉपीराइट class action मुकदमे में लगभग $1.5 billion की सुलह को मंजूरी दी
  • Anthropic हजारों लेखकों और प्रकाशकों को प्रति किताब लगभग $3,000 देगा, और 4,82,000 से अधिक लक्षित किताबों में से 91% से अधिक पर अधिकार दावा दर्ज किया गया
  • पहले के फैसले में माना गया था कि कॉपीराइट वाली किताबों का उपयोग कर AI ट्रेनिंग करना अपने आप में गैरकानूनी नहीं है, लेकिन piracy sites से लाखों किताबें हासिल करना अनुचित था
  • वादियों की ओर से इस सुलह को ज्ञात कॉपीराइट मुआवजों में अब तक का सबसे बड़ा बताया गया, और प्रतिभागियों को मुआवजा यथाशीघ्र वितरित करने की योजना है
  • 2024 में Andrea Bartz समेत 3 लेखकों द्वारा शुरू किया गया यह मुकदमा अदालत में चल रहे दर्जनों AI कॉपीराइट मुकदमों में पहली बड़ी सुलह बन गया

$1.5 billion की सुलह को मंजूरी

  • संघीय जिला अदालत की जज Araceli Martínez-Olguín ने Anthropic और हजारों लेखकों के बीच class action सुलह को मंजूरी दी, जिसके तहत प्रति किताब लगभग $3,000 का भुगतान किया जाएगा
  • सुलह की कुल राशि $1.5 billion है, और यह Claude chatbot की ट्रेनिंग में इस्तेमाल की गई पायरेटेड किताबों से संबंधित है
  • अदालत ने माना कि यह सुलह प्रभावित लेखकों और प्रकाशकों को वास्तविक राहत प्रदान करती है
  • 4,82,000 से अधिक लक्षित किताबों में से लगभग 91% के लिए लेखक या प्रकाशक ने अधिकार दावा किया, इसलिए वे भुगतान के पात्र बने

मुआवजे का आकार और भुगतान प्रक्रिया

  • वादियों की ओर से वकील Justin Nelson ने कहा कि यह सुलह ज्ञात कॉपीराइट मुआवजों में अब तक की सबसे बड़ी है
  • वादी पक्ष class action के प्रतिभागियों को मुआवजा यथाशीघ्र वितरित करने की योजना बना रहा है

AI ट्रेनिंग और अवैध रूप से हासिल सामग्री में अंतर करने वाला फैसला

  • सेवानिवृत्त अमेरिकी संघीय जिला अदालत के जज William Alsup ने सितंबर 2025 में इस सुलह को प्रारंभिक मंजूरी दी
  • पहले के फैसले ने AI ट्रेनिंग और किताबों की प्राप्ति को अलग-अलग देखा
    • कॉपीराइट वाली किताबों से AI chatbot को ट्रेनिंग देना अपने आप में गैरकानूनी नहीं माना गया
    • Anthropic द्वारा piracy sites के जरिए लाखों किताबें हासिल करना अनुचित माना गया
  • Anthropic की legal VP Aparna Sridhar ने इसे एक महत्वपूर्ण फैसला बताया, जिसने पुष्टि की कि किताबों का उपयोग कर AI ट्रेनिंग कॉपीराइट कानून के तहत fair use है
  • कंपनी ने कहा कि पात्र लेखकों और प्रकाशकों में 91% से अधिक ने अपने भुगतान हिस्से का दावा किया है, और उसे मामले के समापन की उम्मीद है

मुकदमे की शुरुआत और दायरा

  • बेस्टसेलिंग thriller लेखिका Andrea Bartz ने 2024 में दो अन्य लेखकों के साथ मिलकर पहली बार यह मुकदमा दायर किया
  • यह सुलह अदालत में अभी भी चल रहे दर्जनों AI कॉपीराइट मुकदमों में पहली बड़ी सुलह है

1 टिप्पणियां

 
GN⁺ 6 시간 전
Hacker News की राय
  • सिर्फ $1.5 billion का one-time settlement होने से कुछ नहीं बदलेगा। अगर AI मौजूदा विचारों को ज्यों का त्यों दोहराता है, तो उसके लिए usage fee देने का कानून बनना चाहिए। अगर LLM इंसानों द्वारा बनाई चीज़ों को तुरंत कॉपी करके सभी subscribers तक पहुँचा सकता है, तो व्यवस्था बदलनी चाहिए

    • यह settlement अदालत के नज़रिए से LLM से लगभग असंबंधित है। Judge Alsup ने फ़ैसला दिया कि किताबों को LLM में इनपुट करना transformative है और fair use के अंतर्गत आता है। खासकर अगर भौतिक किताबें खरीदकर उन्हें scan किया गया हो और मूल प्रतियाँ नष्ट कर दी गई हों
      फ़ैसले के अनुसार, Anthropic शायद pirated किताबों को भी LLM में इनपुट कर सकता था अगर बाद में उन्हें delete करने की योजना होती। समस्या यह थी कि pirated प्रतियों को सर्वर की केंद्रीय लाइब्रेरी में स्थायी रूप से संग्रहीत किया गया था, और उनमें ऐसी किताबें भी थीं जो वास्तव में training में इस्तेमाल ही नहीं हुईं। $1.5 billion इस अवैध लाइब्रेरी के लिए settlement है, और training में उपयोग हुआ या नहीं, यह कानूनी रूप से अप्रासंगिक है। हालांकि, अगर यह कोई AI कंपनी न होती तो शायद बहुत कम रकम में settlement हो जाता
    • उस तर्क से, जब भी कोई मेरे विचार या किसी और के विचार दोहराए, उसे पैसे देने पड़ेंगे। अगर copyright अमूर्त concepts और vibes तक की रक्षा करे और substantial similarity का मानदंड ही नज़रअंदाज़ हो जाए, तो सिर्फ इसलिए कि कोई पहले लिख चुका है, जादुई स्कूल की कहानी भी अब नहीं लिखी जा सकेगी
    • विचार और तथ्य copyright से संरक्षित नहीं होते। copyright लागू होने के लिए विचार को बहुत ठोस, रचनात्मक और पर्याप्त स्तर पर व्यक्त करना पड़ता है। LLM output कभी-कभी ऐसा हो सकता है, लेकिन आम तौर पर नहीं होता
    • अगर कोई pirated किताबें वेब पर साझा करते पकड़ा जाए और जुर्माना भर दे, तो इससे उसे उन्हें साझा करते रहने का अधिकार नहीं मिल जाता। अगर किताबों के लिए औपचारिक permission ली गई होती, तो लेखक या प्रकाशक के साथ कुछ हिस्से साझा करने की सहमति बन सकती थी
    • अब क्या विचारों को ही own करने की कोशिश हो रही है, यही सवाल है
  • समय हो तो judge का motion denial response पढ़ने लायक है
    publishers और authors के लिए महत्वपूर्ण हिस्सा यह है कि eligible हर किताब पर $3,000 दिए जाएंगे। अगर यह एक पारंपरिक publishing contract है जिसमें एक ही लेखक शामिल है, तो रकम आधी-आधी बँटेगी। Judge ने class action counsel fee को 12.5% यानी $187.5 million से घटाकर 6.8% यानी $101 million कर दिया, जो लगभग आधी कटौती है, और unreimbursed litigation expenses $2.6 million थे। तीन lead plaintiffs को सिर्फ $15,000 each मिलेंगे

    • real estate agents और financial advisors की fee rates पर upper limit होती है। मुझे लगता है कि ऐसे standard और reasonable नियम lawyers पर लागू न होने का कारण यह है कि नियम बनाने और लागू करने वाले ज़्यादातर लोग खुद lawyers होते हैं
    • आखिर किस सामान्य स्थिति में unreimbursed litigation expenses $2.6 million तक पहुँच जाते हैं, यह समझ से बाहर है
  • इससे उस मशहूर Reddit शख्स की याद आती है जिसने content public किया था लेकिन उससे पैसा भी नहीं कमाया, और आखिरकार आत्महत्या की ओर धकेल दिया गया

    • वह सिर्फ कोई मशहूर Reddit user नहीं था, बल्कि Aaron Swartz था, जिसने Reddit की founding में योगदान दिया था और RSS का आविष्कार किया था
      यह conspiracy theory जैसा लग सकता है, लेकिन संभव है कि MIT private network की पड़ताल करते समय उसने कुछ ऐसी अंधेरी बातें खोज ली हों जो सार्वजनिक होने पर कई लोगों के लिए विनाशकारी होतीं। Jeffrey Epstein ने MIT और Media Lab को भारी दान दिया था, इसलिए संभव है कि मुख्यधारा की ‘suicide’ कहानी के पीछे कोई और गहरी कहानी रही हो
  • Judge Alsup के मूल फ़ैसले में कहा गया था कि piracy के लिए ज़िम्मेदारी है, लेकिन किताबों से LLM training fair use है। रुचि हो तो फ़ैसला पढ़ा जा सकता है

    • Alsup एक दिलचस्प judge हैं जिन्होंने Oracle v Google, Waymo v Uber जैसे कई बड़े tech मुकदमों को संभाला है। वे लंबे समय से BASIC में programming करने वाले hobbyist developer भी हैं, और मुख्यतः amateur radio गतिविधियों को support करने वाले programs बनाते रहे हैं। shortwave propagation prediction program की screen यहाँ देखी जा सकती है
    • क्या बिना पूर्व सहमति के दूसरों के काम से बड़े पैमाने पर हमेशा के लिए मुनाफ़ा कमाना fair use है, यह सवाल बना हुआ है। अगर अपराध का निपटारा पैसे से हो सकता है, तो इसका मतलब आखिर यही है कि हर चीज़ की एक कीमत है, और settlement money खून की कीमत कहने का एक नरम तरीका लगता है। सचमुच fair होना हो तो इन कंपनियों को स्थायी रूप से usage fee देनी चाहिए, लेकिन व्यवहार में इसे लागू करना मुश्किल है
    • लगता है judge को सैद्धांतिक रूप से किताबों के शब्दशः पुनरुत्पादन की संभावना का पता था। यह जानने की जिज्ञासा है कि क्या उन्हें वह मामला भी पता था जिसमें ऐसा वास्तव में हुआ। अगर नहीं पता था, तो बाद में यह जानने पर भी क्या वे उस प्रक्रिया को ‘अत्यंत transformative’ कहते, यह स्पष्ट नहीं
  • समझ नहीं आता कि Kim Dotcom की तरह इन्हें जेल क्यों नहीं भेजा जाता। यह भी समझ नहीं आता कि federal agents Dario की खिड़की तोड़कर अंदर क्यों नहीं घुसते। इन्होंने सिर्फ piracy नहीं की, बल्कि उसे फिर से बेचकर मुनाफ़ा भी कमाया

    • ऐसे AI settlements, अतीत में copyright enforcement के शिकार लोगों का मज़ाक उड़ाने जैसे हैं, इसलिए अपमानजनक लगते हैं। पुलिस ने Kim Dotcom को आतंकवादी की तरह ट्रीट किया, helicopters से उतरकर उसके घर पर छापा मारा, लेकिन बड़ी tech कंपनियाँ बेहूदे settlement amounts को business cost मानकर निपटा देती हैं
    • यह साफ संकेत है कि कानून का पालन करना ज़रूरी नहीं; बस उसे इस तरह तोड़ो कि परिणाम तुम्हारी सहन-सीमा में रहें। सबको यह समझने में बस समय लगेगा, और फिर यह धीरे-धीरे मर रही liberal democracy के अंत तक ले जा सकता है
    • एक आदमी को मारो तो हत्यारा, हज़ार को मारो तो विजेता कहलाते हो
    • यह मामला class-action civil lawsuit है, इसलिए मेरी समझ से civil suit में जेल की सज़ा विकल्प नहीं होती
    • यह settlement भविष्य में criminal punishment की संभावना को ज़रूरी नहीं कि रोक दे
  • जो लोग मानते हैं कि सिर्फ Anthropic ही समस्या है, उन्हें यह हकीकत भी जाननी चाहिए कि ज़्यादातर लेखक median income से कम कमाते हैं और उनकी सालाना आय 20,000 डॉलर से कम होती है। प्रकाशक advance देकर बाद में बिक्री से उसे पूरी तरह recoup करने तक लेखक को अतिरिक्त आय नहीं देते, और ज़्यादातर लेखक उस सीमा तक पहुँच ही नहीं पाते
    हो सकता है यह बेहतर हो कि प्रकाशक लेखकों को पर्याप्त भुगतान करें और 2~3 साल में एक किताब लें। संबंधित आँकड़े Authors Guild सर्वे में देखे जा सकते हैं

    • इस दृष्टिकोण में कुछ समस्याएँ हैं। प्रकाशन बाज़ार में कमाई फ़िल्म या संगीत की तरह समान रूप से वितरित नहीं होती; कुछ सफल लेखक ही असल में प्रकाशकों को संभाले रखते हैं, जबकि प्रकाशक अगली बड़ी hit की उम्मीद में कई लेखकों को advance देते हैं
      बहुत-सी किताबें अपना advance भी वापस नहीं निकाल पातीं, इसलिए अगर लेखकों को सिर्फ royalty मिलती तो वे शायद और कम कमाते। Advance बढ़ाने से contracts की संख्या घटती है, क्योंकि पूँजी सीमित है। लिखना तो लगभग हर कोई कर सकता है, इसलिए supply असीमित है, लेकिन demand बहुत सीमित है। लिंक किए गए आँकड़ों में भी प्रकाशक के साथ छपे लेखकों की median income self-published लेखकों से अधिक है, इसलिए यह भी कहा जा सकता है कि प्रकाशक लेखकों का आर्थिक मूल्य बढ़ाते हैं। अंत में, ज़्यादातर किताबें भी संगीत या फ़िल्मों की तरह बड़ी आर्थिक कीमत बनाए बिना डूब जाती हैं, इसलिए सिर्फ ‘लेखकों को ज़्यादा भुगतान करो’ इसका जवाब नहीं है
    • अगर ज़्यादातर किताबें बिक्री से advance recover नहीं कर पातीं, तो क्या यह लेखकों के लिए ज़्यादा फ़ायदेमंद contract नहीं है? मतलब, कम सही, पर किसी विकल्प से बेहतर एक guaranteed floor तो मिलता है
    • Advance recover न कर पाना यह भी दिखाता है कि प्रकाशक ज़्यादातर लेखकों को किताब की बिक्री से कमाई गई रकम से ज़्यादा भुगतान करते हैं
    • एक ही समय में कई समस्याएँ मौजूद हो सकती हैं
    • अगर advance किताब की बिक्री से अधिक है, तो क्या इसका मतलब यह नहीं कि प्रकाशक उस किताब पर घाटा उठा रहा है और बिक्री से ज़्यादा भुगतान कर रहा है?
  • अगर यही काम कोई व्यक्ति करता तो जेल जाता, लेकिन कंपनी करे तो बस छोटा-सा जुर्माना देकर और ज़्यादा कंटेंट निगलने का लाइसेंस मिल जाता है

    • यह कोई छोटा जुर्माना नहीं है; यह हर किताब को बाज़ार से खरीदने की लागत से कहीं ज़्यादा बड़ी रकम है
  • असली बात यह नहीं है कि किताबें Claude की training में इस्तेमाल हुईं, बल्कि यह है कि वे pirated copies थीं

    • यह दुखद नतीजा है। अब AI क्षेत्र में बड़ा खिलाड़ी बनने के लिए इतना पूँजीवान होना पड़ेगा कि पूरी लाइब्रेरी खरीद सके और उसे digitize भी कर सके। जानकारी के लिए, किताबों से भरे बड़े pallet box को ‘gaylord’ कहा जाता है, और ये लोग इन्हें सैकड़ों में खरीदते हैं
      books3 इसलिए बनाया गया था ताकि यह स्पष्ट हो सके कि क्या AI कंपनियाँ किताबों पर training कर सकती हैं। यह संभावना कम थी कि निष्कर्ष यह निकलेगा कि ‘सिर्फ training के लिए piracy भी चल सकती है’, लेकिन अगर पर्याप्त compute resources हों तो इससे व्यक्तिगत hackers भी अपने AI models train कर सकते थे। Compute resources, उदाहरण के लिए, Google TRC से मिल सकते हैं। अब कोई सार्थक काम करने के लिए करोड़ों डॉलर चाहिए। मैंने सुना था कि Eleuther ने कभी public domain training data इकट्ठा किया था; जिज्ञासा है कि क्या उसने इतना बड़ा corpus बनाया कि किताबों की training की अहमियत कम हो सके
    • इसलिए हमेशा प्रतिद्वंद्वी मॉडल को distill करना चाहिए। कानूनी ज़िम्मेदारी competitor पर छोड़ दो
    • Training में उसका उपयोग भी एक अलग मुद्दा है। pirated सामग्री से लाभ कमाना भी अपने आप में समस्या होना चाहिए
    • यह एक निर्णायक फ़र्क है, क्योंकि मानव ज्ञान के बड़े हिस्से को समेटे हुए, non-pirated कई terabytes किताबें आसानी से उपलब्ध थीं और उन्हीं पर training हुई हो—ऐसा लगता नहीं
    • मैं पूछना चाहता हूँ कि Anthropic जैसी कंपनियों के लिए आपकी आर्थिक उपज को चुराना किस सीमा तक स्वीकार्य है, जबकि वे उसी से आपकी नौकरियाँ खत्म करना चाहती हैं। कम-से-कम Player Piano में रोबोट चलाने वाली cassette tapes बनाने वाले मज़दूर को भुगतान किया जाता था
      आज के LLM शासक लगभग मानवता के कुल ज्ञान को चुराकर उसे अपनी तय की हुई कीमत पर दोबारा बेचने का अधिकार माँग रहे हैं। जब इन्होंने पहली बार अपना लक्ष्य सार्वजनिक किया था, तब इन्हें समाज से बहिष्कृत होकर कंगाल हो जाना चाहिए था, लेकिन इंसानों से नफ़रत करने वाले और computer slaves से आदेश मानने वाली दुनिया चाहने वाले अमीर लोग बहुत ज़्यादा हैं
  • लगता है इस मामले को निपटाने से पहले MPAA और RIAA से सलाह लेना भूल गए। एक किताब पर 3,000 डॉलर—क्या मज़ाकिया नतीजा है। Napster में एक गाने पर कितना लगता था, यह जानना दिलचस्प होगा

    • RIAA मुकदमे से पहले समझौते में आम तौर पर प्रति गाना 2~4 डॉलर माँगती थी। आम तौर पर निशाना ऐसे लोगों पर होता था जिन्होंने 1,000 से ज़्यादा गाने share किए हों, इसलिए कुल रकम कई हज़ार डॉलर बनती थी
      जो कुछ मामले समझौते से आगे मुकदमे तक गए, उनमें 1,000 से ज़्यादा गानों में से लगभग 15 गाने चुनकर दावा किया गया। statutory damages प्रति उल्लंघित कृति कम-से-कम 750 डॉलर थे, इसलिए यह पहले दिए गए समझौता प्रस्ताव से लगभग 3~5 गुना बनता था। ज़्यादातर लोगों को वकीलों ने बताया कि उनके जीतने की संभावना नहीं है, फिर उन्होंने RIAA से गंभीर बातचीत कर समझौता कर लिया। जो बहुत थोड़े लोग अंत तक अड़े रहे, उन्होंने मुकदमा बुरी तरह लड़ा और न्यूनतम से कहीं अधिक हर्जाने के फ़ैसले झेले; RIAA ने उनसे कम रकम की पेशकश की थी, फिर भी लड़ते रहने का नतीजा अच्छा नहीं निकला
  • यह समझौता कई मायनों में Anthropic के IPO प्रोत्साहन को बढ़ाता है। समझौते की संरचना ही Anthropic के बने रहने को मानकर चलती है; 1.5 बिलियन डॉलर किस्तों में दिए जाएँगे और वकीलों की फ़ीस भी उसी शेड्यूल पर दी जाएगी
    class-action plaintiffs व्यवहार में Anthropic के creditors बन जाते हैं, इसलिए उन्हें सीधे फ़ायदे के लिए यह ज़रूरी है कि भुगतान अवधि भर कंपनी solvent रहे। सिविल मुकदमों का उद्देश्य क्षतिपूर्ति होता है, और इतना बड़ा फ़ैसला जो भुगतान करने वाले को दिवालिया कर दे, वह निश्चित रूप से लेखकों के लिए और बुरा होता