1 पॉइंट द्वारा GN⁺ 3 시간 전 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • AI कंपनियाँ बड़ी मात्रा में खरीदी गई दुर्लभ पुस्तकों की रीढ़ काटकर उन्हें हाई-स्पीड स्कैन कर रही हैं और फिर मूल प्रतियों को नष्ट कर रही हैं
  • ISBNdb अधिकतम 10 लाख पुस्तकों तक के ऑर्डर, खरीदार की गुमनामी, और NDA का समर्थन करता है, और ग्राहकों को इस प्रक्रिया को ‘डिजिटल संरक्षण’ कहने की सलाह देता है
  • 2022 से पहले प्रकाशित किताबों को इस वजह से अधिक मूल्यवान माना जा रहा है कि उनमें AI-जनरेटेड टेक्स्ट मिला हुआ नहीं है, और Anthropic भी बड़े पैमाने पर पुस्तकों की व्यवस्था करने में लगा है
  • एक संघीय न्यायाधीश ने मूल प्रति हटाकर एक समय में केवल एक प्रति छोड़ने के तरीके को fair use माना, लेकिन बेहद कम बची प्रतियों वाली किताबें भी इस प्रक्रिया में शामिल हैं
  • 18वीं सदी की अब भी मौजूद किसी पुस्तक की आखिरी प्रति नष्ट होने के बाद बदली नहीं जा सकती, इसलिए यह कानूनी फैसला अपरिवर्तनीय क्षति को तेज कर सकता है

दुर्लभ पुस्तकें ट्रेनिंग डेटा में कैसे बदल रही हैं

  • AI कंपनियाँ बड़ी मात्रा में किताबें खरीदने के बाद उनकी रीढ़ काटती हैं, हाई-स्पीड स्कैन करती हैं, और मूल प्रतियों को नष्ट कर देती हैं
  • ISBNdb अधिकतम 10 लाख पुस्तकों तक के ऑर्डर की मध्यस्थता करते हुए खरीदार की पहचान छिपाता है
    • NDA को एक सेवा फीचर के रूप में देता है
    • ग्राहकों को इस काम को ‘डिजिटल संरक्षण’ कहने की सलाह देता है
    • अपनी वेबसाइट पर कहता है: “‘AI कंपनियाँ 20 लाख किताबें नष्ट कर रही हैं’ जैसी पंक्ति सहानुभूति पाने लायक हेडलाइन नहीं है”
  • 2022 से पहले प्रकाशित किताबों को इस आधार पर प्रीमियम डेटा माना जाता है कि उनमें AI-जनरेटेड टेक्स्ट शामिल नहीं है
  • Anthropic ने ‘दुनिया की हर किताब’ हासिल करने के लिए Google Books की पूर्व पार्टनरशिप प्रमुख को नियुक्त किया

fair use के फैसले ने जो अपरिवर्तनीयता छोड़ी

  • एक संघीय न्यायाधीश ने इस तर्क के आधार पर इस प्रथा को fair use माना कि मूल प्रति हटाने पर किसी एक समय में केवल एक प्रति मौजूद रहती है
  • एक बुकस्टोर से जुड़े व्यक्ति ने 404 Media को बताया कि बहुत कम बची प्रतियों वाली दुर्लभ किताबें भी इस प्रक्रिया में डाली जा रही हैं
  • वेबसाइट फिर से अपलोड की जा सकती हैं और बेस्टसेलर दोबारा छापे जा सकते हैं, लेकिन केवल आखिरी तीन प्रतियाँ बची 18वीं सदी की वनस्पति-विज्ञान की पुस्तक नष्ट होने के बाद बदली नहीं जा सकती
  • इंटरनेट scraping, लाइब्रेरी torrent, और संगीत की अनधिकृत कॉपी से अलग, मूल प्रति को नष्ट करना वापस नहीं पलटा जा सकता, और कानूनी फैसले के बाद ऐसे कारोबार और तेज हो सकते हैं

1 टिप्पणियां

 
GN⁺ 3 시간 전
Hacker News की राय
  • प्रकाशकों से मुझे ज़्यादा हमदर्दी नहीं है। वे किताबों को कॉपीराइट खत्म होने तक आउट-ऑफ-प्रिंट रखकर अच्छी-भली किताबों को दुर्लभ बना देते हैं, और जो किताबें बिक रही होती हैं उनमें भी अक्सर नमी से मुड़ने वाला कागज़ और कुछ ही सालों में पन्नों में बिखर जाने वाली perfect binding ही होती है
    जिन किताबों को प्रकाशक आउट-ऑफ-प्रिंट कर दे, उन्हें दूसरे प्रकाशक को मूल प्रकाशक को मुआवज़ा दिए बिना प्रकाशित करने की अनुमति होनी चाहिए, जबकि लेखक के साथ royalty दोबारा negotiate की जा सके। अगर कोई प्रकाशक टिकाऊ कागज़ और sewn signatures वाली hardcover edition नहीं निकालता, तब भी दूसरे प्रकाशकों को premium edition बनाने देने के लिए कॉपीराइट कानून बदलना चाहिए

    • मेरे हिसाब से कॉपीराइट लेखक या उसके जीवनसाथी की मृत्यु के साथ खत्म हो जाना चाहिए। जब record labels साफ़ तौर पर fair use में आने वाले कुछ सेकंड के music analysis videos तक monetize कर लेते हैं और बहुत समय व पैसा लगाने वाले छोटे channels की कमाई ले लेते हैं, तो यह अनुचित है
      छोटे streamers के पास कानूनी लड़ाई लड़ने की क्षमता भी नहीं होती। वह channel यह है: https://www.youtube.com/@diggingthegreats/videos
    • 17वीं–18वीं सदी में आम था कि प्रकाशक किताबों को bind नहीं करते थे और खरीदार independent bookbinder से custom order कराते थे; कभी-कभी पूरी निजी library मालिक की एक जैसी cover style का पालन करती थी
      उस समय किताबें ऐसी luxury थीं जिन्हें ज़्यादातर लोग खरीद नहीं सकते थे, और सस्ती mass-produced binding आने से accessibility बढ़ी। आज भी एक artisan market मौजूद है जो बाज़ार में बिकने वाली किताबों को खोलकर high-quality custom binding और covers बनाता है
    • जो 17वीं–18वीं सदी की किताबें आज तक बची दिखती हैं, हो सकता है वे इसलिए बचीं क्योंकि वे शुरुआत से ही अच्छी तरह बनाई गई थीं। खराब बनी किताबें पहले ही गायब हो चुकी हैं और दिखती नहीं हैं—यह survivorship bias है
    • अगर प्रकाशक सभी किताबों को premium binding में बनाकर warehouse में ढेर लगाते रहें, जबकि consumers सिर्फ सस्ते paperbacks खरीदें, तो प्रकाशक के पास अतिरिक्त लागत उठाने की वजह नहीं है; यह market demand पर प्रतिक्रिया है
      यह मानने के बजाय कि प्रकाशक जानबूझकर छिपी premium edition demand को नज़रअंदाज़ कर रहे हैं, सरल बात यह है कि वे sales data से जानते हैं कि यह नहीं बिकेगी। अगर लक्ष्य preservation है, तो थोड़ा बेहतर कागज़ अनिवार्य करने के बजाय inventory warehouses या collectors की shelves नहीं, बल्कि मजबूत digital archive बनाना चाहिए
    • intellectual property चुराने वाले LLM operators से तो प्रकाशकों से भी कम हमदर्दी है
  • कॉपीराइट की जांच करने के बाद पुरानी किताबें फिर से प्रकाशित कर रहे हैं। सभी किताबें 1930 से पहले छपी editions पर आधारित हैं, और rights holder ने renewal किया या नहीं, इस पर निर्भर करते हुए बड़ी संख्या में 1964 या 1973 तक की किताबें भी संभव हैं
    एक special paper cutter से spine काटने के बाद पन्नों को sealed plastic sleeves में रखकर permanent storage में रखा जाता है, और rescan की संभावना के लिए original uncompressed files भी magnetic disks पर सुरक्षित रखी जाती हैं। कॉपीराइट खत्म होते ही प्रकाशित कर सकें, इसके लिए 1931 के बाद की दुर्लभ editions भी पहले से खोजी जाती हैं, लेकिन किसी AI company ने कभी full scans से training की अनुमति नहीं मांगी

    • यहां ‘हम’ कौन हैं, और sealed plastic long-term preservation के लिए उपयुक्त है या नहीं, यह जानना चाहूंगा। chemical degradation से humidity या corrosive vapors अंदर जमा हो सकते हैं, इसलिए यह जांचना ज़रूरी है कि actively temperature/humidity controlled environment बेहतर नहीं होगा क्या
    • बहुत पुरानी किताबें पुराने style की भाषा की तरफ bias पैदा कर सकती हैं, और valuable knowledge भी अक्सर modern literature में ज़्यादा गहराई और detail से मिलता है, इसलिए AI training data के तौर पर उनकी value कम होती है
      पुराने ग्रंथ अपने-आप में रोचक हैं और preservation लायक हैं, लेकिन विशाल training datasets में मिलाने के उपयोग के लिए कम उपयोगी हैं
    • यह जानने के लिए कि यह 2 लोगों की nonprofit है या $1 trillion valuation वाली pre-IPO company, sources और background चाहिए
    • spine काट देने पर क्या बस source से कटे हुए ‘Dead Sea Scrolls’ जैसे अलग-अलग पन्ने ही नहीं बच जाते, यह सवाल है
  • अगर scan की जा रही चीज़ें सिर्फ ऐसी किताबें हैं जिन पर कॉपीराइट बचा है, तो 18वीं सदी की botany books क्यों शामिल हैं, यह समझ नहीं आता। अपनी किताबों को scan करना कॉपीराइट के हिसाब से legal होना चाहिए, और इसके लिए destruction की मांग नहीं होनी चाहिए
    50 साल से ज़्यादा पहले प्रकाशित और भूल जाने के जोखिम वाली works पर orphan works rules लागू किए जा सकते हैं, ताकि rights holder यह साबित करे कि वे कई libraries आदि में preserved हैं, या अतिरिक्त copying की अनुमति दे, या कॉपीराइट छोड़ दे

    • किताबों को अलग-अलग पन्नों में खोलकर scan करना तेज़ और सस्ता होता है, और AI training volume का खेल है, इसलिए यह तरीका फायदेमंद है। scan के बाद बेकार हुए पन्ने pulp बनाकर recycle कर दिए जाते हैं, इसलिए कॉपीराइट न भी हो तो destructive scanning मुख्यधारा बन गई होती
      OpenAI Amazon से 2018 की किताब का digital edition खरीदकर सीधे इस्तेमाल क्यों नहीं कर सकता—इसकी वजह license violation के अलावा DRM हटाने पर रोक लगाने वाला DMCA भी है
    • 18वीं सदी की किताबों का कॉपीराइट खत्म हो चुका है, इसलिए original को preserve करते हुए scan करना illegal नहीं है
    • अपूरणीय किताबों को नष्ट करने की वजह कॉपीराइट नहीं, बल्कि destructive scanning की cost saving है: https://www.404media.co/ai-companies-are-buying-tons-of-old-...
    • जिन दुर्लभ प्राचीन किताबों की बची copies single digits में हैं, उन्हें museum collections की तरह cultural heritage protection मिलनी चाहिए। अगर owner उन्हें नुकसान पहुंचाना या discard करना चाहे, तो state को पहले खरीदने का अधिकार होना चाहिए
    • shredded किताब का एक फायदा यह भी है कि competitor उसे फिर से scan नहीं कर सकता
  • अगर Archive.org पर उसके पास मौजूद physical books को lend करने के कारण मुकदमा न हुआ होता, तो यह नतीजा भी टल सकता था। प्रकाशकों को अपनी चाही हुई outcome पर और सावधानी से सोचना चाहिए था

    • Archive.org मूल रूप से वे किताबें lend करता था जिन्हें उसने physical रूप में रखा और scan किया था, DRM और एक copy पर एक समय में एक borrower की limit के साथ; लेकिन COVID के दौरान उसने limit हटाकर unlimited simultaneous lending की अनुमति दी, जिससे प्रकाशकों के साथ विवाद शुरू हुआ
    • जब किसी किताब की एक copy नष्ट होती है, तो बाकी copies और unpublished inventory की value बढ़ जाती है, इसलिए यह मानना मुश्किल है कि प्रकाशकों को यह ज़रूर नापसंद होगा
    • Archive.org के लापरवाह approach ने उल्टा legitimate preservation work की position तक कमजोर कर दी, ऐसा कहा जा सकता है
  • प्रकाशकों ने shadow libraries के data से training करने वाली AI companies पर lawsuit कर बड़े content deals पाने की कोशिश की, लेकिन AI companies ने analog loophole का इस्तेमाल किया। used book $5 में खरीदकर destructive scanning पर $25 खर्च करना copyright fees से कहीं सस्ता है
    हालांकि target ancient texts नहीं, बल्कि अभी कॉपीराइट वाली किताबें हैं; और पुराना होना अपने-आप valuable होना नहीं है। demand नहीं होती और storage cost लगती है, इसलिए libraries किताबें discard करती हैं, और scanning companies उन्हें सस्ते में हासिल कर सकती हैं

    • AI company के लिए ये किताबें valuable हैं, इसलिए fair compensation देना चाहिए
    • modern literature भी समय के साथ ancient literature बन जाता है, इसलिए सिर्फ मौजूदा physical value के आधार पर फैसला नहीं किया जा सकता
    • equipment wear, jammed paper निकालने की labor cost, और recycling cost शामिल करने पर भी destructive scanning की cost प्रति किताब $25 से ज़्यादा $0.25 के करीब हो सकती है
    • कई buyers की information बदलकर और original materials नष्ट कर देने से गलत content LLM में रह जाता है, इसलिए इसे justify करना propaganda जैसा है
  • Bradbury की 《Fahrenheit 451》 से ज़्यादा यह Vernor Vinge की 《Rainbows End》 में दिखने वाली ‘कतरने के बाद स्कैन’ फैक्टरी जैसी लगती है

    • Vernor Vinge ने निकट भविष्य का अनुमान खास तौर पर अच्छी तरह लगाया था, और कतरकर स्कैन करने को उन्होंने एक ऐसी पद्धति के रूप में दिखाया था जिसे खलनायक non-destructive scanning पर जाने से पहले थोड़े समय के लिए इस्तेमाल करते हैं। लंबे समय में मानवता के लिए किए जा सकने वाले सबसे अच्छे कामों में से एक Anna’s Archive को समर्थन देना है, ऐसा मुझे लगता है
    • आम जनता जो अर्थ अक्सर लगाती है उससे यह अलग है, लेकिन 《Fahrenheit 451》 के लेखक की मंशा के भी काफी करीब है
  • दुर्लभ प्रतियों को digitize करते हुए Authors Guild v. Google से हुए नुकसान को भी पलटा जा सकता है। AI कंपनियों को स्कैन की अनुमति दी जाए, लेकिन डिजिटल कॉपी सार्वजनिक करना अनिवार्य हो, और पहले स्कैन करने वाली कंपनी के लाभ के लिए कुछ वर्षों की मोहलत दी जा सकती है: https://en.wikipedia.org/wiki/Authors_Guild,_Inc._v._Google,...

    • 1850 की किसी किताब की इकलौती प्रति को नष्ट कर उसकी सामग्री को एक मुनाफे वाले सिस्टम में बंद कर देना, सार्वजनिक जमीन से बिना अनुमति संसाधन निकालने जैसा सार्वजनिक संसाधन का दोहन है
      इसके उलट, उसे उच्च गुणवत्ता में digitize कर स्थायी रूप से मुफ्त सार्वजनिक करना, लाइब्रेरी और ऑनलाइन में मुफ्त इस्तेमाल हो सकने वाले सार्वजनिक LLM के जरिए उपलब्ध कराना, और अगर कोई भौतिक प्रति नहीं बची हो तो पर्याप्त सत्यापन के बाद उसे सार्वजनिक rare-book archive में संरक्षित करने जैसा नियमन कहीं अधिक तर्कसंगत होगा
  • मूर्खतापूर्ण copyright law की वजह से अगर AI कंपनियों के पास कानूनी तौर पर यही तरीका बचता है, तो पूरा दोष उन पर डालना मुश्किल है। आप स्थानीय shadow library को समर्थन दे सकते हैं: https://annas-archive.pk/donate

  • सिर्फ उद्धृत सामग्री को देखें तो दुर्लभ प्रतियां वास्तव में नष्ट की जा रही हैं, इसका सबूत कम है। बदली न जा सकने वाली 18वीं सदी की वनस्पति-विज्ञान किताब का उदाहरण जोड़ा गया है, लेकिन यह संभावना खारिज नहीं होती कि असल लक्ष्य बिक्री में उपलब्ध या आम किताबें हों

    • 18वीं सदी की सभी किताबों का copyright समाप्त हो चुका है, इसलिए उन्हें कतरने की कोई खास वजह नहीं है
  • यहां दुर्लभ प्रतियां ऐतिहासिक रूप से महत्वपूर्ण मध्ययुगीन पांडुलिपियां नहीं, बल्कि तुलनात्मक रूप से हाल की ऐसी किताबें लगती हैं जिनका copyright अभी बाकी है, लेकिन बिक्री में उपलब्ध भौतिक प्रतियां कम हैं। ऐसी किसी किताब की एक प्रति नष्ट करके सामग्री को डिजिटल रूप से संरक्षित करना जरूरी नहीं कि बुरा ही हो, और copyright वाली किताबों का मूल्य आम तौर पर भौतिक माध्यम से ज्यादा उनकी सामग्री में होता है

    • ऐतिहासिक रूप से महत्वपूर्ण मध्ययुगीन पांडुलिपियां भी धीरे-धीरे ऑनलाइन सार्वजनिक हो रही हैं, और शोधकर्ता जब मूल स्रोत के scan तक सीधे पहुंच पाते हैं तो ऐतिहासिक शोध तेज होता है। बेशक इस मामले में तरीका non-destructive होता है
    • लेखक के हस्ताक्षर या gold leaf वाली खास collector edition जैसी किताबें भी होती हैं जिनमें भौतिक माध्यम खुद मूल्यवान होता है, लेकिन AI कंपनियों द्वारा ऐसे editions इस्तेमाल करने की संभावना कम है
    • जिन किताबों की बची हुई प्रतियां single digits में हों, उनके लिए भी अगर उच्च गुणवत्ता वाला डिजिटल scan सार्वजनिक करने की शर्त हो तो destructive scanning पर सहमति दी जा सकती है
    • मुख्य सवाल यह है कि डिजिटल रूप में संरक्षण किसके लिए किया जा रहा है
    • कहीं किसी Markov chain के weights को थोड़ा बदलने के काम को सचमुच सामग्री संरक्षण कहा जा सकता है या नहीं, इस पर संदेह है