- AI कंपनियाँ बड़ी मात्रा में खरीदी गई दुर्लभ पुस्तकों की रीढ़ काटकर उन्हें हाई-स्पीड स्कैन कर रही हैं और फिर मूल प्रतियों को नष्ट कर रही हैं
- ISBNdb अधिकतम 10 लाख पुस्तकों तक के ऑर्डर, खरीदार की गुमनामी, और NDA का समर्थन करता है, और ग्राहकों को इस प्रक्रिया को ‘डिजिटल संरक्षण’ कहने की सलाह देता है
- 2022 से पहले प्रकाशित किताबों को इस वजह से अधिक मूल्यवान माना जा रहा है कि उनमें AI-जनरेटेड टेक्स्ट मिला हुआ नहीं है, और Anthropic भी बड़े पैमाने पर पुस्तकों की व्यवस्था करने में लगा है
- एक संघीय न्यायाधीश ने मूल प्रति हटाकर एक समय में केवल एक प्रति छोड़ने के तरीके को fair use माना, लेकिन बेहद कम बची प्रतियों वाली किताबें भी इस प्रक्रिया में शामिल हैं
- 18वीं सदी की अब भी मौजूद किसी पुस्तक की आखिरी प्रति नष्ट होने के बाद बदली नहीं जा सकती, इसलिए यह कानूनी फैसला अपरिवर्तनीय क्षति को तेज कर सकता है
दुर्लभ पुस्तकें ट्रेनिंग डेटा में कैसे बदल रही हैं
- AI कंपनियाँ बड़ी मात्रा में किताबें खरीदने के बाद उनकी रीढ़ काटती हैं, हाई-स्पीड स्कैन करती हैं, और मूल प्रतियों को नष्ट कर देती हैं
- ISBNdb अधिकतम 10 लाख पुस्तकों तक के ऑर्डर की मध्यस्थता करते हुए खरीदार की पहचान छिपाता है
- NDA को एक सेवा फीचर के रूप में देता है
- ग्राहकों को इस काम को ‘डिजिटल संरक्षण’ कहने की सलाह देता है
- अपनी वेबसाइट पर कहता है: “‘AI कंपनियाँ 20 लाख किताबें नष्ट कर रही हैं’ जैसी पंक्ति सहानुभूति पाने लायक हेडलाइन नहीं है”
- 2022 से पहले प्रकाशित किताबों को इस आधार पर प्रीमियम डेटा माना जाता है कि उनमें AI-जनरेटेड टेक्स्ट शामिल नहीं है
- Anthropic ने ‘दुनिया की हर किताब’ हासिल करने के लिए Google Books की पूर्व पार्टनरशिप प्रमुख को नियुक्त किया
fair use के फैसले ने जो अपरिवर्तनीयता छोड़ी
- एक संघीय न्यायाधीश ने इस तर्क के आधार पर इस प्रथा को fair use माना कि मूल प्रति हटाने पर किसी एक समय में केवल एक प्रति मौजूद रहती है
- एक बुकस्टोर से जुड़े व्यक्ति ने 404 Media को बताया कि बहुत कम बची प्रतियों वाली दुर्लभ किताबें भी इस प्रक्रिया में डाली जा रही हैं
- वेबसाइट फिर से अपलोड की जा सकती हैं और बेस्टसेलर दोबारा छापे जा सकते हैं, लेकिन केवल आखिरी तीन प्रतियाँ बची 18वीं सदी की वनस्पति-विज्ञान की पुस्तक नष्ट होने के बाद बदली नहीं जा सकती
- इंटरनेट scraping, लाइब्रेरी torrent, और संगीत की अनधिकृत कॉपी से अलग, मूल प्रति को नष्ट करना वापस नहीं पलटा जा सकता, और कानूनी फैसले के बाद ऐसे कारोबार और तेज हो सकते हैं
1 टिप्पणियां
Hacker News की राय
प्रकाशकों से मुझे ज़्यादा हमदर्दी नहीं है। वे किताबों को कॉपीराइट खत्म होने तक आउट-ऑफ-प्रिंट रखकर अच्छी-भली किताबों को दुर्लभ बना देते हैं, और जो किताबें बिक रही होती हैं उनमें भी अक्सर नमी से मुड़ने वाला कागज़ और कुछ ही सालों में पन्नों में बिखर जाने वाली perfect binding ही होती है
जिन किताबों को प्रकाशक आउट-ऑफ-प्रिंट कर दे, उन्हें दूसरे प्रकाशक को मूल प्रकाशक को मुआवज़ा दिए बिना प्रकाशित करने की अनुमति होनी चाहिए, जबकि लेखक के साथ royalty दोबारा negotiate की जा सके। अगर कोई प्रकाशक टिकाऊ कागज़ और sewn signatures वाली hardcover edition नहीं निकालता, तब भी दूसरे प्रकाशकों को premium edition बनाने देने के लिए कॉपीराइट कानून बदलना चाहिए
छोटे streamers के पास कानूनी लड़ाई लड़ने की क्षमता भी नहीं होती। वह channel यह है: https://www.youtube.com/@diggingthegreats/videos
उस समय किताबें ऐसी luxury थीं जिन्हें ज़्यादातर लोग खरीद नहीं सकते थे, और सस्ती mass-produced binding आने से accessibility बढ़ी। आज भी एक artisan market मौजूद है जो बाज़ार में बिकने वाली किताबों को खोलकर high-quality custom binding और covers बनाता है
यह मानने के बजाय कि प्रकाशक जानबूझकर छिपी premium edition demand को नज़रअंदाज़ कर रहे हैं, सरल बात यह है कि वे sales data से जानते हैं कि यह नहीं बिकेगी। अगर लक्ष्य preservation है, तो थोड़ा बेहतर कागज़ अनिवार्य करने के बजाय inventory warehouses या collectors की shelves नहीं, बल्कि मजबूत digital archive बनाना चाहिए
कॉपीराइट की जांच करने के बाद पुरानी किताबें फिर से प्रकाशित कर रहे हैं। सभी किताबें 1930 से पहले छपी editions पर आधारित हैं, और rights holder ने renewal किया या नहीं, इस पर निर्भर करते हुए बड़ी संख्या में 1964 या 1973 तक की किताबें भी संभव हैं
एक special paper cutter से spine काटने के बाद पन्नों को sealed plastic sleeves में रखकर permanent storage में रखा जाता है, और rescan की संभावना के लिए original uncompressed files भी magnetic disks पर सुरक्षित रखी जाती हैं। कॉपीराइट खत्म होते ही प्रकाशित कर सकें, इसके लिए 1931 के बाद की दुर्लभ editions भी पहले से खोजी जाती हैं, लेकिन किसी AI company ने कभी full scans से training की अनुमति नहीं मांगी
पुराने ग्रंथ अपने-आप में रोचक हैं और preservation लायक हैं, लेकिन विशाल training datasets में मिलाने के उपयोग के लिए कम उपयोगी हैं
अगर scan की जा रही चीज़ें सिर्फ ऐसी किताबें हैं जिन पर कॉपीराइट बचा है, तो 18वीं सदी की botany books क्यों शामिल हैं, यह समझ नहीं आता। अपनी किताबों को scan करना कॉपीराइट के हिसाब से legal होना चाहिए, और इसके लिए destruction की मांग नहीं होनी चाहिए
50 साल से ज़्यादा पहले प्रकाशित और भूल जाने के जोखिम वाली works पर orphan works rules लागू किए जा सकते हैं, ताकि rights holder यह साबित करे कि वे कई libraries आदि में preserved हैं, या अतिरिक्त copying की अनुमति दे, या कॉपीराइट छोड़ दे
OpenAI Amazon से 2018 की किताब का digital edition खरीदकर सीधे इस्तेमाल क्यों नहीं कर सकता—इसकी वजह license violation के अलावा DRM हटाने पर रोक लगाने वाला DMCA भी है
अगर Archive.org पर उसके पास मौजूद physical books को lend करने के कारण मुकदमा न हुआ होता, तो यह नतीजा भी टल सकता था। प्रकाशकों को अपनी चाही हुई outcome पर और सावधानी से सोचना चाहिए था
प्रकाशकों ने shadow libraries के data से training करने वाली AI companies पर lawsuit कर बड़े content deals पाने की कोशिश की, लेकिन AI companies ने analog loophole का इस्तेमाल किया। used book $5 में खरीदकर destructive scanning पर $25 खर्च करना copyright fees से कहीं सस्ता है
हालांकि target ancient texts नहीं, बल्कि अभी कॉपीराइट वाली किताबें हैं; और पुराना होना अपने-आप valuable होना नहीं है। demand नहीं होती और storage cost लगती है, इसलिए libraries किताबें discard करती हैं, और scanning companies उन्हें सस्ते में हासिल कर सकती हैं
Bradbury की 《Fahrenheit 451》 से ज़्यादा यह Vernor Vinge की 《Rainbows End》 में दिखने वाली ‘कतरने के बाद स्कैन’ फैक्टरी जैसी लगती है
दुर्लभ प्रतियों को digitize करते हुए Authors Guild v. Google से हुए नुकसान को भी पलटा जा सकता है। AI कंपनियों को स्कैन की अनुमति दी जाए, लेकिन डिजिटल कॉपी सार्वजनिक करना अनिवार्य हो, और पहले स्कैन करने वाली कंपनी के लाभ के लिए कुछ वर्षों की मोहलत दी जा सकती है: https://en.wikipedia.org/wiki/Authors_Guild,_Inc._v._Google,...
इसके उलट, उसे उच्च गुणवत्ता में digitize कर स्थायी रूप से मुफ्त सार्वजनिक करना, लाइब्रेरी और ऑनलाइन में मुफ्त इस्तेमाल हो सकने वाले सार्वजनिक LLM के जरिए उपलब्ध कराना, और अगर कोई भौतिक प्रति नहीं बची हो तो पर्याप्त सत्यापन के बाद उसे सार्वजनिक rare-book archive में संरक्षित करने जैसा नियमन कहीं अधिक तर्कसंगत होगा
मूर्खतापूर्ण copyright law की वजह से अगर AI कंपनियों के पास कानूनी तौर पर यही तरीका बचता है, तो पूरा दोष उन पर डालना मुश्किल है। आप स्थानीय shadow library को समर्थन दे सकते हैं: https://annas-archive.pk/donate
सिर्फ उद्धृत सामग्री को देखें तो दुर्लभ प्रतियां वास्तव में नष्ट की जा रही हैं, इसका सबूत कम है। बदली न जा सकने वाली 18वीं सदी की वनस्पति-विज्ञान किताब का उदाहरण जोड़ा गया है, लेकिन यह संभावना खारिज नहीं होती कि असल लक्ष्य बिक्री में उपलब्ध या आम किताबें हों
यहां दुर्लभ प्रतियां ऐतिहासिक रूप से महत्वपूर्ण मध्ययुगीन पांडुलिपियां नहीं, बल्कि तुलनात्मक रूप से हाल की ऐसी किताबें लगती हैं जिनका copyright अभी बाकी है, लेकिन बिक्री में उपलब्ध भौतिक प्रतियां कम हैं। ऐसी किसी किताब की एक प्रति नष्ट करके सामग्री को डिजिटल रूप से संरक्षित करना जरूरी नहीं कि बुरा ही हो, और copyright वाली किताबों का मूल्य आम तौर पर भौतिक माध्यम से ज्यादा उनकी सामग्री में होता है