सभी ISBN का विज़ुअलाइज़ेशन
(annas-archive.org)-
ISBN विज़ुअलाइज़ेशन
- Anna's Archive मानव इतिहास की सबसे बड़ी खुली पुस्तक सूची प्रदान करता है.
- प्रत्येक पिक्सेल 2,500 ISBN को दर्शाता है, और यदि फ़ाइल उपलब्ध है तो पिक्सेल हरे रंग में दिखता है.
- पूरी पुस्तकों में से केवल 16% का ही बैकअप लिया गया है, और अधिक काम की आवश्यकता है.
-
पृष्ठभूमि
- Anna's Archive मानवता के ज्ञान का बैकअप लेने के लिए ISBN नंबरों का उपयोग करके पुस्तक सूची तैयार करता है.
- ISBN 1970 के दशक से अधिकांश देशों में प्रकाशित पुस्तकों को दिए जाते रहे हैं.
- यह बिना किसी केंद्रीय प्राधिकरण के एक वितरित प्रणाली के रूप में संचालित होता है, और नंबर देश, प्रमुख प्रकाशक, फिर छोटे प्रकाशकों के क्रम में आवंटित किए जाते हैं.
- Anna's Archive ISBNdb, Worldcat, Google Books आदि जैसे विभिन्न मेटाडेटा स्रोतों को स्क्रैप करके सबसे बड़ा खुला पुस्तक मेटाडेटा संग्रह रखता है.
- दुर्लभ और जोखिम में पड़ी पुस्तकों की पहचान करना और उन्हें संरक्षित करना महत्वपूर्ण है.
-
विज़ुअलाइज़ेशन
- विभिन्न datasets को अलग-अलग देखा जा सकता है, और dropdown तथा buttons का उपयोग करके उनके बीच स्विच किया जा सकता है.
- datasets में Anna's Archive, Google Books, Goodreads, Internet Archive आदि शामिल हैं.
- विज़ुअलाइज़ेशन में नियमित रेखाओं और ब्लॉक्स, तथा खाली क्षेत्रों जैसे पैटर्न देखे जा सकते हैं.
-
$10,000 इनाम
- विज़ुअलाइज़ेशन को बेहतर बनाने के लिए एक इनाम रखा गया है, और 31 जनवरी 2025 तक open source code जमा करना होगा.
- सर्वश्रेष्ठ submission को $6,000, दूसरे स्थान को $3,000, और तीसरे स्थान को $1,000 मिलेगा, भुगतान Monero(XMR) में किया जाएगा.
- न्यूनतम मानदंड पूरे न होने पर भी कुछ इनाम दिया जा सकता है.
- submissions में HTML को संशोधित करके विज़ुअलाइज़ेशन में सुधार करना होगा, और यह desktop तथा mobile दोनों पर अच्छी तरह काम करना चाहिए.
- अतिरिक्त अंक usability और visual appeal के आधार पर दिए जाएंगे.
-
कोड
- image generation code और examples एक विशेष directory में उपलब्ध हैं.
- ISBN जानकारी देने के लिए 75MB के compressed data format का उपयोग किया जाता है.
- इनाम में भाग लेने के लिए इस format का उपयोग करना आवश्यक नहीं है, लेकिन शुरुआत के लिए यह सबसे सुविधाजनक format है.
- सभी code open source के रूप में उपलब्ध कराए जाने चाहिए.
1 टिप्पणियां
Hacker News की टिप्पणियाँ
नीचे इनाम दिख रहा है, इसलिए मेरी जीत की संभावना तो शायद खत्म ही मानी जाए, लेकिन यह visualization Hilbert curve पर map करने के लिए एकदम उपयुक्त लगती है [0]
अभी जिस तरह डेटा को “धारियों” में बनाया गया है, उसमें sort order में पास-पास के points भी काफ़ी दूर जा सकते हैं। Y-axis पर एक step नीचे जाना डेटा की पूरी एक पंक्ति पार कर जाता है, जबकि X-axis की दूरी original data के साथ 1:1 correspondence रखती है
Hilbert curve पर map करने से X-axis और Y-axis का अपना अर्थ ख़त्म हो जाता है, लेकिन sorted list में पास के points output image में भी visually पास रहेंगे
ISBN में शुरुआत का हिस्सा देश, दूसरा publisher, तीसरा title होता है और अंत में checksum होता है, इसलिए checksum हटाकर और hyphen के बिना हर हिस्से को बड़े numbers की तरह sort करना ठीक लगेगा
तब बड़े publishing countries के हिस्से चौड़े “द्वीपों” जैसे दिखेंगे, और उन द्वीपों के भीतर publisher codes चमकीले points की तरह दिखाई देंगे। अगर इन क्षेत्रों पर labels भी लगा दिए जाएँ, तो वह बोनस points जैसा होगा
मैंने पहले interview के लिए weather data पर यह तरीका लागू करके कुछ बनाया था [1]। उसमें seasonal data साथ-साथ cluster हो गया था, इसलिए seasonality बहुत स्पष्ट दिखती थी
[0] https://en.wikipedia.org/wiki/Hilbert_curve
[1] https://graypegg.com/hilbert (https://github.com/graypegg/hilbertcurveplayground अगर आप इस code का इस्तेमाल करके इनाम के लिए कोशिश करना चाहते हैं, तो संदर्भ के लिए देख सकते हैं। दोबारा इस्तेमाल करें तो कम-से-कम मेरा नाम ज़रूर लें, हालांकि मैं इसे रोक नहीं सकता)
[0] https://github.com/jakubcerveny/gilbert
[1] https://jakubcerveny.github.io/gilbert/demo/
Hilbert curve असल में curve structure का सिर्फ़ एक परिणाम है, लेकिन चिंता यह है कि इसका नतीजा डेटा को साफ़ “वर्गाकार” blocks में बँटा हुआ दिखाता है [0]। उस अर्थ में मौजूदा visualization ज़्यादा उपयोगी लगती है, क्योंकि इसमें हर country की स्थिति तुरंत समझी जा सकती है
[0] https://raw.githubusercontent.com/jakubcerveny/gilbert/maste...
समस्या यह है कि ISBN hierarchical नहीं है। ISBN blocks में खरीदे जाते हैं, या फिर बेहिसाब अतिरिक्त शुल्क देकर individual रूप में भी लिए जा सकते हैं। मैं यह उस अनुभव से कह रहा हूँ कि एक ही किताब को दोबारा प्रकाशित करने के लिए मैंने एक ISBN खरीदा था
इसलिए यह visualization कोई ख़ास रोचक या उपयोगी बात नहीं दिखाती
Library of Congress Classification या Dewey Decimal Classification का उपयोग करने वाली visualization कहीं ज़्यादा उपयोगी होगी, और ख़ास तौर पर अगर वह public domain तथा copyright-free repositories और catalogs से जुड़ती हो तो और भी अच्छा होगा। जैसे John Mark Ockerbloom की सामग्री का एक interactive और visual version
https://onlinebooks.library.upenn.edu/
image 1000×800 pixels की है और प्रति pixel 2500 ISBN हैं, यानी इसमें 2 अरब ISBN visualize किए गए हैं। ISBN-13 में 12 अंक और 1 checksum digit होती है, इसलिए सामान्यतः उम्मीद होगी कि यह मौजूदा image से 500 गुना बड़ी या dense होती
मौजूदा आकार से लगता है कि इसमें सिर्फ़ 978 और 979 prefix वाले ISBN शामिल हैं, और नीचे का आधा हिस्सा ज़्यादा sparse है, इसलिए संभव है कि वह नया 979 range हो
विवरण के अनुसार मुझे लाल और हरे pixels में फ़र्क दिखना चाहिए, लेकिन मुझे लगा कि color blindness की वजह से मैं नहीं देख पा रहा हूँ। मुझे सिर्फ़ लाल और काला दिख रहा है
लेकिन color blindness correction browser extension इस्तेमाल करने पर भी मुझे और रंग अलग नहीं दिखे। समझ नहीं आ रहा कि यह सिर्फ़ मेरे साथ है या graph में ही कोई गड़बड़ी है
नीचे scroll करके interactive visualization tool ढूँढें, और उसे “Files in Anna's Archive [md5]” पर बदलें, तब हरे pixels की जगहें gray में highlight हो जाएँगी
image पर right-click करें, “Inspect” चुनें, फिर element में नया CSS
hue-rotatefilter जोड़ेंelement { max-width: 100%; margin: 0 auto; filter: hue-rotate(-90deg); }आम तौर पर मैं
filter: saturate(100);इस्तेमाल करता हूँ, लेकिन इस image पर वह ठीक काम नहीं कर रहा था। rotation angle को शायद adjust करना पड़े; मेरे लिए -90deg सबसे अच्छा रहाAnna's Archive दुनिया के अजूबों में से एक है। अगर मानवता लगभग ख़ुद को नष्ट भी कर ले, तब भी अगर Anna's Archive बची रहे तो अपेक्षाकृत तेज़ पुनर्निर्माण की उम्मीद हो सकती है
ऐसा लगता है कि server IP को EU में block किया गया है। नीदरलैंड्स के Ziggo internet पर यह संदेश दिखता है
“यह वेबसाइट block कर दी गई है
यूरोपीय प्रतिबंध
Council of the European Union ने तय किया है कि RT (पूर्व में Russia Today) और Sputnik News वेबसाइटों का प्रसारण अब नहीं होना चाहिए। जिस वेबसाइट को आप खोलने की कोशिश कर रहे हैं, वह इन यूरोपीय प्रतिबंधों के दायरे में आती है
VodafoneZiggo इन प्रतिबंधों को लागू करने के लिए बाध्य है, इसलिए इस वेबसाइट को block किया गया है”
https://web.archive.org/web/20250106112552/https://annas-arc...
क्या और किसी को भी यह संदेश दिख रहा है?
“यह server यह साबित नहीं कर सका कि वही annas-archive.org है। इसका security certificate *.hs.llnwd.net के लिए जारी किया गया है। यह configuration error हो सकता है, या कोई attacker आपके connection को intercept कर रहा हो सकता है”
किसी भी साइट पर warning को ignore करके अंदर जाने पर HTTP 400 error मिलता है
Wikipedia के अनुसार www.ukispcourtorders.co.uk पहले blocked domains और उनसे जुड़े court orders की सूची दिखाने वाली साइट थी
https://en.wikipedia.org/wiki/List_of_websites_blocked_in_th...
इस graph में क्या किससे मेल खाता है, यह समझना काफ़ी मुश्किल है। अगर कोई Bookland, यानी 978, कहाँ है यह दिखा दे तो दिशा समझना आसान होगा
वहाँ की ISBN files डाउनलोड करके इस्तेमाल करना क्या illegal है? ऐसी जानकारी अपने पास रखने में समस्या क्या है, समझ नहीं आता
इसमें लिखा है, “हर pixel 2,500 ISBNs को दर्शाता है। अगर उस ISBN की file मौजूद है, तो उस pixel को और हरा बनाया जाता है”, लेकिन और हरा से क्या मतलब है, समझ नहीं आता। मुझे हरे रंग की कोई shading दिख नहीं रही
और क्या काले pixels का मतलब unregistered ISBN है?
यह संदेश आ रहा है
“यूरोपीय प्रतिबंध
Council of the European Union ने तय किया है कि RT (पूर्व में Russia Today) और Sputnik News वेबसाइटों का प्रसारण अब नहीं होना चाहिए। जिस वेबसाइट को आप खोलने की कोशिश कर रहे हैं, वह इन यूरोपीय प्रतिबंधों के दायरे में आती है”
इटली में यह बस NS_ERROR_CONNECTION_REFUSED के साथ fail हो जाती है