2 पॉइंट द्वारा GN⁺ 2025-01-11 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • ISBN विज़ुअलाइज़ेशन

    • Anna's Archive मानव इतिहास की सबसे बड़ी खुली पुस्तक सूची प्रदान करता है.
    • प्रत्येक पिक्सेल 2,500 ISBN को दर्शाता है, और यदि फ़ाइल उपलब्ध है तो पिक्सेल हरे रंग में दिखता है.
    • पूरी पुस्तकों में से केवल 16% का ही बैकअप लिया गया है, और अधिक काम की आवश्यकता है.
  • पृष्ठभूमि

    • Anna's Archive मानवता के ज्ञान का बैकअप लेने के लिए ISBN नंबरों का उपयोग करके पुस्तक सूची तैयार करता है.
    • ISBN 1970 के दशक से अधिकांश देशों में प्रकाशित पुस्तकों को दिए जाते रहे हैं.
    • यह बिना किसी केंद्रीय प्राधिकरण के एक वितरित प्रणाली के रूप में संचालित होता है, और नंबर देश, प्रमुख प्रकाशक, फिर छोटे प्रकाशकों के क्रम में आवंटित किए जाते हैं.
    • Anna's Archive ISBNdb, Worldcat, Google Books आदि जैसे विभिन्न मेटाडेटा स्रोतों को स्क्रैप करके सबसे बड़ा खुला पुस्तक मेटाडेटा संग्रह रखता है.
    • दुर्लभ और जोखिम में पड़ी पुस्तकों की पहचान करना और उन्हें संरक्षित करना महत्वपूर्ण है.
  • विज़ुअलाइज़ेशन

    • विभिन्न datasets को अलग-अलग देखा जा सकता है, और dropdown तथा buttons का उपयोग करके उनके बीच स्विच किया जा सकता है.
    • datasets में Anna's Archive, Google Books, Goodreads, Internet Archive आदि शामिल हैं.
    • विज़ुअलाइज़ेशन में नियमित रेखाओं और ब्लॉक्स, तथा खाली क्षेत्रों जैसे पैटर्न देखे जा सकते हैं.
  • $10,000 इनाम

    • विज़ुअलाइज़ेशन को बेहतर बनाने के लिए एक इनाम रखा गया है, और 31 जनवरी 2025 तक open source code जमा करना होगा.
    • सर्वश्रेष्ठ submission को $6,000, दूसरे स्थान को $3,000, और तीसरे स्थान को $1,000 मिलेगा, भुगतान Monero(XMR) में किया जाएगा.
    • न्यूनतम मानदंड पूरे न होने पर भी कुछ इनाम दिया जा सकता है.
    • submissions में HTML को संशोधित करके विज़ुअलाइज़ेशन में सुधार करना होगा, और यह desktop तथा mobile दोनों पर अच्छी तरह काम करना चाहिए.
    • अतिरिक्त अंक usability और visual appeal के आधार पर दिए जाएंगे.
  • कोड

    • image generation code और examples एक विशेष directory में उपलब्ध हैं.
    • ISBN जानकारी देने के लिए 75MB के compressed data format का उपयोग किया जाता है.
    • इनाम में भाग लेने के लिए इस format का उपयोग करना आवश्यक नहीं है, लेकिन शुरुआत के लिए यह सबसे सुविधाजनक format है.
    • सभी code open source के रूप में उपलब्ध कराए जाने चाहिए.

1 टिप्पणियां

 
GN⁺ 2025-01-11
Hacker News की टिप्पणियाँ
  • नीचे इनाम दिख रहा है, इसलिए मेरी जीत की संभावना तो शायद खत्म ही मानी जाए, लेकिन यह visualization Hilbert curve पर map करने के लिए एकदम उपयुक्त लगती है [0]
    अभी जिस तरह डेटा को “धारियों” में बनाया गया है, उसमें sort order में पास-पास के points भी काफ़ी दूर जा सकते हैं। Y-axis पर एक step नीचे जाना डेटा की पूरी एक पंक्ति पार कर जाता है, जबकि X-axis की दूरी original data के साथ 1:1 correspondence रखती है
    Hilbert curve पर map करने से X-axis और Y-axis का अपना अर्थ ख़त्म हो जाता है, लेकिन sorted list में पास के points output image में भी visually पास रहेंगे
    ISBN में शुरुआत का हिस्सा देश, दूसरा publisher, तीसरा title होता है और अंत में checksum होता है, इसलिए checksum हटाकर और hyphen के बिना हर हिस्से को बड़े numbers की तरह sort करना ठीक लगेगा
    तब बड़े publishing countries के हिस्से चौड़े “द्वीपों” जैसे दिखेंगे, और उन द्वीपों के भीतर publisher codes चमकीले points की तरह दिखाई देंगे। अगर इन क्षेत्रों पर labels भी लगा दिए जाएँ, तो वह बोनस points जैसा होगा
    मैंने पहले interview के लिए weather data पर यह तरीका लागू करके कुछ बनाया था [1]। उसमें seasonal data साथ-साथ cluster हो गया था, इसलिए seasonality बहुत स्पष्ट दिखती थी
    [0] https://en.wikipedia.org/wiki/Hilbert_curve
    [1] https://graypegg.com/hilbert (https://github.com/graypegg/hilbertcurveplayground अगर आप इस code का इस्तेमाल करके इनाम के लिए कोशिश करना चाहते हैं, तो संदर्भ के लिए देख सकते हैं। दोबारा इस्तेमाल करें तो कम-से-कम मेरा नाम ज़रूर लें, हालांकि मैं इसे रोक नहीं सकता)

    • Gilbert curve भी है, जो 2 की power न होने वाले rectangular क्षेत्रों के लिए generalized Hilbert curve है [0], और इसका एक online demo भी है [1]
      [0] https://github.com/jakubcerveny/gilbert
      [1] https://jakubcerveny.github.io/gilbert/demo/
    • मैं जानना चाहता हूँ कि ऐसी कौन-सी property है जो Hilbert curve को, उदाहरण के लिए, snake pattern से बेहतर बनाती है। Snake pattern में भी पास-पास के ISBN visualization में पड़ोसी ही रहते हैं
      Hilbert curve असल में curve structure का सिर्फ़ एक परिणाम है, लेकिन चिंता यह है कि इसका नतीजा डेटा को साफ़ “वर्गाकार” blocks में बँटा हुआ दिखाता है [0]। उस अर्थ में मौजूदा visualization ज़्यादा उपयोगी लगती है, क्योंकि इसमें हर country की स्थिति तुरंत समझी जा सकती है
      [0] https://raw.githubusercontent.com/jakubcerveny/gilbert/maste...
  • समस्या यह है कि ISBN hierarchical नहीं है। ISBN blocks में खरीदे जाते हैं, या फिर बेहिसाब अतिरिक्त शुल्क देकर individual रूप में भी लिए जा सकते हैं। मैं यह उस अनुभव से कह रहा हूँ कि एक ही किताब को दोबारा प्रकाशित करने के लिए मैंने एक ISBN खरीदा था
    इसलिए यह visualization कोई ख़ास रोचक या उपयोगी बात नहीं दिखाती
    Library of Congress Classification या Dewey Decimal Classification का उपयोग करने वाली visualization कहीं ज़्यादा उपयोगी होगी, और ख़ास तौर पर अगर वह public domain तथा copyright-free repositories और catalogs से जुड़ती हो तो और भी अच्छा होगा। जैसे John Mark Ockerbloom की सामग्री का एक interactive और visual version
    https://onlinebooks.library.upenn.edu/

    • ISBN hierarchical है। आपका मतलब क्या है, समझ नहीं आ रहा। Gaul की तरह, ISBN भी कई हिस्सों में बँटा होता है: एक हिस्सा language के लिए, दूसरा publisher के लिए, और आख़िरी title के लिए। अंतिम हिस्सा checksum है https://en.wikipedia.org/wiki/ISBN#Overview
    • यह visualization वही दिखाती है जो यह दिखाना चाहती है। मुख्यतः यह कि उनके पास दुनिया की कुल किताबों में से कितना हिस्सा है। इसका hierarchy से कोई संबंध नहीं है
    • काले pixels की मात्रा देखकर यह भी दिखता है कि ISBN वास्तविक उपयोग की गति से कहीं तेज़ allocate किए जाते हैं
      image 1000×800 pixels की है और प्रति pixel 2500 ISBN हैं, यानी इसमें 2 अरब ISBN visualize किए गए हैं। ISBN-13 में 12 अंक और 1 checksum digit होती है, इसलिए सामान्यतः उम्मीद होगी कि यह मौजूदा image से 500 गुना बड़ी या dense होती
      मौजूदा आकार से लगता है कि इसमें सिर्फ़ 978 और 979 prefix वाले ISBN शामिल हैं, और नीचे का आधा हिस्सा ज़्यादा sparse है, इसलिए संभव है कि वह नया 979 range हो
  • विवरण के अनुसार मुझे लाल और हरे pixels में फ़र्क दिखना चाहिए, लेकिन मुझे लगा कि color blindness की वजह से मैं नहीं देख पा रहा हूँ। मुझे सिर्फ़ लाल और काला दिख रहा है
    लेकिन color blindness correction browser extension इस्तेमाल करने पर भी मुझे और रंग अलग नहीं दिखे। समझ नहीं आ रहा कि यह सिर्फ़ मेरे साथ है या graph में ही कोई गड़बड़ी है

    • जानकारी के लिए, मुझे color blindness नहीं है, और मुझे लाल, हरे और काले pixels दिख रहे हैं। सामान्य नज़र से graph अजीब नहीं लगता
      नीचे scroll करके interactive visualization tool ढूँढें, और उसे “Files in Anna's Archive [md5]” पर बदलें, तब हरे pixels की जगहें gray में highlight हो जाएँगी
    • अगर मेरी तरह आपको red-green color blindness है, तो यह आज़माएँ
      image पर right-click करें, “Inspect” चुनें, फिर element में नया CSS hue-rotate filter जोड़ें
      element { max-width: 100%; margin: 0 auto; filter: hue-rotate(-90deg); }
      आम तौर पर मैं filter: saturate(100); इस्तेमाल करता हूँ, लेकिन इस image पर वह ठीक काम नहीं कर रहा था। rotation angle को शायद adjust करना पड़े; मेरे लिए -90deg सबसे अच्छा रहा
    • graph ख़ुद तो ठीक लग रही है, और सचमुच लाल तथा थोड़ा-सा हरा pixel मौजूद है। अफ़सोस, लगता है समस्या extension की तरफ़ है
    • मुझे भी color blindness है, और यह graph अच्छी नहीं है
    • हरे dots और हरे dots की कुछ lines दिख रही हैं। क्या आपने zoom करके देखा?
  • Anna's Archive दुनिया के अजूबों में से एक है। अगर मानवता लगभग ख़ुद को नष्ट भी कर ले, तब भी अगर Anna's Archive बची रहे तो अपेक्षाकृत तेज़ पुनर्निर्माण की उम्मीद हो सकती है

    • आपने “अपेक्षाकृत तेज़ पुनर्निर्माण” कहा, लेकिन अगर इसके लिए पहले आत्म-विनाश ज़रूरी शर्त है, तो क्या यह सच में अच्छी बात होगी?
  • ऐसा लगता है कि server IP को EU में block किया गया है। नीदरलैंड्स के Ziggo internet पर यह संदेश दिखता है
    “यह वेबसाइट block कर दी गई है
    यूरोपीय प्रतिबंध
    Council of the European Union ने तय किया है कि RT (पूर्व में Russia Today) और Sputnik News वेबसाइटों का प्रसारण अब नहीं होना चाहिए। जिस वेबसाइट को आप खोलने की कोशिश कर रहे हैं, वह इन यूरोपीय प्रतिबंधों के दायरे में आती है
    VodafoneZiggo इन प्रतिबंधों को लागू करने के लिए बाध्य है, इसलिए इस वेबसाइट को block किया गया है”

    • पोलैंड में यह ठीक से खुलती है। इसके बजाय यह लिंक इस्तेमाल किया जा सकता है
      https://web.archive.org/web/20250106112552/https://annas-arc...
    • अपडेट: DNS server settings बदलकर, ताकि पहले से सीधे चल रहा server ISP को forward करने के बजाय root DNS का इस्तेमाल करे, समस्या हल हो गई
    • फ्रांस में कोई समस्या नहीं
    • अगर आप खुद recursive resolver चलाते हैं तो कुछ फायदे होते हैं
    • फ़िनलैंड में कोई समस्या नहीं
  • क्या और किसी को भी यह संदेश दिख रहा है?
    “यह server यह साबित नहीं कर सका कि वही annas-archive.org है। इसका security certificate *.hs.llnwd.net के लिए जारी किया गया है। यह configuration error हो सकता है, या कोई attacker आपके connection को intercept कर रहा हो सकता है”

    • मेरे साथ भी यही है। UK के EE internet पर annas-archive.org के लिए DNS query करने पर www.ukispcourtorders.co.uk address लौटता है, और वहाँ भी security warning दिखती है
      किसी भी साइट पर warning को ignore करके अंदर जाने पर HTTP 400 error मिलता है
      Wikipedia के अनुसार www.ukispcourtorders.co.uk पहले blocked domains और उनसे जुड़े court orders की सूची दिखाने वाली साइट थी
      https://en.wikipedia.org/wiki/List_of_websites_blocked_in_th...
    • नहीं, यह तो ऐसा लग रहा है जैसे उधर से man-in-the-middle attack जैसा कुछ हो रहा हो। हालांकि domain खुद एक सामान्य CDN जैसा दिखता है
    • फ़िनलैंड के ISP DNS पर Google Trust Services द्वारा जारी किया गया सामान्य-सा दिखने वाला certificate मिलता है
    • मेरे साथ भी ऐसा ही है
  • इस graph में क्या किससे मेल खाता है, यह समझना काफ़ी मुश्किल है। अगर कोई Bookland, यानी 978, कहाँ है यह दिखा दे तो दिशा समझना आसान होगा

    • इसे और आसानी से visualise करना ही इस पोस्ट में घोषित bounty का उद्देश्य है
  • वहाँ की ISBN files डाउनलोड करके इस्तेमाल करना क्या illegal है? ऐसी जानकारी अपने पास रखने में समस्या क्या है, समझ नहीं आता

    • अगर यह libgen और sci-hub से link करने वाला पेज है, तो शायद वे copyright को लेकर ज़्यादा चिंतित नहीं होंगे
  • इसमें लिखा है, “हर pixel 2,500 ISBNs को दर्शाता है। अगर उस ISBN की file मौजूद है, तो उस pixel को और हरा बनाया जाता है”, लेकिन और हरा से क्या मतलब है, समझ नहीं आता। मुझे हरे रंग की कोई shading दिख नहीं रही
    और क्या काले pixels का मतलब unregistered ISBN है?

    • color blindness test करवाने की सलाह दूँगा। हरा रंग काफ़ी साफ़ दिखता है, खासकर पूरी image में ऊपर से लगभग 40% नीचे वाले हिस्से में
    • ध्यान से देखने पर सचमुच कुछ भूरेपन वाले pixels और कुछ गहरे हरे pixels दिखते हैं
  • यह संदेश आ रहा है
    “यूरोपीय प्रतिबंध
    Council of the European Union ने तय किया है कि RT (पूर्व में Russia Today) और Sputnik News वेबसाइटों का प्रसारण अब नहीं होना चाहिए। जिस वेबसाइट को आप खोलने की कोशिश कर रहे हैं, वह इन यूरोपीय प्रतिबंधों के दायरे में आती है”

    • इस वेबसाइट पर DNS स्तर पर censorship हो रही है, लेकिन लगता है error page गलत चुन लिया गया है
      इटली में यह बस NS_ERROR_CONNECTION_REFUSED के साथ fail हो जाती है
    • यूरोपीय IP पर भी यहाँ यह ठीक से खुल रही है
    • DNS को 1.1.1.1(Cloudflare) या 8.8.8.8(Google) जैसे किसी पते पर बदल दें