1 पॉइंट द्वारा GN⁺ 2026-04-23 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • 1910–1911 Encyclopædia Britannica 11वाँ संस्करण का डिजिटल संस्करण, जिसमें फुल-टेक्स्ट सर्च, cross-reference और annotation सुविधाएँ उपलब्ध हैं
  • शीर्ष नेविगेशन में Articles, Contributors, Topics, Ancillary जैसी श्रेणियाँ दी गई हैं
  • शीर्षक में Encyclopædia Britannica और Eleventh Edition · 1910–1911 स्पष्ट रूप से दर्शाया गया है
  • परिचय पंक्ति में Fully searchable, cross-referenced, and annotated सीधे लिखा गया है
  • अतिरिक्त मुख्य-विवरण, उदाहरण, या विस्तृत फीचर परिचय प्रस्तुत नहीं किया गया है

अवलोकन

  • 1910–1911 Encyclopædia Britannica 11वाँ संस्करण का डिजिटल संस्करण, जिसमें फुल-टेक्स्ट सर्च, cross-reference और annotation सुविधाएँ उपलब्ध हैं
  • शीर्ष नेविगेशन में Articles, Contributors, Topics, Ancillary जैसी श्रेणियाँ दी गई हैं
  • शीर्षक में Encyclopædia Britannica, Eleventh Edition · 1910–1911 स्पष्ट रूप से दर्शाया गया है
  • परिचय वाक्य के रूप में Fully searchable, cross-referenced, and annotated सीधे लिखा गया है
  • अतिरिक्त मुख्य-विवरण, उदाहरण, या विस्तृत फीचर विवरण उपलब्ध नहीं है

प्रदान की गई जानकारी

  • डिजिटल संस्करण की मुख्य विशेषताओं के रूप में searchability, cross-reference, और annotation को सीधे पुष्टि किया जा सकता है
  • लेख के मुख्य भाग से संबंधित विस्तृत विवरण या प्रत्येक आइटम का अलग परिचय शामिल नहीं है
  • लेखक जानकारी, प्रकाशन जानकारी, और संदर्भ जानकारी से संबंधित metadata इस सारांश के दायरे से बाहर है

1 टिप्पणियां

 
GN⁺ 2026-04-23
Hacker News टिप्पणियाँ
  • मैंने 1911 Encyclopædia Britannica को साफ-सुथरी, संरचित और browse करने लायक साइट के रूप में फिर से बनाया है। इसे https://britannica11.org/ पर देखा जा सकता है
    लगभग 37,000 लेखों को मूल volumes के आधार पर पुनर्स्थापित किया है, और section-स्तर की contents सूची पर क्लिक, cross-reference links, contributor search, मूल volume और page संकेत, हर page के मूल scan से लिंक, appendix जैसी सामग्री, subject index, metadata सहित full-text search तक जोड़ा है
    मुख्य काम title structure, कई pages में फैले लेख, tables, formulas, बहुभाषी सामग्री, footnotes और plates जैसी चीज़ों के लिए restoration pipeline संभालना था
    लक्ष्य यह था कि मूल एहसास बना रहे, लेकिन साथ ही यह वास्तव में काम की चीज़ भी बने
    खास तौर पर search quality, sections के बीच navigation, cross-references, और जहाँ structure अटपटा लगता हो वहाँ feedback चाहूँगा
    pipeline या data model पर सवाल भी स्वागत योग्य हैं

    • appendix सामग्री के साथ अच्छी तरह मेल खाने वाली चीज़ के रूप में The Reader's Guide to the Encyclopaedia Britannica जोड़ना अच्छा रहेगा। Public domain text https://www.gutenberg.org/ebooks/74039 पर है, और scans https://archive.org/details/readersguidetoen00londuoft पर देखे जा सकते हैं
    • यह सच में बहुत बढ़िया बना है। एक feature सुझाव के रूप में, अगर pipeline में EPUB generation भी support हो तो अच्छा होगा। साइट कभी बंद भी हो जाए तो offline search और reading संभव रहेगी, और EPUB compression की वजह से पूरी encyclopedia की file size शायद उतनी बड़ी भी न हो
    • contents सूची में escaping issue दिख रहा है। उदाहरण के लिए United States लेख में Roosevelt's का rendering टूटा हुआ लग रहा है। https://britannica11.org/article/27-0635-united-states-the/united_states__the
    • यह इतना अच्छा था कि मैं सचमुच कुछ topics में काफी देर तक घूमता रहा
      लेकिन article के अंदर जाने के बाद जब किसी दूसरे topic पर जाना चाहा, तो ऊपर का search box "Search titles and full text..." काम नहीं कर रहा था
      और पहली बार आने पर थोड़ा समझ नहीं आया कि शुरुआत कहाँ से करूँ; "Articles" या "Topics" दबाने पर browsing शुरू होगी, यह बात तुरंत स्पष्ट नहीं हुई। शायद मुझे लगा था कि main image ही entry point का काम करेगी
    • अगर एक लेख के भीतर उल्लेखित विषयों को दूसरे लेखों से जोड़ने वाले Wikipedia-style internal links हों तो और भी अच्छा लगेगा
  • यह project सच में कमाल का है। मैं भी लंबे समय से छोटे scope में कुछ ऐसा करने के बारे में सोचता रहा हूँ
    1911 Britannica के खास तौर पर प्रसिद्ध होने की कई वजहें हैं, लेकिन सबसे ज़्यादा जानी-पहचानी बात शायद यह है कि यह प्रथम विश्व युद्ध से पहले की आख़िरी encyclopedia है
    इसलिए इसमें पहली और दूसरी industrial revolution और Progressive Era की भाप जैसी आशावादिता बची हुई है, और अभी "the war to end all wars" के झटके का रंग नहीं चढ़ा
    मैंने सीधे https://britannica11.org पर random तौर पर Portuguese East Africa खोजकर देखा, वह तुरंत मिल गया और अच्छी तरह दिखा; नतीजा https://britannica11.org/article/22-0177-portuguese-east-africa/portuguese_east_africa था
    एक विनम्र request के तौर पर, अगर text और मूल page image को साथ-साथ दिखाने वाला side-by-side view option हो तो बहुत अच्छा रहेगा
    तब OCR fidelity को सीधे जाँचा जा सकेगा और सुंदर printing भी साथ देखी जा सकेगी, और हर page के लिए नया window खोलने की ज़रूरत नहीं पड़ेगी
    व्यक्तिगत रूप से मैं इस साइट को document entry point की तरह इस्तेमाल करना चाहूँगा, फिर reading image-centric तरीके से करूँ और verify या copy करने के लिए text पर switch करूँ
    अभी भी मुझे पता था कि मूल images मौजूद हैं, लेकिन side links खोजने में मुझे तीन visits लग गए, इतना वह नज़र नहीं आया। Selectable thumbnails जैसा कोई बीच का विकल्प भी ठीक लग सकता है
    सबसे बढ़कर, यह तेज़ भी है

  • "Adolescence" लेख जैसी चीज़ें देखने पर आज के समय में काफी चौंकाने वाले विश्वास मिलते हैं
    उदाहरण के लिए, इसमें यह लिखा है कि puberty के आसपास लड़कियों पर exercise और intellectual education का बोझ कम कर देना चाहिए और उन्हें आराम के लिए मजबूर करना चाहिए

    • सही कहा। 1911 edition मुझे दिलचस्प लगने की एक वजह यह भी है। लेखक अपनी राय को अधिक सीधे ढंग से व्यक्त कर सकते थे, और वह राय अपने समय की सामान्य धारणाओं को स्वाभाविक रूप से दिखाती है
    • मुझे लगता है ऐसी बातें लिखित रूप में साफ़-साफ़ सामने आने पर ही ज़्यादा चौंकाती हैं
      व्यवहार में बहुत से लोग अब भी कुछ हद तक ऐसी ही जीवन-शैली अपनाते हैं, और women's movement ने भी कभी इसके उलट दिशा को बहुत ज़ोर से आगे बढ़ाया, लेकिन बाद में labor market में न जाने की चुनने की आज़ादी पर भी ज़ोर दिया
      तथाकथित "soft life" की पसंद हर युग में मिलती है, और अगर पुरुषों के लिए भी किसी और पर आर्थिक रूप से निर्भर रहने का cultural विकल्प व्यापक रूप से खुला हो, तो मेरा मानना है कि उनमें से भी काफी लोग कम बौद्धिक दबाव वाले और ज़्यादा चरणबद्ध roles चुनेंगे
      तब दूसरे क्षेत्रों में representation imbalance भी महिलाओं को ज़बरदस्ती धकेलने से नहीं, बल्कि पुरुषों के स्वैच्छिक हटने से कुछ हद तक कम हो सकती है, ऐसा एक दृष्टिकोण है
    • अब public domain text हो तो लगभग कुछ भी Kimi या GLM जैसे latest LLMs में डालकर आधुनिक भाषा में काफी अच्छे summaries लिए जा सकते हैं
      ऐतिहासिक documents की ईंट-जैसी paragraphs को LLM का थोड़ा ज़्यादा formatting करके व्यवस्थित कर देना भी अनपेक्षित रूप से उपयोगी है
      और अगर एक prompt और दे दें, जैसे "आज के समय में इस text को कैसे लिया जाएगा?", तो वर्तमान मानकों के हिसाब से अनुचित या असहज लगने वाले हिस्सों को भी यह काफी विस्तार से दिखा देता है
  • मैं जानना चाहता था कि अंदर से information किस structure में है। Digital humanities की तरफ हाल में पता चला कि ऐसे कामों में XML-TEI जैसी semantic markup का काफी उपयोग होता है
    मैंने Latin-English Lewis & Short dictionary की XML-TEI encoding देखते हुए BaseX और XQuery सीखी, और "पूरे corpus में केवल एक बार आने वाला शब्द इस्तेमाल करने वाला classical author कौन है" या "सबसे लंबा hapax शब्द कौन सा है" जैसे सवाल पूछने में मज़ा आया
    Tufts University ने ऐसी सामग्री सार्वजनिक की, यह भी बहुत अच्छा लगा
    1911 Britannica को भी BaseX में डालकर XQuery से तरह-तरह से खंगालना बहुत मज़ेदार होगा

    • आंतरिक structure XML-TEI नहीं, बल्कि relational data और pipeline आधारित है। Article boundaries, sections, contributors, cross-references और source page provenance को structured records के रूप में restore किया गया है
      Text खुद public domain है, लेकिन अभी bulk structured export जारी नहीं किया गया है
      हालाँकि इस thread में भी dataset access की बहुत requests आई हैं, इसलिए इस पर गंभीरता से विचार कर रहा हूँ; और अगर जारी किया, तो plain text dump की बजाय structure सुरक्षित रखने वाले रूप में करना चाहूँगा
  • आधुनिक texts की तुलना में इसकी writing style और structure काफी अलग है, यह दिलचस्प लगा
    उदाहरण के लिए Copenhagen entry https://britannica11.org/article/07-0111-copenhagen/copenhagen में geography और मुख्य दर्शनीय चीज़ों का सटीक वर्णन है, लेकिन लेखक जिन चीज़ों को रोचक या विचित्र मानते हैं उनके बारे में भावनात्मक adjectives और निजी राय भी बिना झिझक जोड़ते हैं
    और नीचे Battle of Copenhagen वाला हिस्सा geography के वर्णन से अचानक नौसैनिक युद्ध के scene-by-scene depiction में चला जाता है, मानो genre ही बदल गया हो

    • सही बात है। यही इस edition की मेरी सबसे पसंदीदा बातों में से एक है। Documents का tone ज़्यादा व्यक्तिगत और कम uniform है
      geography, history, और कभी-कभी काफी मज़बूत opinions भी एक ही जगह मिले हुए हैं, और मुझे लगता है इससे पढ़ना उल्टा और बेहतर हो जाता है
      इस बारे में कुछ बातें मैंने अपने intro page https://britannica11.org/about.html में भी लिखी हैं
    • Victor Hugo entry देखते ही मुझे एक ऐसी पंक्ति मिली जिसे देखकर साफ़ लगा कि लेखक प्रशंसक है
      Les Misérables को "अब तक रचा या कल्पित किया गया सबसे महान epic और dramatic novel" कहना उसी का उदाहरण था
  • मैंने लंबे समय तक सोचा है कि 2021 edition की Encarta या Britannica जैसी अपेक्षाकृत हाल की encyclopedia मिल सकती है या नहीं
    LLM से पहले, लेकिन कोविड के बाद वाली उस अजीब सीमा पर, मुझे ऐसे आख़िरी information source जैसी चीज़ की उम्मीद होती है जो AI contamination से कम प्रभावित हो
    बचपन में मेरी सबसे प्रिय चीज़ों में एक CD-ROM encyclopedia थी, और जब इंटरनेट आम नहीं था तब बरसाती दोपहरों में मनपसंद entries खोलकर पढ़ना और सीखना मुझे बहुत अच्छा लगता था

    • Britannica का DVD edition archive.org पर मिल सकता है। 2004 edition https://archive.org/details/britannica-2004, 2009 edition https://archive.org/details/britannica-multimedia-dvd-2009-disc, 2012 edition https://archive.org/details/britannica-dvd_20230709, और 2013 edition https://archive.org/details/encyclopedia-britannica-dvd-2013 पर उपलब्ध हैं
    • मैं उस एहसास को ठीक-ठीक समझता हूँ। मेरा भी CD-ROM encyclopedia के साथ ऐसा ही अनुभव रहा है, और बस इधर-उधर घूमते-घूमते किसी article में डूब जाने वाला मज़ा आसानी से replace नहीं होता
      इस project की प्रेरणाओं में से एक यही भी थी कि 1911 के मूल text और structure के आधार पर उस exploratory feel को फिर से जीवित किया जाए
    • Encarta की अंतिम release 2009 में आई थी
  • जिसे 1911 Encyclopedia Britannica पसंद है, उसे https://OldEncyc.com भी रोचक लग सकती है
    वहाँ 1728 से 1926 तक की 22 editions की पुरानी encyclopedias को volume और letter range के हिसाब से खंगाला जा सकता है। OP साइट की तरह search-centric नहीं है, लेकिन सामग्री का दायरा बहुत बड़ा है

    • यह साइट मैंने पहले नहीं देखी थी, लेकिन यह सच में शानदार collection लग रही है। खास तौर पर कई editions को व्यापक रूप से समेटने वाली बात मुझे बहुत पसंद आई
  • एक बहुत छोटा bug report है, लेकिन अभी चुना गया font ℔ character को support नहीं करता, इसलिए https://britannica11.org/article/22-0688-s2/putting_the_shot जैसे documents अजीब दिखते हैं
    आजकल ज़्यादा परिचित notation lb में normalize करना भी विचार करने लायक हो सकता है

    • अच्छी पकड़ है। यह glyph coverage की समस्या है, इसलिए missing characters के लिए fallback font जोड़ने या उस case को normalize करने का सोच रहा हूँ
      मामूली लगने पर भी, यह project ऐसी चीज़ों से भरा पड़ा है
  • दुनिया सच में छोटी है। मैं अभी EB 9th edition scans को साफ़ करके MediaWiki साइट पर डाल रहा हूँ, और illustrations और plates तक शामिल कर रहा हूँ, इसलिए अभी सिर्फ़ लगभग एक-तिहाई तक पहुँचा हूँ
    मैंने कई OCR tools आज़माए, और अब तक paddleOCR सबसे प्रभावशाली लगा। Text columns अलग करने, illustrations की labeling, और margins के text पहचानने में यह काफी अच्छा था
    बेशक यह पूर्ण नहीं है, इसलिए कुछ tables मैं हाथ से ठीक कर रहा हूँ, और मूल scanned pages तथा electronic text के बीच आना-जाना संभव हो इसलिए source pages भी साथ अपलोड करने की योजना है

    • वैसे, 1875 की 9th edition अपने अनेक उल्लेखनीय contributors की वजह से scholar's edition के नाम से जानी जाती थी, और यह 19वीं सदी के उत्तरार्ध की बहुत आकर्षक झलक लगती है
      इसी तरह hyperlinks और index जोड़कर online करने लायक सामग्री के रूप में geography atlases, medical atlases, और Baedeker travel guides भी याद आते हैं
    • सुनने में रोमांचक लग रहा है। 9th edition अपने आप में शानदार है, और उसका बहुत सा material 11th edition में भी आगे बढ़ता है
      Alfred Newton के विशाल पक्षी-विषयक entries या Macaulay के कुछ classic essays तुरंत याद आते हैं
  • कुछ हिस्सों में आज पढ़ने पर काफ़ी दिलचस्प और अजीब-सी स्वादिष्टता महसूस होती है। उदाहरण के लिए stars entry https://britannica11.org/article/25-0806-star/star#section-10 में लिखा है कि अगर अंतरिक्ष में तारे अनंत रूप से समान रूप से फैले हों और light absorption न हो, तो sky background चकाचौंध कर देने वाला उजला होना चाहिए

    • मैंने "computer" खोजा, तो आधुनिक अर्थ वाला computer नहीं मिला; सिर्फ़ Chauncey Wright मिला, जिसने American Ephemeris and Nautical Almanac में computer एक पेशेवर पदनाम के रूप में काम किया था
      नतीजा https://britannica11.org/article/28-0872-wright-chauncey/wright__chauncey?q=computer&match=1 था, और सच में ज़माना कितना बदल गया है यह महसूस हुआ
    • Sun entry भी काफी दिलचस्प थी। उन्हें nuclear fusion का पता नहीं था, लेकिन सूर्य इतनी विशाल energy कैसे देता है, इस बारे में chemical combustion या gravitational contraction जैसी theories को वे ज़्यादातर खारिज कर चुके थे
      इसके बजाय वे elements की atomic structure के किसी rearrangement को सबसे संभावित मानते थे, और समझाते थे कि जब nebula सिमटकर सूर्य बनता है और matter ज्ञात elements में विकसित होता है, तब energy निकलती है
      उस समय के ज्ञान स्तर को देखते हुए, यह आश्चर्यजनक रूप से काफ़ी क़रीबी अनुमान था
    • उस हिस्से को Olbers' paradox के संदर्भ में देखा जा सकता है