2 पॉइंट द्वारा GN⁺ 2023-09-18 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • Linear Book Scanner एक कम-लागत वाला ओपन सोर्स पुस्तक स्कैनर है जो अपने-आप पेज पलटना और स्कैनिंग करता है
  • जब किताब डिवाइस के ऊपर आगे-पीछे चलती है, तब पेज पलटना और स्कैनिंग क्रम से होती है
  • हर बार एक मूवमेंट पर वैक्यूम सक्शन एक तरफ के पेज को दूसरी तरफ पलट देता है
  • पेज दो imaging sensor से गुजरते हुए स्कैन होते हैं
  • समर्पित सॉफ़्टवेयर स्कैन के नतीजों को searchable PDF में बदलता है, जिससे उपयोगिता बढ़ती है

पेज पलटते हुए स्कैन करने की संरचना

  • Linear Book Scanner को कम-लागत पेज-पलटने वाले पुस्तक स्कैनर के रूप में डिज़ाइन किया गया है
  • इसका डिज़ाइन open source के रूप में सार्वजनिक है, इसलिए कोई भी इसे खुद बना सकता है
  • किताब मशीन के ऊपर आगे-पीछे चलती है, और हर बार गुजरने पर वैक्यूम पेज को एक तरफ से दूसरी तरफ खींचकर पलट देता है

स्कैन के परिणाम

  • पेज दो imaging sensor से गुजरते समय स्कैन होते हैं
  • सॉफ़्टवेयर स्कैन की गई किताब को searchable PDF के रूप में तैयार करता है

1 टिप्पणियां

 
GN⁺ 2023-09-18
Hacker News की राय
  • इस विषय के लिए https://diybookscanner.org/ पर एक community है
    कुछ साल पहले मैंने Java में bookbuilder नाम का एक छोटा tool बनाया था, जिससे हाथ से पेज पलटकर और फोटो लेने के बाद सभी images को automatically process करके searchable PDF बनाया जा सकता था
    मैंने https://boofcv.org/ नाम की pure Java computer vision library इस्तेमाल की थी, जो आज भी मौजूद है और काफी तेज है
    यह page outline detection, skew correction, image flattening, skin tone matching से उंगलियों की outline हटाना—सब automatically कर सकता था, और फिर बिना user intervention के invisible OCR layer वाला PDF बना सकता था
    मुझे याद है कि flattening सुधारने के लिए मैंने किसी तरह के watershed algorithm से line slope detection पर भी काम किया था
    यह एक मजेदार project था, और सोचता हूं कि source code कहीं बचा है या नहीं। download page भी अब गायब हो चुका है, और उस समय मुझे लगा ही नहीं था कि ऐसा छोटा side project दूसरों के लिए interesting होगा, इसलिए इसे open source करने से पहले ही बात रह गई

    • https://diybookscanner.org/ का असली book scanner forum फिलहाल कई हफ्तों से down है, और उसे restore करने का काम चल रहा है
    • मुझे काफी पहले से book scanning में रुचि रही है, और शायद मुझे यह software देखने की याद है
      मैंने site पर दिखे शुरुआती versions में से एक बनाया था, और कुछ साल पहले संयोग से Jonathon Duerig से मिला और उनके लिए waterjet cutting का काम भी किया
      जब मैंने पहली बार linear book scanner देखा, तो लगा कि यह उल्टा है। अगर यह hanging structure में खुद चल सके, तो book की mass न जानने या friction से निपटने की समस्या से बचा जा सकता है
      counterweight से force को constant रखा जा सकता है, और कोई भी book scan हो, केवल known mass को ही move करना होगा
    • BoofCV सच में शानदार है
      अफसोस है कि आज से पहले इसके बारे में नहीं जानता था; अगर पता होता तो शायद इसे सीखने और contribute करने में समय लगाता। अभी भी संभव है, लेकिन अभी देखने पर लगता है कि यह लगभग हर वह feature और उससे भी अधिक cover करता है जिसके बारे में मैंने सुना है
      मैंने examples एक-एक करके क्लिक करते हुए 30 मिनट बिता दिए
    • हो सके तो इसे GitHub पर publish कर दें, अच्छा होगा
  • इसी तरह का commercial scanner मौजूद है [1] [2], और इसका भी V-shaped design है, लेकिन यह ऊपर से scan करने के लिए flipped form में है
    book move नहीं करती, scanner move करता है, इसलिए book के साथ यह कहीं ज्यादा gentle होता है
    इस तरह के open source alternative को develop होते देखकर बहुत खुशी हो रही है
    [1] https://www.treventus.com
    [2] https://youtu.be/SdipuAuWsEs?si=dFWRtva5gO2oM91o

    • lease या rent पर लेना, या digitization service use करना भी शायद महंगा होगा
      क्योंकि दोनों options में pricing information public नहीं है, बस inquiry form भरने को कहा गया है
    • original project से जुड़े Google presentation में भी इस device को cover किया गया है
      https://youtu.be/4JuoOaL11bw?si=do1qet5Kq_WErQgz&t=162
    • इसी idea का DIY version यहां है: https://www.diybookscanner.org
    • यह scanner हर scan पर एक page काटकर निकालता है, इसलिए मुझे यकीन नहीं कि यह बढ़िया alternative है
      उसके बाद यह कितना gentle है, इसका ज्यादा मतलब नहीं लगता
      अगर आप बचे हुए pages को फिर से bind करके नई book बनाना चाहते हैं, तो शायद हो सकता है
  • idea पसंद है, लेकिन preservation purpose या valuable books के लिए page tear risk थोड़ा चिंता का विषय है
    ऐसे cases में मैं वैसे भी हाथ से scan करना पसंद करूंगा, लेकिन बहुत सारी books digitize करने के लिए ऐसा device चाहने की नौबत कई बार आई है
    FAQ में torn pages की frequency के बारे में लिखा है:

    Prototype 1 could scan the majority of books without damage, but may tear one or two pages in some books. Out of 50 books tested, 45% had one or two of their pages either torn or folded. This is a very early prototype and there are many areas for improvement in the design.
    निजी तौर पर यह ज्यादातर acceptable है। खासकर अगर बाद के versions में 45% को घटाकर करीब 10–20% कर दें, तो अगर मेरे पास ऐसे device के लिए जगह हो, मैं इसे बनाने के बारे में सोचूंगा

    • कुछ समय तक Internet Archive ने ऐसा book scanner बनाया जिसमें book को V-shaped cradle पर रखा जाता था
      volunteer हाथ से page पलटता था, दो glass plates को नीचे-ऊपर करके pages को हल्के से दबाता था, और angled mount पर लगी दो DSLR cameras photos लेती थीं
      पूरा device automatic नहीं है, लेकिन हाथ से आसानी से operate किया जा सकता है
      https://blog.archive.org/2021/02/09/meet-eliza-zhang-book-sc...
    • अगर अभी तक नहीं देखा है, तो यह site देखने लायक है
      https://www.diybookscanner.org/en/intro.html
    • ऐसी book जिसे replace नहीं किया जा सकता, जैसे कोई पुरानी और out-of-print book, उसके लिए यह बिल्कुल acceptable नहीं है
      एक भी torn page नहीं होना चाहिए
      computers से पहले electronic copies भी नहीं होती थीं
  • इस क्षेत्र में software अभी उस स्तर तक नहीं पहुँचा है जहाँ होना चाहिए, इसलिए लोग software से हो सकने वाले कामों को hardware से निपटा रहे हैं
    अगर दो या ज़्यादा photos या stereo image जैसा input हो, जैसे नया iPhone, तो triangulation से flattened page का अनुमान लगाकर ऐसी image बनाई जा सकती है जो flatbed scanner से काटे गए page जैसी दिखे
    उसके बाद Ethiopia में किसी व्यक्ति को पर्याप्त भुगतान कर दें जो किताब को बिना नुकसान पहुँचाए सावधानी से pages पलटे
    किसी भी researcher को पता होगा कि आज की digital libraries में संदिग्ध quality वाले scan work का लगभग एक सदी का ढेर जमा है
    AI 8K monitor पर ऐसे scans का अनुमान लगा सकता है जिन्हें असली outline font format से अलग पहचानना मुश्किल हो
    पहले 1980s के font wars के संबंध में, मैंने पुराने formats और digital scans को PostScript और TrueType fonts में बदलने के काम पर सलाह दी थी
    उस समय यह कठिन था, लेकिन जब software बराबरी कर लेगा, तो इसे text scanning का सही तरीका माना जाएगा
    वैज्ञानिक साहित्य के लिए कुछ ChatGPT जैसा चाहिए जो हर page को reproduce कर सकने वाला LaTeX source restore कर सके। सच तो यह है कि fixed text और flowing text दोनों को समान आसानी से लिखने वाला, और कम जटिल LaTeX successor सचमुच चाहिए

    • यह बहुत ही physical problem है, और इस्तेमाल करने लायक shortcuts ज़्यादा नहीं हैं
      मैंने एक preservation project में सचमुच बहुत सारी magazines scan की हैं, और आम तौर पर उन्हें flatbed पर रखना है या नहीं, इससे बहुत फर्क नहीं पड़ता था। किसी भी हालत में pages हाथ से पलटने में समय लगता है
      magazines और books को बहुत तेज़ी से scan करने का जाना-पहचाना तरीका पहले से है: spine binding काटकर pages को automatic scanner में डालना
      बेशक, अगर scan के बाद भी object को preserve रखना है, तो यह लागू नहीं हो सकता क्योंकि copy नष्ट हो जाती है
      आखिरकार, चीज़ को खराब किए बिना scanning automate करने का सबसे अच्छा तरीका top camera और page-turning machine को जोड़ना होगा। मुझे लगता है Google का बड़े पैमाने का scanning project भी इसी तरह रहा होगा
      X-ray से pages पलटे बिना कुछ books को “scan” किया जा सकता है, लेकिन लगता है वहाँ भी नई समस्याएँ पैदा होंगी
    • Third World labour का शोषण करने के लिए infrastructure बनाना आखिर किस तरह software problem है, यह मुझे समझ नहीं आता
      समस्या यह नहीं है कि software distortion correction ठीक से नहीं कर पाता, बल्कि यह है कि book scanning की सारी तैयारी कर लेने के बाद ऐसा device इस्तेमाल करना बेहतर है जिसमें distortion correction की ज़रूरत ही न पड़े
    • Software 2017 में ही सक्षम था। visually impaired लोगों के लिए एक device में मूल रूप से यह काम किया था, और stereo image की भी ज़रूरत नहीं थी
      flattening कैसे काम करती है, यह यहाँ देखा जा सकता है। यह हिस्सा library संभालती थी, इसलिए अलग से code लिखने की ज़रूरत नहीं थी
      https://youtu.be/DPu0iJtK2sI?t=1542
      इसमें page पलटने को बताने, page पलटा गया है या नहीं detect करने, और photo लेने की सुविधा भी है। background में photos को flatten किया जाता है, pages split किए जाते हैं और OCR किया जाता है
      थोड़ी आदत पड़ जाए तो एक किताब को प्रति page 1–5 seconds में scan और OCR किया जा सकता है
      https://youtu.be/DPu0iJtK2sI?t=1909
      इसके बाद OCR की हुई book save रहती है और जब चाहें पढ़कर सुना देती है
    • LaTeX successor के लिए https://typst.app/ काफी अच्छी तरह जगह बना रहा है
    • AI बिल्कुल नहीं। digitization process में text का हल्के-हल्के बदल जाना सबसे ज़्यादा टालने वाली चीज़ है
      https://news.ycombinator.com/item?id=29223815
      दिखने में सही लेकिन गलत नतीजों का जोखिम AI से पहले भी चिंता का विषय रहा है
  • यह वाला कहीं ज़्यादा सुरक्षित लगता है
    https://www.inforum.com/newsmd/ndsu-students-book-scanner-in...
    http://diybookscanner.org

    • वह तरीका निश्चित रूप से ज़्यादा सुरक्षित है, लेकिन automatic नहीं है और किसी को pages पलटने पड़ते हैं
      यह project उसी समस्या को हल करने की कोशिश है, लेकिन किताब को नुकसान न पहुँचे इसलिए इसे कहीं ज़्यादा gentle तरीके से करना होगा
  • scan करने के बाद सारी सामग्री digital format में होती है, तो scan से पहले किताब को अलग-अलग pages में binding हटाकर खोलना scalable model क्यों नहीं है, यह सोच रहा हूँ
    क्या मकसद अतिरिक्त dismantling work से बचना है

    • Archivists आम तौर पर जिस work को preserve करना चाहते हैं उसे नष्ट करना पसंद नहीं करते
      किताब scan करने पर भी आपको केवल optical images ही मिलती हैं। medieval manuscripts के मामले में pages मिटाए जाकर फिर से लिखे गए हो सकते हैं
      किताब को बस scan करके physical copy नष्ट कर दें तो ऐसे evidence खो जाते हैं
      हालांकि सस्ती mass-market books के लिए, शायद अधिकांश archivists भी लाखों copies में से एक copy नष्ट करके work को preserve करने पर बहुत परवाह नहीं करेंगे
      असली समस्या केवल बहुत पुरानी और बहुत दुर्लभ works में होती है
    • अगर किताब बहुत कीमती नहीं है, तो आम तौर पर paper cutter से binding वाला हिस्सा पूरी तरह काटकर loose sheets को sheet-feed scanner में डालना आसान होता है
  • ज़रा-सी भी damaged किताबें तो पूरी तरह चिथड़े-चिथड़े हो जाएँगी

    • यह देखकर मैं भी सहम गया था
      मेरे पास कई पुरानी books हैं जिन्हें digitize करना चाहता हूँ, और आम तौर पर दिखने वाले ज़्यादातर book scanners में भी कम से कम किताब को पूरी तरह खोलना पड़ता है, और ऐसा करने पर जैसा आपने कहा, किताब फट सकती है
      ऊपर से उन devices में vacuum, sharp edges से होकर movement, और stepper motor जैसी चीज़ें भी शामिल नहीं होतीं
      https://linearbookscanner.org/faq/ के दूसरे सवाल को देखें:

      Out of 50 books tested, 45% had one or two of their pages either torn or folded
      अपनी कम कीमती books पर भी मैं यह इस्तेमाल नहीं करूँगा

    • निश्चित रूप से ऐसा होगा। अगर कुछ अटक जाए या environmental conditions बदलकर paper के साथ react करें, तो जो किताबें damaged नहीं थीं वे भी ऐसी हो सकती हैं
      फिर भी अगर scan करने के लिए किताबों का पहाड़ हो, और ऐसी machine से ज़्यादातर को process करके सिर्फ special cases को अधिक सावधानी से handle किया जा सके, तो यह फायदा है
  • Google ने मोटे तौर पर पहले ही सभी किताबें scan कर ली थीं। समस्या copyright और rights holders की थी
    पेज पलटने के काम के लिए कम वेतन वाले labour का इस्तेमाल किया गया था। अगर कोई पहले link नहीं डालता, तो मैं बाद में link भेज दूँगा
    घर आकर देखा तो यह article था: https://www.theatlantic.com/technology/archive/2017/04/the-t...

  • वाकई शानदार लगता है। न सिर्फ आप किताबों को digitize कर सकते हैं, बल्कि यह मुफ्त में उन्हें shred भी कर देता है
    काफी अच्छा 1+1 deal है

  • मुझे dust mites से allergy है, इसलिए कोई किताब shelf पर लगभग 6 महीने रहे तो सिर्फ छूने भर से allergic reaction हो जाता है
    बाहर से झाड़ने या vacuum cleaner से साफ करने का भी असर नहीं होता
    लगता है इस device का इस्तेमाल किताबों से dust mites हटाने और उन्हें पढ़ने लायक बनाने में किया जा सकता है