- Linear Book Scanner एक कम-लागत वाला ओपन सोर्स पुस्तक स्कैनर है जो अपने-आप पेज पलटना और स्कैनिंग करता है
- जब किताब डिवाइस के ऊपर आगे-पीछे चलती है, तब पेज पलटना और स्कैनिंग क्रम से होती है
- हर बार एक मूवमेंट पर वैक्यूम सक्शन एक तरफ के पेज को दूसरी तरफ पलट देता है
- पेज दो imaging sensor से गुजरते हुए स्कैन होते हैं
- समर्पित सॉफ़्टवेयर स्कैन के नतीजों को searchable PDF में बदलता है, जिससे उपयोगिता बढ़ती है
पेज पलटते हुए स्कैन करने की संरचना
- Linear Book Scanner को कम-लागत पेज-पलटने वाले पुस्तक स्कैनर के रूप में डिज़ाइन किया गया है
- इसका डिज़ाइन open source के रूप में सार्वजनिक है, इसलिए कोई भी इसे खुद बना सकता है
- किताब मशीन के ऊपर आगे-पीछे चलती है, और हर बार गुजरने पर वैक्यूम पेज को एक तरफ से दूसरी तरफ खींचकर पलट देता है
स्कैन के परिणाम
- पेज दो imaging sensor से गुजरते समय स्कैन होते हैं
- सॉफ़्टवेयर स्कैन की गई किताब को searchable PDF के रूप में तैयार करता है
1 टिप्पणियां
Hacker News की राय
इस विषय के लिए https://diybookscanner.org/ पर एक community है
कुछ साल पहले मैंने Java में bookbuilder नाम का एक छोटा tool बनाया था, जिससे हाथ से पेज पलटकर और फोटो लेने के बाद सभी images को automatically process करके searchable PDF बनाया जा सकता था
मैंने https://boofcv.org/ नाम की pure Java computer vision library इस्तेमाल की थी, जो आज भी मौजूद है और काफी तेज है
यह page outline detection, skew correction, image flattening, skin tone matching से उंगलियों की outline हटाना—सब automatically कर सकता था, और फिर बिना user intervention के invisible OCR layer वाला PDF बना सकता था
मुझे याद है कि flattening सुधारने के लिए मैंने किसी तरह के watershed algorithm से line slope detection पर भी काम किया था
यह एक मजेदार project था, और सोचता हूं कि source code कहीं बचा है या नहीं। download page भी अब गायब हो चुका है, और उस समय मुझे लगा ही नहीं था कि ऐसा छोटा side project दूसरों के लिए interesting होगा, इसलिए इसे open source करने से पहले ही बात रह गई
मैंने site पर दिखे शुरुआती versions में से एक बनाया था, और कुछ साल पहले संयोग से Jonathon Duerig से मिला और उनके लिए waterjet cutting का काम भी किया
जब मैंने पहली बार linear book scanner देखा, तो लगा कि यह उल्टा है। अगर यह hanging structure में खुद चल सके, तो book की mass न जानने या friction से निपटने की समस्या से बचा जा सकता है
counterweight से force को constant रखा जा सकता है, और कोई भी book scan हो, केवल known mass को ही move करना होगा
अफसोस है कि आज से पहले इसके बारे में नहीं जानता था; अगर पता होता तो शायद इसे सीखने और contribute करने में समय लगाता। अभी भी संभव है, लेकिन अभी देखने पर लगता है कि यह लगभग हर वह feature और उससे भी अधिक cover करता है जिसके बारे में मैंने सुना है
मैंने examples एक-एक करके क्लिक करते हुए 30 मिनट बिता दिए
इसी तरह का commercial scanner मौजूद है [1] [2], और इसका भी V-shaped design है, लेकिन यह ऊपर से scan करने के लिए flipped form में है
book move नहीं करती, scanner move करता है, इसलिए book के साथ यह कहीं ज्यादा gentle होता है
इस तरह के open source alternative को develop होते देखकर बहुत खुशी हो रही है
[1] https://www.treventus.com
[2] https://youtu.be/SdipuAuWsEs?si=dFWRtva5gO2oM91o
क्योंकि दोनों options में pricing information public नहीं है, बस inquiry form भरने को कहा गया है
https://youtu.be/4JuoOaL11bw?si=do1qet5Kq_WErQgz&t=162
उसके बाद यह कितना gentle है, इसका ज्यादा मतलब नहीं लगता
अगर आप बचे हुए pages को फिर से bind करके नई book बनाना चाहते हैं, तो शायद हो सकता है
idea पसंद है, लेकिन preservation purpose या valuable books के लिए page tear risk थोड़ा चिंता का विषय है
ऐसे cases में मैं वैसे भी हाथ से scan करना पसंद करूंगा, लेकिन बहुत सारी books digitize करने के लिए ऐसा device चाहने की नौबत कई बार आई है
FAQ में torn pages की frequency के बारे में लिखा है:
volunteer हाथ से page पलटता था, दो glass plates को नीचे-ऊपर करके pages को हल्के से दबाता था, और angled mount पर लगी दो DSLR cameras photos लेती थीं
पूरा device automatic नहीं है, लेकिन हाथ से आसानी से operate किया जा सकता है
https://blog.archive.org/2021/02/09/meet-eliza-zhang-book-sc...
https://www.diybookscanner.org/en/intro.html
एक भी torn page नहीं होना चाहिए
computers से पहले electronic copies भी नहीं होती थीं
इस क्षेत्र में software अभी उस स्तर तक नहीं पहुँचा है जहाँ होना चाहिए, इसलिए लोग software से हो सकने वाले कामों को hardware से निपटा रहे हैं
अगर दो या ज़्यादा photos या stereo image जैसा input हो, जैसे नया iPhone, तो triangulation से flattened page का अनुमान लगाकर ऐसी image बनाई जा सकती है जो flatbed scanner से काटे गए page जैसी दिखे
उसके बाद Ethiopia में किसी व्यक्ति को पर्याप्त भुगतान कर दें जो किताब को बिना नुकसान पहुँचाए सावधानी से pages पलटे
किसी भी researcher को पता होगा कि आज की digital libraries में संदिग्ध quality वाले scan work का लगभग एक सदी का ढेर जमा है
AI 8K monitor पर ऐसे scans का अनुमान लगा सकता है जिन्हें असली outline font format से अलग पहचानना मुश्किल हो
पहले 1980s के font wars के संबंध में, मैंने पुराने formats और digital scans को PostScript और TrueType fonts में बदलने के काम पर सलाह दी थी
उस समय यह कठिन था, लेकिन जब software बराबरी कर लेगा, तो इसे text scanning का सही तरीका माना जाएगा
वैज्ञानिक साहित्य के लिए कुछ ChatGPT जैसा चाहिए जो हर page को reproduce कर सकने वाला LaTeX source restore कर सके। सच तो यह है कि fixed text और flowing text दोनों को समान आसानी से लिखने वाला, और कम जटिल LaTeX successor सचमुच चाहिए
मैंने एक preservation project में सचमुच बहुत सारी magazines scan की हैं, और आम तौर पर उन्हें flatbed पर रखना है या नहीं, इससे बहुत फर्क नहीं पड़ता था। किसी भी हालत में pages हाथ से पलटने में समय लगता है
magazines और books को बहुत तेज़ी से scan करने का जाना-पहचाना तरीका पहले से है: spine binding काटकर pages को automatic scanner में डालना
बेशक, अगर scan के बाद भी object को preserve रखना है, तो यह लागू नहीं हो सकता क्योंकि copy नष्ट हो जाती है
आखिरकार, चीज़ को खराब किए बिना scanning automate करने का सबसे अच्छा तरीका top camera और page-turning machine को जोड़ना होगा। मुझे लगता है Google का बड़े पैमाने का scanning project भी इसी तरह रहा होगा
X-ray से pages पलटे बिना कुछ books को “scan” किया जा सकता है, लेकिन लगता है वहाँ भी नई समस्याएँ पैदा होंगी
समस्या यह नहीं है कि software distortion correction ठीक से नहीं कर पाता, बल्कि यह है कि book scanning की सारी तैयारी कर लेने के बाद ऐसा device इस्तेमाल करना बेहतर है जिसमें distortion correction की ज़रूरत ही न पड़े
flattening कैसे काम करती है, यह यहाँ देखा जा सकता है। यह हिस्सा library संभालती थी, इसलिए अलग से code लिखने की ज़रूरत नहीं थी
https://youtu.be/DPu0iJtK2sI?t=1542
इसमें page पलटने को बताने, page पलटा गया है या नहीं detect करने, और photo लेने की सुविधा भी है। background में photos को flatten किया जाता है, pages split किए जाते हैं और OCR किया जाता है
थोड़ी आदत पड़ जाए तो एक किताब को प्रति page 1–5 seconds में scan और OCR किया जा सकता है
https://youtu.be/DPu0iJtK2sI?t=1909
इसके बाद OCR की हुई book save रहती है और जब चाहें पढ़कर सुना देती है
https://news.ycombinator.com/item?id=29223815
दिखने में सही लेकिन गलत नतीजों का जोखिम AI से पहले भी चिंता का विषय रहा है
यह वाला कहीं ज़्यादा सुरक्षित लगता है
https://www.inforum.com/newsmd/ndsu-students-book-scanner-in...
http://diybookscanner.org
यह project उसी समस्या को हल करने की कोशिश है, लेकिन किताब को नुकसान न पहुँचे इसलिए इसे कहीं ज़्यादा gentle तरीके से करना होगा
scan करने के बाद सारी सामग्री digital format में होती है, तो scan से पहले किताब को अलग-अलग pages में binding हटाकर खोलना scalable model क्यों नहीं है, यह सोच रहा हूँ
क्या मकसद अतिरिक्त dismantling work से बचना है
किताब scan करने पर भी आपको केवल optical images ही मिलती हैं। medieval manuscripts के मामले में pages मिटाए जाकर फिर से लिखे गए हो सकते हैं
किताब को बस scan करके physical copy नष्ट कर दें तो ऐसे evidence खो जाते हैं
हालांकि सस्ती mass-market books के लिए, शायद अधिकांश archivists भी लाखों copies में से एक copy नष्ट करके work को preserve करने पर बहुत परवाह नहीं करेंगे
असली समस्या केवल बहुत पुरानी और बहुत दुर्लभ works में होती है
ज़रा-सी भी damaged किताबें तो पूरी तरह चिथड़े-चिथड़े हो जाएँगी
मेरे पास कई पुरानी books हैं जिन्हें digitize करना चाहता हूँ, और आम तौर पर दिखने वाले ज़्यादातर book scanners में भी कम से कम किताब को पूरी तरह खोलना पड़ता है, और ऐसा करने पर जैसा आपने कहा, किताब फट सकती है
ऊपर से उन devices में vacuum, sharp edges से होकर movement, और stepper motor जैसी चीज़ें भी शामिल नहीं होतीं
https://linearbookscanner.org/faq/ के दूसरे सवाल को देखें:
फिर भी अगर scan करने के लिए किताबों का पहाड़ हो, और ऐसी machine से ज़्यादातर को process करके सिर्फ special cases को अधिक सावधानी से handle किया जा सके, तो यह फायदा है
Google ने मोटे तौर पर पहले ही सभी किताबें scan कर ली थीं। समस्या copyright और rights holders की थी
पेज पलटने के काम के लिए कम वेतन वाले labour का इस्तेमाल किया गया था। अगर कोई पहले link नहीं डालता, तो मैं बाद में link भेज दूँगा
घर आकर देखा तो यह article था: https://www.theatlantic.com/technology/archive/2017/04/the-t...
वाकई शानदार लगता है। न सिर्फ आप किताबों को digitize कर सकते हैं, बल्कि यह मुफ्त में उन्हें shred भी कर देता है
काफी अच्छा 1+1 deal है
मुझे dust mites से allergy है, इसलिए कोई किताब shelf पर लगभग 6 महीने रहे तो सिर्फ छूने भर से allergic reaction हो जाता है
बाहर से झाड़ने या vacuum cleaner से साफ करने का भी असर नहीं होता
लगता है इस device का इस्तेमाल किताबों से dust mites हटाने और उन्हें पढ़ने लायक बनाने में किया जा सकता है