- जब academic PDF साझा किए जाते हैं, तो प्रति-डाउनलोड metadata और access time को मिलाकर, उसी paper file की source tracking के लिए इस्तेमाल किया जा सकता है
- पहचान मान
exiftoolसे देखा जा सकता है, और उच्च-स्तरीय metadata को exiftool + qpdf संयोजन से हटाया जा सकता है - PDF में “final published version”(VoR) को दर्शाने वाला NISO tag और अनुमत domain restrictions भी शामिल हैं, और Elsevier ऐसे metadata वाले PDF को scan करता है
- ऐसा लगता है कि Sci-Hub से मिले papers में भी यह metadata बना रहता है, जिससे paper download में इस्तेमाल हुए academic account की पहचान तक पहुंचा जा सकता है
- अलग-अलग पहचान tags वाले दो PDFs, metadata हटाने और
qpdf --deterministic-idचलाने के बादdiffपर एक जैसे थे, लेकिन इससे अतिरिक्त watermarking की अनुपस्थिति को सामान्यीकृत करना कठिन है
हर डाउनलोड पर बदलने वाला Elsevier PDF metadata
- Elsevier PDF में हर डाउनलोड के लिए एक unique hash metadata के रूप में एम्बेड किया जाता है
- उसी paper को दो बार डाउनलोड करके metadata की तुलना करने पर अलग-अलग values दिखाई देती हैं
- अगर इस value को access time के साथ जोड़ा जाए, तो साझा किए गए PDF की पहचान यह पता लगाने के लिए की जा सकती है कि वह किस डाउनलोड से आया
जाँच और हटाने में इस्तेमाल किए गए tools
exiftoolसे PDF metadata को सीधे देखा जा सकता है- उच्च-स्तरीय metadata हटाने के commands:
exiftool -all:all= <path.pdf> -o <output1.pdf>qpdf --linearize <output1.pdf> <output2.pdf>
- सभी metadata हटाने के लिए dangerzone या mat2 का उपयोग किया जा सकता है
- संबंधित tools:
- exiftool: metadata पढ़ने/लिखने का tool
- qpdf: PDF processing tool
- dangerzone: PDF को image के रूप में render करके फिर OCR करने वाला GUI tool
- mat2: PDF को image के रूप में render करता है लेकिन OCR नहीं करता, ऐसा metadata removal tool
ऑटोमेटेड cleanup script और tag extraction
- दी गई shell script, निर्दिष्ट directory या current directory में PDF files को recursively खोजकर metadata हटाती है
- target environment macOS और Unix-आधारित systems हैं, और
qpdfवexiftoolका installed होना ज़रूरी है - हर PDF के लिए
_clean.pdfsuffix वाला cleaned version बनाया जाता है, औरexiftoolवqpdf --linearizeलागू किए जाते हैं - इसके बाद सही तरह से extracted tags और सीधे extract किए जा सकने वाले Python code को gist में जोड़ा गया
- शुरुआत में इसे “hash” कहा गया था, लेकिन extracted value में एक स्पष्ट pattern है और यह क्या समेटे हुए है, यह अभी स्पष्ट नहीं है
NISO tags और Sci-Hub में बचे रहने वाले निशान
- PDF metadata में document status दिखाने वाले NISO tags शामिल होते हैं
- document status को “final published version”(VoR) के रूप में दिखाया जाता है
- यह किस domain पर मौजूद होना चाहिए, इसकी restrictions भी साथ शामिल होती हैं
- Elsevier ऐसे metadata वाले PDF को scan करता है, इसलिए copies साझा करते समय metadata हटाना ज़रूरी है
- ऐसा प्रतीत होता है कि Sci-Hub से मिले papers में भी यह metadata संरक्षित रहता है
- अगर Sci-Hub, एकत्र किए गए academic credentials से papers डाउनलोड करता है, तो publisher इस metadata के जरिए उन accounts की पहचान कर सकता है जिन्हें बंद या सुरक्षित किया जाना चाहिए
अतिरिक्त watermarking की संभावना और verification results
- metadata के अलावा अधिक परिष्कृत watermarking होने की संभावना बनी हुई है
- अलग-अलग पहचान tags वाली दो files पर किए गए experiment के results:
- metadata हटाया गया
qpdfके--deterministic-idflag से दोबारा linearize किया गया- resulting PDF
diffपर एक जैसी निकली
- सिर्फ इस result के आधार पर यह सामान्य निष्कर्ष निकालना सावधानी के बिना उचित नहीं कि अतिरिक्त watermarking नहीं है
- metadata बड़े पैमाने पर PDF को तेज़ी से scan करने की सुविधा देता है, इसलिए यह विशेष रूप से ध्यान खींचने वाला पहचान माध्यम है
1 टिप्पणियां
Hacker News की राय
यह कल्पना होती है कि वे उन लोगों को ढूंढने के लिए इतनी मेहनत कर रहे हैं जिन्होंने ऐसे विचार साझा किए जिन्हें उन्होंने न बनाया, न फंड किया, ताकि उन्हें पैसे न देने के लिए सज़ा दी जा सके
ऐसी कंपनियां बस मानवता की प्रगति में बाधा डालने वाली संस्थाएं लगती हैं
ऊपर से ऐसी कंपनियां रंगीन इमेज प्रिंटिंग जैसी अतिरिक्त सेवाओं के लिए भी लेखकों से बेहिसाब पैसे वसूलती हैं
दूर भविष्य में स्कूलों और विश्वविद्यालयों में शायद ऐसी कंपनियों को सामाजिक परजीवियों के उदाहरण के रूप में पढ़ाया जाएगा
असली समस्या मेरे हिसाब से सरकारें हैं, खासकर अमेरिकी सरकार, जो बल-प्रयोग के एकाधिकार का इस्तेमाल करके ऐसी कंपनियों को ऐसे business model लागू कराने में मदद करती हैं
कुछ लेखक कई साल लगाते हैं, कई लेखक कम से कम 1 साल लगाते हैं, और कुछ विद्वान एक पेपर पर कई साल लगाते हैं
Elsevier भी इस काम के उत्पादन और फंडिंग में काफी हद तक शामिल पार्टनर है, और वहां के कर्मचारी editing, typesetting और distribution संभालते हैं
लेखक भी इस प्रक्रिया के पार्टनर हैं और कई बार Elsevier से royalties भी पाते हैं
फिर भी कुछ लोग piracy को सही ठहराने के लिए तरह-तरह की जबरन दलीलें जोड़ते हैं
अगर कोई गरीब लेखक है, तो यह मानना चाहिए कि अवैध copying उसकी लेखन की बिक्री से रोज़ी कमाने की क्षमता को कमजोर कर रही है
दस्तावेज़ सार्वजनिक करने से पहले दो अलग-अलग स्रोतों से copies लेकर hash की तुलना करना एक अच्छी आदत लगती है
डेटा को image, audio file, PDF, program—कहीं भी छिपाया जा सकता है
कम से कम Elsevier के मामले में यह काफी स्पष्ट दिखता है कि वे users को track करने के लिए key का इस्तेमाल कर रहे हैं
शायद उस कानून का आखिरकार उपयोगी इस्तेमाल हो सके
PDF files से संभावित malware हटाने के लिए इस्तेमाल होने वाला एक free open source tool DangerZone है, और यह metadata भी हटा सकता है
सिर्फ metadata साफ करने के लिए यह शायद जरूरत से ज्यादा है, लेकिन उल्लेख करने लायक है
https://dangerzone.rocks/
पर्याप्त लंबी PDF में 128-bit identifier छिपाने के कई तरीके होते हैं
सफेद background पर सफेद rectangle, जगह-जगह बहुत हल्के से non-black pixels आदि कुछ भी हो सकता है
कई तरीके print करने के बाद scan करने पर भी बचे रह सकते हैं
PDF को overall साफ करने और size घटाने के लिए मैं एक छोटा script इस्तेमाल कर रहा हूं
मोटे तौर पर यह ऐसा है
pdftops -paper A4 -expand -level3 file.pdfps2pdf14 -dEmbedAllFonts=true \-dUseFlateCompression=true \-dOptimize=true \-dProcessColorModel=/DeviceRGB \-r72 \-dDownsampleGrayImages=true \-dGrayImageResolution=150 \-dAutoFilterGrayImages=false \-dGrayImageDownsampleType=/Bicubic \-dDownsampleMonoImages=true \-dMonoImageResolution=150 \-dMonoImageDownsampleType=/Subsample \-dDownsampleColorImages=true \-dColorImageResolution=150 \-dAutoFilterColorImages=false \-dColorImageDownsampleType=/Bicubic \-dPDFSETTINGS=/ebook \-dNOSAFER \-dALLOWPSTRANSPARENCY \-dShowAnnots=false \file.pdf file.pdfजरूरत हो तो बाद में अतिरिक्त metadata डाला जा सकता है
यह किसी खास tracking method को हटाने के लिए विशेष रूप से design नहीं किया गया है, लेकिन ज्यादातर मामलों में सरल और काफी उपयोगी है
Elsevier से PDF download करें, उसे अपने PDF viewer में खोलें, फिर print दबाएं और printer selection में Print to PDF चुन लें
यह जानकारी file copy करते समय बचे रहने की संभावना रखती है, और tool व format के हिसाब से compressed file के अंदर चली जाकर बाद में restore भी हो सकती है
https://www.digital-detective.net/forensic-analysis-of-zone-...
Total Commander plugins में से कुछ यह भी दिखाते हैं कि कोई खास file कहां से download हुई थी
मैंने कई plugins install कर रखे हैं, इसलिए ठीक-ठीक कौन सा है पता नहीं, लेकिन शायद यह plugin होगा: https://totalcmd.net/plugring/ntfsstreamviewer.html
फिर print किए गए PDF pages को दोबारा scan करें,
convert,pdfuniteसे PDF document में जोड़ें, औरghostscriptसे compress कर देंअगर आपको पूरा यकीन न हो कि यह वाकई जरूरी है, तो कृपया ऐसा न करें
यह इस विषय से जुड़ा है, इसलिए यहाँ छोड़ रहा हूँ
https://github.com/kanzure/pdfparanoia
और
https://github.com/firstlookmedia/pdf-redact-tools
DangerZone का लिंक मूल रूप से सबमिट किए गए Mastodon थ्रेड में मिल सकता है
ऐसे tools बनाने चाहिए जो मानवता के ज्ञान को साझा और खोलने योग्य बनाएं
https://en.m.wikipedia.org/wiki/Sci-Hub
वैसे ऐसे fingerprints को अपने-आप हटाया जा सके तो अच्छा होगा
Elsevier और उसके जैसे संस्थान लगातार बचे रह सकते हैं, और लोग सचमुच ऐसे परजीवी systems को पैसे देते हैं—इस तथ्य के मूल कारणों को खोजकर विश्लेषण करना चाहिए
संभावित सुराग यह हैं कि academia आखिरकार आलसी है और system को ठीक करने का इरादा नहीं रखती; researchers अपने research में इतने डूबे रहते हैं कि अपने काम से सीधे जुड़े न होने वाले कामों की quality बहुत खराब होती है; और ऐसे incentive structures मौजूद हैं जिनका फायदा उन लोगों को वापस मिलता है जो इस system को बनाए रखते हैं
क्या कोई और सुराग है
उदाहरण के लिए, technology fields काफी हद तक open access journals की ओर शिफ्ट हो गई हैं, और researcher promotion के लिए भी यह ठीक से काम करता है
लेकिन जब तक tenure जैसी चीजें Nature में publication पर निर्भर हैं, निकट भविष्य में Nature को हटाना मुश्किल होगा
metadata, document watermarking में बहुत आसान target है
आम तौर पर PDF renderers spacing, kerning, invisible characters और तरह-तरह की steganography का इस्तेमाल करके हर copy को unique बना देते हैं
hash का क्या मतलब होगा, यह समझ नहीं आता; असल में यह किसी secret value और unique copy को मिलाकर बनाया गया message authentication code होने की संभावना ज्यादा है
इससे publisher को साफ़ की गई copy की पहचान करने में मदद मिलती है
अगर दो या उससे ज्यादा copies हों तो फिर से anonymize किया जा सकता है, और सोचता हूँ कि summarization-style language models इस काम में उपयोगी हो सकते हैं या नहीं
बेशक diagrams में भी steganographic variations डाले जा सकते हैं
PDF एक messy document format है, इसलिए लगभग हमेशा उसे plain text में बदल देता हूँ, और आम तौर पर meaning का नुकसान नहीं होता
क्या यह practice EU में legal है