1 पॉइंट द्वारा GN⁺ 2024-06-11 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • जब academic PDF साझा किए जाते हैं, तो प्रति-डाउनलोड metadata और access time को मिलाकर, उसी paper file की source tracking के लिए इस्तेमाल किया जा सकता है
  • पहचान मान exiftool से देखा जा सकता है, और उच्च-स्तरीय metadata को exiftool + qpdf संयोजन से हटाया जा सकता है
  • PDF में “final published version”(VoR) को दर्शाने वाला NISO tag और अनुमत domain restrictions भी शामिल हैं, और Elsevier ऐसे metadata वाले PDF को scan करता है
  • ऐसा लगता है कि Sci-Hub से मिले papers में भी यह metadata बना रहता है, जिससे paper download में इस्तेमाल हुए academic account की पहचान तक पहुंचा जा सकता है
  • अलग-अलग पहचान tags वाले दो PDFs, metadata हटाने और qpdf --deterministic-id चलाने के बाद diff पर एक जैसे थे, लेकिन इससे अतिरिक्त watermarking की अनुपस्थिति को सामान्यीकृत करना कठिन है

हर डाउनलोड पर बदलने वाला Elsevier PDF metadata

  • Elsevier PDF में हर डाउनलोड के लिए एक unique hash metadata के रूप में एम्बेड किया जाता है
  • उसी paper को दो बार डाउनलोड करके metadata की तुलना करने पर अलग-अलग values दिखाई देती हैं
  • अगर इस value को access time के साथ जोड़ा जाए, तो साझा किए गए PDF की पहचान यह पता लगाने के लिए की जा सकती है कि वह किस डाउनलोड से आया

जाँच और हटाने में इस्तेमाल किए गए tools

  • exiftool से PDF metadata को सीधे देखा जा सकता है
  • उच्च-स्तरीय metadata हटाने के commands:
    • exiftool -all:all= <path.pdf> -o <output1.pdf>
    • qpdf --linearize <output1.pdf> <output2.pdf>
  • सभी metadata हटाने के लिए dangerzone या mat2 का उपयोग किया जा सकता है
  • संबंधित tools:
    • exiftool: metadata पढ़ने/लिखने का tool
    • qpdf: PDF processing tool
    • dangerzone: PDF को image के रूप में render करके फिर OCR करने वाला GUI tool
    • mat2: PDF को image के रूप में render करता है लेकिन OCR नहीं करता, ऐसा metadata removal tool

ऑटोमेटेड cleanup script और tag extraction

  • दी गई shell script, निर्दिष्ट directory या current directory में PDF files को recursively खोजकर metadata हटाती है
  • target environment macOS और Unix-आधारित systems हैं, और qpdfexiftool का installed होना ज़रूरी है
  • हर PDF के लिए _clean.pdf suffix वाला cleaned version बनाया जाता है, और exiftoolqpdf --linearize लागू किए जाते हैं
  • इसके बाद सही तरह से extracted tags और सीधे extract किए जा सकने वाले Python code को gist में जोड़ा गया
  • शुरुआत में इसे “hash” कहा गया था, लेकिन extracted value में एक स्पष्ट pattern है और यह क्या समेटे हुए है, यह अभी स्पष्ट नहीं है

NISO tags और Sci-Hub में बचे रहने वाले निशान

  • PDF metadata में document status दिखाने वाले NISO tags शामिल होते हैं
    • document status को “final published version”(VoR) के रूप में दिखाया जाता है
    • यह किस domain पर मौजूद होना चाहिए, इसकी restrictions भी साथ शामिल होती हैं
  • Elsevier ऐसे metadata वाले PDF को scan करता है, इसलिए copies साझा करते समय metadata हटाना ज़रूरी है
  • ऐसा प्रतीत होता है कि Sci-Hub से मिले papers में भी यह metadata संरक्षित रहता है
  • अगर Sci-Hub, एकत्र किए गए academic credentials से papers डाउनलोड करता है, तो publisher इस metadata के जरिए उन accounts की पहचान कर सकता है जिन्हें बंद या सुरक्षित किया जाना चाहिए

अतिरिक्त watermarking की संभावना और verification results

  • metadata के अलावा अधिक परिष्कृत watermarking होने की संभावना बनी हुई है
  • अलग-अलग पहचान tags वाली दो files पर किए गए experiment के results:
    • metadata हटाया गया
    • qpdf के --deterministic-id flag से दोबारा linearize किया गया
    • resulting PDF diff पर एक जैसी निकली
  • सिर्फ इस result के आधार पर यह सामान्य निष्कर्ष निकालना सावधानी के बिना उचित नहीं कि अतिरिक्त watermarking नहीं है
  • metadata बड़े पैमाने पर PDF को तेज़ी से scan करने की सुविधा देता है, इसलिए यह विशेष रूप से ध्यान खींचने वाला पहचान माध्यम है

1 टिप्पणियां

 
GN⁺ 2024-06-11
Hacker News की राय
  • यह कल्पना होती है कि वे उन लोगों को ढूंढने के लिए इतनी मेहनत कर रहे हैं जिन्होंने ऐसे विचार साझा किए जिन्हें उन्होंने न बनाया, न फंड किया, ताकि उन्हें पैसे न देने के लिए सज़ा दी जा सके
    ऐसी कंपनियां बस मानवता की प्रगति में बाधा डालने वाली संस्थाएं लगती हैं

    • असल में यह इतना मुश्किल नहीं है, लेकिन मूल बात से सहमत हूं
      ऊपर से ऐसी कंपनियां रंगीन इमेज प्रिंटिंग जैसी अतिरिक्त सेवाओं के लिए भी लेखकों से बेहिसाब पैसे वसूलती हैं
      दूर भविष्य में स्कूलों और विश्वविद्यालयों में शायद ऐसी कंपनियों को सामाजिक परजीवियों के उदाहरण के रूप में पढ़ाया जाएगा
    • समस्या कंपनी अपने-आप में कम, एक लक्षण ज़्यादा है
      असली समस्या मेरे हिसाब से सरकारें हैं, खासकर अमेरिकी सरकार, जो बल-प्रयोग के एकाधिकार का इस्तेमाल करके ऐसी कंपनियों को ऐसे business model लागू कराने में मदद करती हैं
    • यह भी सोचना चाहिए कि एक किताब लिखने में कितनी मेहनत लगती है
      कुछ लेखक कई साल लगाते हैं, कई लेखक कम से कम 1 साल लगाते हैं, और कुछ विद्वान एक पेपर पर कई साल लगाते हैं
      Elsevier भी इस काम के उत्पादन और फंडिंग में काफी हद तक शामिल पार्टनर है, और वहां के कर्मचारी editing, typesetting और distribution संभालते हैं
      लेखक भी इस प्रक्रिया के पार्टनर हैं और कई बार Elsevier से royalties भी पाते हैं
      फिर भी कुछ लोग piracy को सही ठहराने के लिए तरह-तरह की जबरन दलीलें जोड़ते हैं
      अगर कोई गरीब लेखक है, तो यह मानना चाहिए कि अवैध copying उसकी लेखन की बिक्री से रोज़ी कमाने की क्षमता को कमजोर कर रही है
    • मज़ेदार है कि जब Elsevier copyright enforce करने की कोशिश करता है तो HN उसे शैतान बना देता है, लेकिन AI training data विषय आते ही अचानक लोग मेरे देखे सबसे सख्त intellectual property योद्धा बन जाते हैं
    • मेरी समझ में यह सिर्फ Elsevier की गलती नहीं है; समस्या वह ढांचा है जिसमें सरकार Elsevier journals में प्रकाशनों की संख्या के आधार पर research funding और promotions बांटती है
  • दस्तावेज़ सार्वजनिक करने से पहले दो अलग-अलग स्रोतों से copies लेकर hash की तुलना करना एक अच्छी आदत लगती है
    डेटा को image, audio file, PDF, program—कहीं भी छिपाया जा सकता है
    कम से कम Elsevier के मामले में यह काफी स्पष्ट दिखता है कि वे users को track करने के लिए key का इस्तेमाल कर रहे हैं

    • फिर भी PDF में cookie consent popup तो नहीं होता
      शायद उस कानून का आखिरकार उपयोगी इस्तेमाल हो सके
  • PDF files से संभावित malware हटाने के लिए इस्तेमाल होने वाला एक free open source tool DangerZone है, और यह metadata भी हटा सकता है
    सिर्फ metadata साफ करने के लिए यह शायद जरूरत से ज्यादा है, लेकिन उल्लेख करने लायक है
    https://dangerzone.rocks/

    • जरूरी नहीं कि समस्या सिर्फ metadata की ही हो
      पर्याप्त लंबी PDF में 128-bit identifier छिपाने के कई तरीके होते हैं
      सफेद background पर सफेद rectangle, जगह-जगह बहुत हल्के से non-black pixels आदि कुछ भी हो सकता है
      कई तरीके print करने के बाद scan करने पर भी बचे रह सकते हैं
  • PDF को overall साफ करने और size घटाने के लिए मैं एक छोटा script इस्तेमाल कर रहा हूं
    मोटे तौर पर यह ऐसा है
    pdftops -paper A4 -expand -level3 file.pdf
    ps2pdf14 -dEmbedAllFonts=true \
    -dUseFlateCompression=true \
    -dOptimize=true \
    -dProcessColorModel=/DeviceRGB \
    -r72 \
    -dDownsampleGrayImages=true \
    -dGrayImageResolution=150 \
    -dAutoFilterGrayImages=false \
    -dGrayImageDownsampleType=/Bicubic \
    -dDownsampleMonoImages=true \
    -dMonoImageResolution=150 \
    -dMonoImageDownsampleType=/Subsample \
    -dDownsampleColorImages=true \
    -dColorImageResolution=150 \
    -dAutoFilterColorImages=false \
    -dColorImageDownsampleType=/Bicubic \
    -dPDFSETTINGS=/ebook \
    -dNOSAFER \
    -dALLOWPSTRANSPARENCY \
    -dShowAnnots=false \
    file.pdf file.pdf
    जरूरत हो तो बाद में अतिरिक्त metadata डाला जा सकता है
    यह किसी खास tracking method को हटाने के लिए विशेष रूप से design नहीं किया गया है, लेकिन ज्यादातर मामलों में सरल और काफी उपयोगी है

  • Elsevier से PDF download करें, उसे अपने PDF viewer में खोलें, फिर print दबाएं और printer selection में Print to PDF चुन लें

    • step 0 के तौर पर Zone Identifier storage को disable करना होगा या किसी tool से मिटाना होगा
      यह जानकारी file copy करते समय बचे रहने की संभावना रखती है, और tool व format के हिसाब से compressed file के अंदर चली जाकर बाद में restore भी हो सकती है
      https://www.digital-detective.net/forensic-analysis-of-zone-...
      Total Commander plugins में से कुछ यह भी दिखाते हैं कि कोई खास file कहां से download हुई थी
      मैंने कई plugins install कर रखे हैं, इसलिए ठीक-ठीक कौन सा है पता नहीं, लेकिन शायद यह plugin होगा: https://totalcmd.net/plugring/ntfsstreamviewer.html
    • publisher से PDF download करें, PDF viewer में खोलें, print दबाएं, और सचमुच कागज़ पर print कर लें
      फिर print किए गए PDF pages को दोबारा scan करें, convert, pdfunite से PDF document में जोड़ें, और ghostscript से compress कर दें
    • ऐसा करने पर भी kerning, colors, line spacing आदि में छिपी संभावित सारी steganography जस की तस रह सकती है
    • Elsevier से PDF download करने के बाद pages को PNG images में convert करके, उन्हें नई PDF में जोड़कर फिर OCR चलाने का तरीका भी है
    • इससे बनी PDF में मौजूद tags और accessibility information पूरी तरह तबाह हो सकती है
      अगर आपको पूरा यकीन न हो कि यह वाकई जरूरी है, तो कृपया ऐसा न करें
  • यह इस विषय से जुड़ा है, इसलिए यहाँ छोड़ रहा हूँ
    https://github.com/kanzure/pdfparanoia
    और
    https://github.com/firstlookmedia/pdf-redact-tools

    • pdf-redact-tools पेज पर यह लिखा है: “Warning: This project is no longer maintained. A much better tool is dangerzone.”
      DangerZone का लिंक मूल रूप से सबमिट किए गए Mastodon थ्रेड में मिल सकता है
  • ऐसे tools बनाने चाहिए जो मानवता के ज्ञान को साझा और खोलने योग्य बनाएं

    • लगता है Sci-Hub के बारे में नहीं सुना
      https://en.m.wikipedia.org/wiki/Sci-Hub
      वैसे ऐसे fingerprints को अपने-आप हटाया जा सके तो अच्छा होगा
  • Elsevier और उसके जैसे संस्थान लगातार बचे रह सकते हैं, और लोग सचमुच ऐसे परजीवी systems को पैसे देते हैं—इस तथ्य के मूल कारणों को खोजकर विश्लेषण करना चाहिए
    संभावित सुराग यह हैं कि academia आखिरकार आलसी है और system को ठीक करने का इरादा नहीं रखती; researchers अपने research में इतने डूबे रहते हैं कि अपने काम से सीधे जुड़े न होने वाले कामों की quality बहुत खराब होती है; और ऐसे incentive structures मौजूद हैं जिनका फायदा उन लोगों को वापस मिलता है जो इस system को बनाए रखते हैं
    क्या कोई और सुराग है

    • field के हिसाब से मिला-जुला है
      उदाहरण के लिए, technology fields काफी हद तक open access journals की ओर शिफ्ट हो गई हैं, और researcher promotion के लिए भी यह ठीक से काम करता है
      लेकिन जब तक tenure जैसी चीजें Nature में publication पर निर्भर हैं, निकट भविष्य में Nature को हटाना मुश्किल होगा
  • metadata, document watermarking में बहुत आसान target है
    आम तौर पर PDF renderers spacing, kerning, invisible characters और तरह-तरह की steganography का इस्तेमाल करके हर copy को unique बना देते हैं
    hash का क्या मतलब होगा, यह समझ नहीं आता; असल में यह किसी secret value और unique copy को मिलाकर बनाया गया message authentication code होने की संभावना ज्यादा है
    इससे publisher को साफ़ की गई copy की पहचान करने में मदद मिलती है
    अगर दो या उससे ज्यादा copies हों तो फिर से anonymize किया जा सकता है, और सोचता हूँ कि summarization-style language models इस काम में उपयोगी हो सकते हैं या नहीं
    बेशक diagrams में भी steganographic variations डाले जा सकते हैं
    PDF एक messy document format है, इसलिए लगभग हमेशा उसे plain text में बदल देता हूँ, और आम तौर पर meaning का नुकसान नहीं होता

  • क्या यह practice EU में legal है

    • Elsevier एक Dutch company है और एक British company के स्वामित्व में है, इसलिए शायद कोई खास समस्या नहीं होगी