- Reddit ने Old Reddit के लॉगआउट उपयोग को malicious scraping और automated traffic का प्रमुख स्रोत मानते हुए लॉगिन अनिवार्य करना शुरू किया है, लेकिन New Reddit अब भी लॉगआउट अवस्था में एक्सेस किया जा सकता है
- Old Reddit पोस्ट और टिप्पणियों को ज्यादातर सामान्य HTML में देता है और लगभग 1MB डाउनलोड तथा 0.5MB अपलोड करता है, जबकि JavaScript पर निर्भर New Reddit लगभग 5 गुना अधिक डेटा लोड करता है
- सीमित browser प्रयोगों में New Reddit से भी कुछ JavaScript और comment API requests के जरिए टिप्पणी टेक्स्ट मिल सका, इसलिए यह पुष्ट नहीं है कि यह बदलाव वास्तव में scraping रोकता है
- Old Reddit शुरुआत में ही 200 टिप्पणियाँ लोड करता है, जबकि New Reddit केवल 25 लोड करता है और scroll के बाद भी लगभग 35 तक ही पहुँचता है, इसलिए scraper के लिए अधिक संक्षिप्त Old Reddit को पसंद करने की वजह साफ है
- अस्पष्ट ‘सुरक्षा’ तर्क देने के बजाय scraping को हतोत्साहित करने या सेवा बंद करने का उद्देश्य सीधे बताना चाहिए था, और लॉगिन अनिवार्य करना उन उपयोगकर्ताओं के लिए अनावश्यक बाधा बनाता है जो इंसानों द्वारा लिखे गए search results पढ़ना चाहते हैं
Reddit और इंसानों द्वारा लिखे गए search results
- Reddit को कई लोकप्रिय forums होस्ट करते हुए user-created communities से अधिकतम मूल्य निकालने वाली कंपनी के रूप में देखा जाता है
- LLM युग में मानव-निर्मित डेटा का मूल्य बढ़ने के साथ Reddit communities की पोस्ट और भी महत्वपूर्ण संपत्ति बन गई हैं
- पहले का Reddit API विवाद भी community से मूल्य वापस लेने की कोशिश का उदाहरण था
- search query में
site: reddit.comजोड़ने पर असली लोगों द्वारा लिखे गए नतीजे ढूँढना आसान हो जाता है, इसलिए Reddit का सक्रिय उपयोग न करने पर भी उसके search results पर जाना उपयोगी बना रहता था
Old Reddit पर लॉगिन की मांग
old.reddit.comReddit के पुराने design का frontend है, लेकिन अब लॉगआउट अवस्था में इसका सामान्य उपयोग कठिन हो गया है- Firefox और NoScript का उपयोग करने वाले कुछ उपयोगकर्ताओं ने बार-बार यह अनुभव किया है कि जो product ठीक से काम करता था, वह support बंद होने से बाहर धकेल दिया जाता है
- 8 साल पुराना फ़ोन और 10 साल पुराना tablet पुराने operating system के कारण अनुपयोगी हो गए
- app store से हटाए गए Stack Exchange app का इस्तेमाल किया जाने वाला API भी बंद कर दिया गया
- Reddit ने इस कदम को “Reddit को सुरक्षित रखने के लिए” बताया, लेकिन ज्ञान तक पहुँचना चाहने वाले उपयोगकर्ता platform के लिए किस तरह का ख़तरा हैं, यह स्पष्ट नहीं है
Reddit द्वारा बताई गई scraping समस्या
- Reddit की आधिकारिक घोषणा के अनुसार Old Reddit का लॉगआउट उपयोग malicious scraping और automated traffic का प्रमुख स्रोत है
- New Reddit लॉगआउट अवस्था में भी उपलब्ध है, इसलिए केवल Old Reddit को सीमित करने का कारण अब भी सवालों में है
- संबंधित comments के मुताबिक malicious traffic के तरीके लगातार बदलते रहते हैं, जिससे block और bypass का चक्र चलता रहता है; बाद में पहचानना आसान है, लेकिन पहले से रोकना कठिन है
- यह व्याख्या भी सामने आई कि Old Reddit में modern security stack नहीं है, इसलिए automated traffic से निपटना कठिन है; Reddit admin ने इसे ही अपने जवाब के रूप में उद्धृत किया
Old Reddit का काम करने का तरीका और data transfer
- लॉगिन के बाद घोषणा thread की जाँच में पाया गया कि Old Reddit user content को ज्यादातर सामान्य HTML में उपलब्ध कराता है
- अतिरिक्त टिप्पणियाँ लोड करने के अलावा JavaScript के बिना भी पेज पढ़ा जा सकता है
- मापा गया पेज लगभग 1MB डाउनलोड और 0.5MB अपलोड करता था, और response का अधिकतर हिस्सा HTML था
- response आने में लगभग 2 सेकंड लगे और आकार की तुलना में यह GitHub से लगभग 4 गुना धीमा था
- यह rate limit के कारण था या Reddit मूल रूप से ही धीमा है, यह स्पष्ट नहीं हो सका
- अतिरिक्त comment requests संक्षिप्त और तेज़ थीं, और सामान्य web page से अलग कोई स्पष्ट सुरक्षा समस्या भी नहीं मिली
New Reddit की JavaScript पर निर्भरता
- New Reddit JavaScript के बिना पोस्ट के अलावा लगभग कोई content लोड नहीं कर पाता
- कुल loading मात्रा Old Reddit की लगभग 5 गुना थी; सटीक security mechanism को bypass करने के बजाय browser में content लाने के लिए आवश्यक न्यूनतम requests ही छोड़ी गईं
- केवल ये requests अनुमति देने पर भी पेज स्वयं लोड हो गया
- filter लगाने पर अतिरिक्त टिप्पणियों का बटन loading में अटका रहा, लेकिन वास्तविक request response में comment text मौजूद था
- केवल पेज का JavaScript चलाकर और ज़रूरी requests भेजकर comment जानकारी मिल सकती है, इसलिए JavaScript execution scraper को रोकने की मुख्य बाधा है या नहीं, यह अस्पष्ट है
CAPTCHA और user behavior transmission
- पेज को कई बार refresh करने और comments व replies लोड करने के दौरान अधिकांश प्रयास विफल नहीं हुए
- filter हटाने वाले एक प्रयोग में redirect के साथ CAPTCHA field query parameter के रूप में भेजी गई, लेकिन वही व्यवहार दोबारा नहीं दोहराया जा सका
- comment API को सीधे बार-बार call करने पर CAPTCHA आता है या नहीं, यह भी पुष्टि नहीं हुई
- New Reddit उपयोगकर्ता के scroll करने या cursor हिलाने पर हर बार Reddit को heartbeat signal भेजता है
scraping रोकने के असर की सीमाएँ
- यह frontend की सुरक्षा समस्या से अधिक Reddit का अपनी मूल्यवान user-generated data की scraping कठिन बनाने वाला कदम लगता है
- यह साबित नहीं हुआ कि New Reddit को अब भी scrape किया जा सकता है, हालांकि Old Reddit की तुलना में काम कठिन होना संभव है
- scraper के Old Reddit को पसंद करने की वजह है कि पेज अधिक संक्षिप्त है और शुरुआती comment loading अधिक है
- Old Reddit शुरुआत में ही 200 comments लोड करता है
- New Reddit पहले 25 comments लोड करता है और scroll पर अपने-आप लगभग 35 तक बढ़ता है
- New Reddit ने सामान्य HTML-केंद्रित पुराने interface को web components आदि पर निर्भर लगभग 5 गुना भारी संरचना में बदल दिया है, जिससे browser को अधिक data लेना और अधिक काम करना पड़ता है
- इससे browser पर बोझ बढ़ाकर scraping की लागत भी बढ़ी हो सकती है, लेकिन वास्तविक blocking प्रभाव की पुष्टि नहीं हुई
‘सुरक्षा’ तर्क पर प्रतिक्रिया
- अगर Reddit चुपचाप
old.reddit.comपर 30X·40X response लागू कर देता या कहता कि उपयोगकर्ता कम हैं इसलिए इसे हटाया जा रहा है, तो यह अप्रिय होते हुए भी अनुमानित निर्णय होता - वास्तविक उपयोगकर्ताओं से सीधे असंबंधित अस्पष्ट security·scraping तर्क देकर पहले से काम कर रहे access तरीके को छीन लेना और बड़ी प्रतिक्रिया का कारण बना
- Anubis जैसी स्थिति में, जहाँ आवश्यकता समझ में आती है, JavaScript सक्षम करने की इच्छा हो सकती है; इसलिए असंतोष का मूल JavaScript नहीं बल्कि स्पष्टीकरण और कार्रवाई के बीच का असंगत संबंध है
- निजी blogs भी Old Reddit की तरह सामान्य HTML में टेक्स्ट देते हैं, लेकिन Reddit की user-generated content से अलग वे मूल रूप से संचालक की अपनी सामग्री होते हैं
बचे हुए विकल्प और चिंताएँ
- लॉगिन करना संभव है, लेकिन जिस प्रक्रिया की पहले ज़रूरत नहीं थी उसे अब अनिवार्य किए जाने पर असंतोष बना हुआ है
- शायद New Reddit का उपयोग करना पड़े, और यह भी स्पष्ट नहीं कि Reddit Old Reddit का support आगे भी जारी रखेगा या नहीं
- चिंता यह भी है कि अगर Reddit को संभव लगा तो भविष्य में New Reddit का लॉगआउट access भी बंद किया जा सकता है
- लोग ऐसी इंटरनेट दुनिया चाहते हैं जहाँ इंसानों द्वारा लिखे गए टेक्स्ट को सीधे खोजकर पढ़ा जा सके, न कि उसे पढ़ने के लिए विशाल और महंगे LLM के रास्ते से गुजरना पड़े
- संबंधित चर्चा Lobste.rs पर भी पोस्ट की गई है
1 टिप्पणियां
Lobste.rs की राय
सोशल मीडिया की enshittification दिखाने वाला सबसे अच्छा उदाहरण पुराने Reddit से नए Reddit में बदलाव है। पुराना वर्ज़न भले पुराना लगता था, लेकिन तेज़ और बिना फालतू चीज़ों के था; ब्राउज़र पर बोझ डाले बिना दर्जनों replies लोड कर सकता था और RES या Toolbox जैसे tools से असुविधाजनक हिस्सों को सुधारा भी जा सकता था।
हर कुछ महीनों में मैं नया वर्ज़न फिर से आज़माता हूं, लेकिन लगभग 15 साल से सदस्य होने के बावजूद उससे तालमेल बैठाना मुश्किल है। दो विशाल sidebars जगह घेर लेते हैं, पोस्ट खोलने की प्रक्रिया धीमी और उलझाऊ है, और कभी-कभी comment threads लोड होते-होते पेज refresh हो जाता है, जिससे context खो जाता है।
इमेज पोस्टिंग, voting, नए moderation tools जैसे अच्छे features भी हैं, लेकिन फिर भी मैं पुराना वर्ज़न ही इस्तेमाल करता हूं। कंपनी फिर से user convenience को प्राथमिकता देगी, इसकी संभावना भी नहीं दिखती; और पुराने वर्ज़न को अनिश्चितकाल तक support करने वाली उनकी स्थिति का हाल में “अभी तो नहीं” तक कमजोर पड़ जाना भी अशुभ संकेत है।
जिस /r/rust में मैं अक्सर भाग लेता हूं, उसके भी moderators और long-time users में से ज़्यादातर को खोकर बिखर जाने की काफी संभावना है। Rust के mature और बहुत ज़्यादा mainstream हो जाने से 10 साल पहले की तुलना में quality भी बहुत गिर गई है। नया Reddit कंपनी की इच्छित दिशा के लिए ज्यादा उपयुक्त है, लेकिन पुराने web के लिए यह बिना उम्मीद वाला, पूरी तरह अलग product है।
मुख्य समस्या यह है कि messaging में “server पर scraping load कम करने के लिए” नहीं, बल्कि “security के लिए” लिखा गया है। आजकल website operators के लिए scraping load एक बिल्कुल वाजिब चिंता है, और बाकी बातें भले जायज़ झुंझलाहट हों, तत्काल मुद्दे से कुछ दूर हैं।
Philips Hue lighting app ने भी कई सालों तक banner दिखाया कि वह account के बिना lights control करने नहीं देगा, “security के लिए”। असली security तो सारी communication को मेरे network के भीतर रखने में है, न कि home network के devices को control करने के लिए external servers और external authentication system को घसीटने में। शुक्र है, अभी तक यह सिर्फ warning ही रही है और account के बिना भी ठीक काम करता है।
Scrapers से प्रभावित छोटे sites के लिए अफसोस है, लेकिन Reddit के लिए खास सहानुभूति नहीं होती। अगर Google आदि ने API access के लिए भारी रकम चुकाई है, तो जब तक Old Reddit बनाए रखने लायक है, non-login access को support करते रहने का कोई कारण न दिखना अजीब है। लगता है CAPTCHA redirect भी देखा है; इसे Old Reddit में जोड़ना इतना कठिन है क्या, इस पर भी सवाल है।
निंदक अंदाज़ में अंदाज़ा लगाऊं तो किसी ने Old Reddit पर 2-second rate limit लगा दी, फिर scraping numbers वैसे ही देखे और उसे बंद करने का फैसला कर लिया; अंदरूनी टकराव के बाद शायद यही compromise निकला।
इस क्षेत्र में साफ़-साफ़ झूठ बोलना बेतुकी हद तक आम है और बहुत बार सहन कर लिया जाता है। Cloudflare भी कुछ महीने पहले तक “example.com पर आगे बढ़ने से पहले connection security की समीक्षा करनी होगी” दिखाता था; हाल ही में ही उसने ज्यादा ईमानदारी से कहना शुरू किया कि malicious bot blocking service user को verify कर रही है।
Google द्वारा XSLT हटाने का justification भी कुछ ऐसा ही था। पहले उसने security को मुख्य कारण बताया, लेकिन असली removal शुरू करने से पहले extension के रूप में पूरी तरह compatible replacement देकर उसने अपने ही security logic को निष्प्रभावी कर दिया। फिर भी actual removal phase में वह लगातार “security के लिए” कहता रहा; उसे दूसरे वैध कारण ईमानदारी से बताने चाहिए थे। समस्या यह नहीं कि सभी browser vendors XSLT हटाना चाहते थे, बल्कि Google ने इसे जिस तरह package किया, वही खटकता है।
कंपनियों को किसी भी चीज़ को “safety के लिए” कहना पसंद है। बहुत पहले एक convenience store में मुझे बताया गया कि छोटी portable bag लेकर अंदर नहीं जा सकते, मेरी और दूसरे customers की safety के लिए। खाली bag से किसी को मारा भी जा सकता है और शायद कभी robbery भी हुई हो, लेकिन वास्तविक चिंता लगभग निश्चित रूप से चोरी थी।
अगर वे ईमानदारी से “safety” को “profit margin बनाए रखने और बढ़ाने के लिए” से बदल देते, तो मैं कहीं ज्यादा सम्मान करता। Business का मकसद पैसा कमाना है, यह स्वाभाविक है।
libredirect जैसे redirect plugins के साथ redlib, libreddit, teddit जैसे Reddit read-only privacy frontends इस्तेमाल किए जा सकते हैं। उन interfaces के developers को छोड़कर किसी और को Reddit की ताज़ा मनमानी सीधे झेलने की ज़रूरत नहीं है।
old.reddit.com इस्तेमाल करने से sexual topics ही नहीं, बल्कि दूसरे sensitive content वाले 18+ subreddits की login wall को भी bypass किया जा सकता है।
Reddit account के बिना किसी खास topic तक पहुंचना चाहने वालों के लिए यह बदलाव और खराब है। Reddit अब भी बहुत बड़ा resource है, इसलिए search query में मैं अक्सर site:reddit.com जोड़ता हूं।
Reddit ने JSON API भी हटा दी, जिससे lurker(https://tangled.org/oppi.li/lurker) जैसे tools भी बंद हो गए, जो account, login wall और JavaScript के बिना Reddit देखने देते थे। पता था कि यह दिन कभी आएगा, और लगता है high-quality user-generated data ही Reddit की defensive wall है।
Old Reddit Reddit के business interests के लिए भी “safe” नहीं है। नया Reddit अब phone पर सीधे काम करने से मना कर देता है और app download की ओर मजबूर करता है; app में सामान्य ad blockers भी काम नहीं करते, इसलिए Reddit को browser की तुलना में कहीं ज्यादा control मिलता है। इसके उलट पुरानी site अभी भी mobile पर usable है।
Reddit और HN पर भी मैंने बहुत सारे साफ़ bots और promotional marketing देखे हैं। Online जिन कुछ जगहों पर मैं interact करता हूं, उनमें से एक lobste.rs है, क्योंकि वहां अधिकतर लोग सचमुच इंसान लगते हैं।
Mobile पर नए Reddit के comments कुछ देर पढ़ने के बाद एक non-closable app install wall आ जाती है, जो “Reddit app में बेहतर है” कहकर मजबूर करती है। App install किए बिना इससे बचने का एकमात्र तरीका Old Reddit है।
बड़े ध्यान से बनाई गई mobile website को एक-दो pages से ज़्यादा देखना शायद “unsafe” है, और Old Reddit को बंद करना app install funnel के इस छेद को बंद करने की कोशिश लगता है।