1 पॉइंट द्वारा GN⁺ 5 시간 전 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • 78,000 से अधिक फिल्मों का डेटा उपलब्ध कराने वाली The Numbers 5 मार्च 2026 को अचानक बंद हो गई, और 30 साल पुराने सिस्टम को निशाना बनाने वाले बड़े पैमाने के automated traffic तथा security probing के कारण पुरानी साइट को छोड़कर केवल न्यूनतम कार्यक्षमता बहाल की गई
  • कुल ट्रैफ़िक में इंसानों की हिस्सेदारी केवल लगभग 10% थी, और दिसंबर 2025 से prompt-आधारित scraping तथा agentic AI traffic तेज़ी से बढ़ा, जिससे ऑपरेशंस टीम के काम के समय का लगभग 90% पुरानी साइट को चलाए रखने में लगने लगा
  • लॉग में सामान्य scraping के साथ-साथ डेटा तक समय से पहले पहुंचने या उसमें हेरफेर करने की कोशिश जैसे दिखने वाले backdoor probing भी मिले, लेकिन वास्तविक outage का कारण और हमलावर की पहचान की पुष्टि नहीं हुई
  • The Numbers का डेटा Polymarket के फिल्म box office prediction market के निपटान के आधार के रूप में इस्तेमाल होने लगा, जिससे public release से पहले डेटा मिलना trading advantage दे सकता है, और AI tools पुरानी साइटों की कमजोरियां सस्ते में खोज सकते हैं
  • AI crawlers पाठकों को वापस लाए बिना भारी लागत और outage पैदा करके open web के आदान-प्रदान संबंध को तोड़ रहे हैं, और पुराना code तथा छोटी टीमों पर निर्भर स्वतंत्र archive, news, forum और reference sites खास तौर पर अधिक असुरक्षित हैं

फिल्म इंडस्ट्री की डेटा बुनियाद के गायब होने का एक हफ्ता

  • The Numbers एक फिल्म डेटा साइट है जो box office revenue, production budget, home video और streaming data का सीधे शोध करके उपलब्ध कराती है, और जिसके सालाना 80 लाख से अधिक विज़िटर हैं
    • पत्रकार, अकादमिक जगत, फिल्म निर्माता, prediction markets और Guinness World Records इसे एक प्रामाणिक स्रोत के रूप में इस्तेमाल करते हैं
    • 2026 की शुरुआत में इसके डेटाबेस में 78,396 फिल्में, 178,375 theatrical release records और 236,176 लोगों की प्रविष्टियां थीं
  • साइट 5 मार्च 2026 को बंद हुई और एक हफ्ते से अधिक समय तक वापस नहीं आई, फिर 13 मार्च को नए infrastructure पर एक सीमित संस्करण के रूप में बहाल की गई
    • पुराने charts, फिल्म-विशिष्ट पेज और Report Builder हट गए, और केवल नवीनतम box office आंकड़ों पर केंद्रित न्यूनतम सुविधाएं बचीं
    • बिना किसी ठोस स्पष्टीकरण के केवल rebuilding message दिखने पर उपयोगकर्ता नाराज़ हो गए, और यहां तक कि paid product conversion के लिए जानबूझकर features घटाने की आशंका भी उठी

1997 में शुरू हुआ 30 साल पुराना सिस्टम

  • गणितज्ञ और IBM के पूर्व software developer Bruce Nash ने 17 अक्टूबर 1997 को 300 फिल्मों को ट्रैक करने वाली एक Geocities साइट शुरू की
    • शुरुआत इस तरह हुई कि Access database से HTML बनाया जाता था, उसे Geocities पर डाला जाता था, और Hollywood Stock Exchange message board पर box office analysis साझा किया जाता था ताकि फिल्म stock trading में उसका उपयोग हो सके
    • उस समय की 20वीं वर्षगांठ पर लिखी गई समीक्षा अब केवल Internet Archive के archived version में बची है
  • दशकों में विस्तार पाई पुरानी साइट लगभग 1.6 लाख source files से करीब 20 लाख पेज उपलब्ध करा रही थी

AI crawlers से बने ट्रैफ़िक के दो बड़े झटके

  • शुरुआती 25 वर्षों तक मुख्य विज़िटर इंसान, अपेक्षाकृत नियम मानने वाले search engines, और personal projects के लिए data collectors थे, और अत्यधिक scraping करने वालों को पहचानकर block किया जा सकता था
  • पहला बदलाव 2024 के आसपास शुरू हुआ, जब AI training crawlers search engine scraping के साथ जुड़ गए
    • AI crawlers search engines की तुलना में नियम कम मानते हैं, इसलिए साइट को स्थिर बनाए रखने के लिए management work बढ़ने लगा
    • 2024 में पूरे web पर automated traffic इंसानी ट्रैफ़िक से आगे निकल गया, और बाद में Cloudflare के आंकड़ों में bots की हिस्सेदारी web page requests की 57.5% तक पहुंच गई
  • दूसरी लहर दिसंबर 2025 के आसपास शुरू हुई, जब prompts के जवाब में साइट scrape करने वाले AI agents और users द्वारा बनाए गए agents ने ट्रैफ़िक को और बढ़ा दिया
    • The Numbers के ट्रैफ़िक में सीधे इंसानी browsing का हिस्सा लगभग 10% था, बाकी AI bots और automated traffic थे
    • दिसंबर से मार्च की शुरुआत तक टीम ने अपने काम के समय का लगभग 90% पुरानी साइट को बनाए रखने में लगाया और बचे समय में नया सिस्टम विकसित किया

crawlers को licensing path बताने वाली प्रतिक्रिया

  • टीम ने साइट पर LLM द्वारा पढ़ी जा सकने वाली guidance जोड़ी, ताकि मॉडल सीधे data scrape करने के बजाय license खरीदने का तरीका बताएं
    • इसके बाद data licensing inquiries लगभग 10 गुना बढ़ गईं
  • ट्रैफ़िक कम करने के उपाय असरदार रहे, लेकिन 30 साल पुराने code और 1.6 लाख files की रक्षा करते हुए सेवा जारी रखने का ढांचागत बोझ खत्म नहीं हुआ

सर्वर बंद होने और security probing के निशान

  • सर्वर 5 मार्च की भोर में ढह गया, और टीम ने शुरू में सिर्फ AI traffic load को कारण माना
  • लॉग में सामान्य URL access के साथ backdoor खोजने की कोशिशें भी मिलीं
    • संभव है कि कोई साइट पर public release से पहले data तक पहुंचना चाहता था, या users को दिखाए जाने वाले data में हेरफेर करना चाहता था
    • कई महीनों तक automated scraping और probing चलती रही, लेकिन अंतिम outage किस वजह से हुआ और इसे किसने अंजाम दिया, इसकी पुष्टि नहीं हुई
  • cybersecurity experts की सलाह पर पुराने सर्वर को दोबारा चालू नहीं किया गया
    • backup restore करने का मतलब उन हमलावरों के सामने फिर से 1.6 लाख legacy files खोल देना होता, जिन्होंने शायद पहले से लंबे समय तक कमजोरियां खोजी थीं
    • यह आकलन किया गया कि पुराना सर्वर दोबारा चालू होने के कुछ ही मिनटों में फिर बंद हो सकता है, इसलिए नए infrastructure पर न्यूनतम feature version बनाया गया

prediction market ने फिल्म डेटा को दिया मौद्रिक मूल्य

  • Polymarket फिल्म opening weekend performance markets चलाता है और The Numbers के Daily Box Office Performance को market settlement standard के रूप में निर्दिष्ट करता है
  • अलग-अलग weekend markets आमतौर पर दसियों हजार से लेकर सैकड़ों हजार डॉलर तक के होते हैं, और एक साथ खुले फिल्म performance markets में कुल मिलाकर कई मिलियन डॉलर लगे हो सकते हैं
  • अगर public release से पहले The Numbers का डेटा देखा जा सके, तो हर हफ्ते दूसरे traders से पहले नतीजे जानकर advance trading की जा सकती है
  • prediction markets लगभग हर डेटा को आर्थिक मूल्य में बदल सकते हैं, सस्ते AI tools साइट intrusion की तकनीकी बाधा घटा देते हैं, और बड़े पैमाने के agent bots पुरानी web infrastructure की कमजोरियों को बढ़ा देते हैं

AI ने cyber attack की entry barrier घटाई

  • Anthropic ने नवंबर 2025 में AI द्वारा समन्वित पहला documented cyber espionage campaign सार्वजनिक किया
    • state-backed group ने लगभग 30 संस्थानों पर हमला किया, और AI ने काम का 80~90% किया
    • हर campaign में इंसान केवल 4~6 decision points पर शामिल हुए
    • sophisticated cyber attacks की बाधा काफी कम हो चुकी है और आगे भी कम होती दिखती है
  • Anthropic की पिछली threat report के अनुसार, कम तकनीकी क्षमता वाले अपराधी भी AI की मदद से ransomware development जैसे जटिल काम कर रहे हैं, जिनके लिए पहले कई वर्षों का प्रशिक्षण चाहिए होता था
  • autonomous AI penetration testing tool XBOW ने लगभग 1,060 vulnerabilities submit कीं और HackerOne की अमेरिकी रैंकिंग में नंबर 1 पर पहुंच गया
  • 30 साल पुरानी साइट, जिसमें ज्ञात कमजोरियां होने की संभावना अधिक है, AI tools के लिए सस्ते में जांचने लायक attack surface बन जाती है, और जो expertise barrier पहले छोटी साइटों की रक्षा करती थी, वह काफी कमजोर हो गई है

The Numbers ने शुरू किया पूरा rebuild

  • public site बंद हो गई, लेकिन The Numbers के core revenue sources प्रभावित नहीं हुए, इसलिए business खुद कायम है
    • free site पिछले कुछ वर्षों में advertising पर बहुत अधिक निर्भर नहीं थी
    • bulk data बेचने वाली OpusData, फिल्म निर्माताओं और निवेशकों के लिए comparative analysis reports, और Business Report इसके मुख्य व्यवसाय हैं
  • 78,396 फिल्में, 178,375 release records और 236,176 लोगों की जानकारी देने वाली वेबसाइट को शून्य से फिर बनाना पड़ रहा है, इसलिए सभी features एक साथ बहाल नहीं हो पा रहे हैं
  • टीम ने 2026 के public website users को छह श्रेणियों में बांटा है
    • इंसान
    • search engines
    • LLM training workloads
    • prompt-आधारित AI traffic
    • agentic AI
    • prediction market traders
  • पहले जहां content, ads और SEO तीन तत्वों पर ध्यान था, अब हर design decision में लगभग 8~10 factors पर विचार करना पड़ता है
  • नई साइट का लक्ष्य है कि वह सभी छह user types को support करे, OpusData service और Business Report subscriber features जोड़े, और आम उपयोगकर्ताओं को पुराना डेटा बेहतर रूप में लौटाए

crawling की लागत और लौटकर न आने वाले विज़िटर

  • Cloudflare के platform-wise data में यह अंतर बहुत बड़ा था कि एक recommended visitor लाने के लिए साइट कितनी crawling सहती है
    • Google एक visitor पर लगभग 5 pages crawl करता है
    • OpenAI 1,000 से अधिक pages crawl करता है
    • Anthropic 38,000 से अधिक pages crawl करता है
  • search engines जो content पढ़ने के बदले पाठकों को भेजते थे, वह open web का आदान-प्रदान संबंध AI crawlers के मामले में काम नहीं करता
  • बड़े पैमाने की scraping छोटी साइटों की bandwidth cost बढ़ा सकती है और पूरी service बंद करा सकती है

दूसरी साइटों को हुआ बड़े पैमाने की scraping का नुकसान

  • Read the Docs में एक crawler ने एक महीने में compressed HTML के 73TB डाउनलोड किए, जिससे bandwidth cost 5,000 डॉलर से अधिक हुई
  • iFixit ने Anthropic crawler से एक दिन में 10 लाख requests दर्ज कीं
  • 7 कर्मचारियों वाली 3D scan बेचने वाली कंपनी Triplegangers business hours के दौरान OpenAI bot की वजह से बंद हो गई, और CEO ने इसे वस्तुतः DDoS attack बताया
  • SourceHut के operator हर हफ्ते अपने काम के समय का 20~100% AI crawlers से निपटने में लगाते हैं और प्रति सप्ताह दर्जनों छोटे outages झेलते हैं
  • Linux news site LWN ने लाखों IPs से आने वाले crawler traffic को distributed denial-of-service attack माना
  • GNOME open source project द्वारा मापे गए ट्रैफ़िक का लगभग 97% bots था
  • एक university library को अपनी catalog service बनाए रखने के लिए 48 घंटों में 16,000 IP addresses block करने पड़े

Wikipedia की लागत और घटते पाठक

  • Wikimedia Foundation ने अप्रैल 2025 में गणना की कि bots Wikipedia pageviews का लगभग 35% हैं, लेकिन सबसे महंगे processing traffic में उनकी हिस्सेदारी कम से कम 65% है
    • क्योंकि crawlers बड़ी मात्रा में उन पेजों को भी ले जाते हैं जिन्हें इंसान लगभग पढ़ते ही नहीं, इसलिए उनकी लागत हिस्सेदारी और अधिक हो जाती है
  • छह महीने बाद Wikipedia के human pageviews साल-दर-साल लगभग 8% घटे
    • उपयोगकर्ता Wikipedia पर सीधे जाने के बजाय AI summaries से ज्ञान लेने लगे
    • AI systems एक तरफ बड़े पैमाने पर content ले रहे हैं, और दूसरी तरफ मूल साइट को मिलने वाले पाठक भी घटा रहे हैं

पुराना इंटरनेट जिन मान्यताओं पर बना था, वे टूट रही हैं

  • AI tools शक्तिशाली होने के साथ विनाशकारी भी हैं, और उन्हें वास्तविक दुनिया में आम लोग रीयल-टाइम में परख रहे हैं
  • पुराना open web इन मान्यताओं पर बना था, लेकिन अब ये सभी वर्तमान स्थिति से मेल नहीं खातीं
    • अधिकांश विज़िटर इंसान होते हैं
    • ट्रैफ़िक मोटे तौर पर पाठकों की संख्या के अनुपात में होता है
    • साइट चलाने की लागत, ऑपरेटर को मिलने वाले मूल्य से जुड़ी होती है
  • AI की उपयोगिता से इनकार करने की बात अलग है, लेकिन मौजूदा web उस ताकत और पैमाने के लिए तैयार नहीं था जो publicly accessible AI models लेकर आए हैं

crawling पर शुल्क और default block के प्रयोग

  • Cloudflare ने pay-per-crawl लॉन्च किया, जिसमें साइटें AI crawlers से प्रति page शुल्क ले सकती हैं
  • इसके बाद उसने pay-per-use मॉडल की घोषणा की, जिसमें content के AI answers में वास्तव में इस्तेमाल होने पर publishers को भुगतान मिलता है
  • 15 सितंबर से Cloudflare ग्राहकों के ad-supported pages पर बिना भुगतान वाले mixed-use crawlers default रूप से blocked रहेंगे
  • इन नीतियों की सफलता इस बात पर निर्भर करेगी कि AI कंपनियां तकनीकी bypass किए बिना billing framework में भाग लेती हैं या नहीं

पूरी independent web ecosystem के लिए चेतावनी

  • The Numbers ने अत्यधिक machine traffic और संभावित intrusion के बीच अपनी पूरी साइट खो दी, लेकिन क्योंकि public website उसका पूरा business नहीं थी, वह बच सकी
  • जर्मन textile company ZEGO 37 साल से चल रही थी, लेकिन मार्च के cyber attack के बाद 6 हफ्तों तक production बंद रहने पर उसने insolvency filing की
  • independent archives, hobby databases, local news, forums और reference sites पुराना code तथा छोटी टीमों या व्यक्तिगत operators पर निर्भर रहते हुए सामूहिक ज्ञान को संजोए हुए हैं
  • The Numbers बेहतर संरचना के साथ वापसी की कोशिश कर रही है, और पुराने इंटरनेट के लिए बनी छोटी साइटों का इस्तेमाल करते रहना और उन्हें support करना अब सीधे उनके अस्तित्व से जुड़ गया है

1 टिप्पणियां

 
GN⁺ 5 시간 전
Hacker News टिप्पणियां
  • गंभीरता से पूछें तो, क्या prediction markets TheNumbers.com के लिए नई revenue stream नहीं बन सकते? संभव है कि कुछ हमलावर release से पहले के आंकड़े हासिल करके prediction markets में पक्की जानकारी के आधार पर bet लगाना चाहते रहे हों
    यह साफ़ तौर पर insider trading है और बेहद अनैतिक है, लेकिन PolyMarket CEO ने कभी कहा भी था कि insider trading सेवा के उद्देश्य का हिस्सा है: https://youtu.be/ZN4njIQcSR4?si=ztyTtgjeHSJbNjSZ&t=1566

  • मुख्य बात सिर्फ़ यह नहीं है कि agents साइट पर लगातार request मार रहे हैं, बल्कि यह है कि वहां exploit की जा सकने वाली संभावित vulnerabilities हैं। साइट बंद होने के बाद डेटा और design को काफ़ी घटाकर वापस आई, इसकी वजह भी यही है
    अगर कोई malicious user The Numbers के release से पहले के डेटा तक पहुंच जाए, तो वह हर हफ्ते बाकी traders से पहले जवाब जानकर front-run कर सकता है

    • अगर prediction market traders नतीजों को front-run करने की कोशिश कर रहे थे, तो prediction market पक्ष को market बंद होने से पहले एक तय trading halt buffer time रखकर इसे रोकना चाहिए
  • Reddit पर यह अटकल देखकर कि यह free site को खराब करके users को paid product की ओर धकेलने की जानबूझकर की गई rug pull थी, सोचने लगा हूं कि आगे free resources और कम तो नहीं हो जाएंगे
    पहले मैं छोटे tools open source में जारी करता था, इस उम्मीद में कि कोई उन्हें मिलते-जुलते problems हल करने में इस्तेमाल करेगा, लेकिन अब यह जानकर कि उन्हें scrape करके training data बनाया जाएगा और बाद में monetize किया जाएगा, free web में योगदान देने से हिचक होती है। उपयोगी free sites चलाने वालों का नाराज़ होना स्वाभाविक है

    • दूसरों की sites scrape करके monetize करना large language models के चलन से पहले से हो रहा था; बदला है तो बस scale
      बात सिर्फ़ इतनी नहीं कि काम का इस्तेमाल खराब तरीके से हो रहा है, बल्कि maintenance cost और time बढ़कर वास्तविक नुकसान भी पहुंचा रहे हैं
    • हाल ही में GitHub पर 200 stars पाने वाले open source project को private कर दिया। दूसरे projects उसका आधार बनाकर attribution दें, यह ठीक था, लेकिन large language models सब कुछ चूस लेते हैं, process करते हैं और फिर उसे अपना बनाकर पेश करते हैं
    • अगर लोग आखिरकार कहीं और पैसे देकर उस data तक पहुंचेंगे, तो उसे free में क्यों दिया जाए? AI के अंधाधुंध इस्तेमाल की वजह से पूरा internet अत्यधिक लालच की ओर जा सकता है, कुछ वैसा ही जैसे Google ने लोगों की search results के page 2 पर न जाने की आदत का फायदा उठाकर छोटी sites को खत्म किया
    • मैं चाहता हूं कि models मेरे software पर train होकर बेहतर हों, इसलिए जितना संभव हो उतना open source में जारी करता हूं
    • अगली AGPL, शायद सामान्य GPL में भी source material का उपयोग करके closed models की training पर रोक स्पष्ट रूप से लिखी होगी। आदर्श रूप से, open weights models को भी रोकना चाहिए अगर वे पूरी training प्रक्रिया साझा नहीं करते
  • कुछ साल पहले COVID-19 के दौरान अमेरिकी सरकार की small business grants और DOJ द्वारा indict किए गए fraudulent loans खोजने वाली site चलाई थी। पूरा public data करीब 10GB था और free में download किया जा सकता था; donations कुल मिलाकर करीब 2,000 डॉलर थे
    लेकिन AI crawlers ने first screen पर मौजूद full download link के बजाय search conditions के हर combination पर pages घूम-घूमकर दर्जनों terabytes HTML download कर लिया। CloudFront cache और efficient backend के बावजूद सिर्फ़ monthly network cost करीब 1,000 डॉलर हो गई, इसलिए अगले महीने site बंद कर दी

    • BigQuery के public datasets इस्तेमाल करने पर, users complex SQL चलाएं तब भी cost user भरता है, और provider को सिर्फ़ storage cost देनी होती है
    • Hetzner dedicated server में inbound और outbound unlimited हैं, और server auction में लगभग 40 डॉलर प्रति माह में high-performance machine मिल सकती है
      हालांकि payment miss हो जाए तो server करीब एक हफ्ते के भीतर delete हो सकता है, इसलिए कभी भी overdue न होने दें
    • वे AI crawlers नहीं, बल्कि security services बेचने और existing browser monopoly को मजबूत करने के लिए public opinion बनाने वाले DDoS attackers हो सकते हैं
    • AWS पर infrastructure बनाना एक financial time bomb जैसा है
    • जानना चाहूंगा कि AI crawlers ने search engines जैसे existing crawlers की तुलना में इतना ज्यादा load क्यों डाला। क्या वे ज्यादा thorough तरीके से crawl करते थे, या ज्यादा बार आते थे
  • बदले हुए traffic mix से निपटने के लिए क्या open source technical patterns और libraries की जरूरत नहीं है? लाखों छोटी sites और creators के पास large-scale automated access से खुद बचाव करने की क्षमता नहीं है, और content जितना उपयोगी होता है, उतनी ही aggressive crawling होती है, जिससे operating cost और instability बढ़ते हैं
    agents की identification, rate limiting, traffic classification, access policies, cache, verification procedures, logging, provenance checks और usage control शामिल करने वाले community management tools की जरूरत है। हर operator के अकेले नया बनाने के बजाय, आज के automated traffic के हिसाब से मजबूत common rules देने चाहिए

    • botnets के खिलाफ collective response चाहिए। अपनी identity बताने और rules मानने वाले अच्छे bots को block करना आसान है, लेकिन real users जैसा व्यवहार करने और residential proxies के पीछे छिपने वाले malicious bots को रोकना लगभग असंभव है
      infected smart TVs और phones के proxy access को खुले तौर पर बेचने वाली companies भी हैं, तो क्या ऐसी IP databases बनाकर block नहीं किया जा सकता? block notice के जरिए घर के infected devices की जांच कराने को प्रेरित किया जाए, तो root cause से निपटने की संभावना है: https://news.ycombinator.com/item?id=49000864
    • community का समाधान robots.txt compliance था, लेकिन यह legal obligation नहीं बल्कि gentlemen's agreement था, इसलिए AI crawlers ने उसे ignore किया
      आखिरकार बात existing traffic surge control tools पर लौट आती है। सुझाए गए tools Slashdot effect, DDoS और excessive search engine crawling रोकने के लिए दशकों से इस्तेमाल होते रहे हैं, और Cloudflare जैसी companies पहले से इस क्षेत्र में आगे हैं
    • मुझे नहीं लगता कि इस problem का कोई technocratic solution है। अमीर लोग बिना किसी खास वजह के पैसे के दम पर internet को DDoS कर रहे हैं, इसलिए जिम्मेदार लोगों को ढूंढकर fine या jail देनी चाहिए। शुरुआत residential proxy providers से की जा सकती है
  • AI companies सचमुच costs को socialize और profits को privatize करती हैं। The Numbers जैसी sites AI हमले झेलने की लागत उठाती हैं, लेकिन AI companies से उन्हें बदले में कुछ नहीं मिलता

    • हालांकि कहा गया कि site में large language models के लिए guidance जोड़ने के बाद license inquiries 10 गुना बढ़ गईं। actual contract payments हुए या नहीं, article में नहीं है
      अगर crawlers high-quality full data के लिए licensing fee देते, तो समस्या नहीं होती, लेकिन मुख्य बात यह है कि वे release से पहले के data तक पहुंचने के लिए vulnerabilities तक ढूंढने लगे
    • सिर्फ़ बदले में कुछ नहीं मिलता ऐसा नहीं, बल्कि extra costs भी उठानी पड़ती हैं
  • मुफ्त सार्वजनिक हिस्से को static site generator से दोबारा बनाकर bot-aware CDN के साथ जोड़ने के लिए यह साइट आदर्श लगती है। ऐसा करने पर लगता है कि इसे उचित लागत पर लंबे समय तक चलाया जा सकता है
    मौजूदा और नई architecture, और साइट को बनाए रखने के लिए अपनाई गई mitigation तथा scaling रणनीतियों के बारे में भी जिज्ञासा है

    • यह समस्या 20 साल पहले Varnish Cache और Coral CDN से पहले ही हल हो चुकी थी। bots बस यह दिखाते हैं कि हाल के web servers कितने अक्षम हो गए हैं
      2000 के दशक की ढीली-ढाली PHP sites भी प्रति सेकंड करीब 200 requests संभालती थीं, static sites 1,000 से ज़्यादा, और Node.js cooperative threading के साथ प्रति सेकंड 100,000 requests का दावा करता था। इसके उलट आज की sites ORM और N+1 समस्या के कारण सैकड़ों से हज़ारों database queries चलाती हैं, response में 500ms से ज़्यादा लगता है और 1,000 concurrent users पर भी बोझ महसूस होता है
      language और database से स्वतंत्र Russian doll cache और dependent data की सटीक cache invalidation आम नहीं हो पाई। Laravel के touch events और Redis query cache तक आज़माए, लेकिन cache invalidation असल में अब भी अनसुलझी समस्या है; इसे खुद implement करने के बजाय शुरू से ही packages और sharding जैसी रणनीतियों पर विचार करना चाहिए
      web को BitTorrent की तरह नज़दीकी peers से content पाने वाला P2P content-addressed storage बनना चाहिए था, लेकिन HTTPS/SSL और browser security model बाधा बने। trust network या zero-knowledge proofs तक की ज़रूरत पड़ सकती है, इसलिए फिलहाल लगता है कि हम पुराने ढर्रे के human verification screen में फंसे रहेंगे
    • approach के लिहाज़ से, लगभग static publishing भर से भी बेहतरीन security model बनाया जा सकता है, और लगता है वैसे भी rewrite का समय आ चुका था। large language models की मदद से अब यह शायद एक weekend का काम भी हो सकता है
  • 2015 में मैंने Applaudience शुरू किया था, जो उस समय real-time movie ticket sales data देने वाला इकलौता service था, और calibration के दौरान TheNumbers.com के आंकड़ों से तुलना किया करता था
    अब मैं दूसरा business करता हूं, लेकिन अपनी बनाई technologies में यह अब भी मेरी सबसे पसंदीदा है, इसलिए किसी दिन इसे फिर से जीवित करना चाहता हूं

  • बड़ी AI companies के crawlers को robots.txt में क्रमशः ClaudeBot, Claude-SearchBot, Claude-User, GPTBot, OAI-SearchBot, PerplexityBot, Google-Extended, Google-Extended-Factual, Bingbot के लिए Disallow: / सेट करके block किया जा सकता है

    • यह सिर्फ नियम मानने वाले crawlers पर काम करता है। smart TV या mobile apps जैसे consumer devices का उपयोग करने वाले, और कभी-कभी internet connectivity देने के बदले reward तक देने वाले bots इसका पालन नहीं करते। hack किए गए toothbrush जैसे devices तक इस्तेमाल किए जाने की संभावना है: https://news.ycombinator.com/item?id=49000864
    • उपयोगी है, लेकिन यह करीब-करीब या तो सब allow करो या सब block करो वाली पद्धति है। अच्छा होता अगर Google crawl-delay support करता ताकि server की स्थिति के हिसाब से adjust किया जा सके, लेकिन वह support नहीं करता: https://developers.google.com/crawling/docs/robots-txt/robots-txt-spec#syntax
      block करने पर search से आने वाला traffic भी और घटता दिखता है
    • ClaudeBot में कम-से-कम पिछले महीने तक directory URL के आखिर की slash हटाने वाला bug था। link में slash होने के बावजूद वह उसे हटाकर request करता, फिर Caddy का redirect पाकर सही URL फिर से request करता था
      नतीजतन अधिकतर subdirectory URLs पर एक-एक अनावश्यक request जुड़ जाती थी
    • चल रहे site network के bot traffic में 90% residential bots के ज़रिए headless Chrome है और practically block नहीं किया जा सकता। Google तक इसे रोक नहीं पाता, जिससे AdSense numbers तक फूल जाते हैं
    • यह बचाव वैसा ही है जैसे lunchbox पर “मत खाना” का sticker लगा देने से मैं नहीं खाऊंगा
  • मैं पुराने रूसी radio broadcasts को archive करने वाली छोटी site http://radar.lv चलाता हूं; पहले US traffic 5% था, लेकिन हाल में 90% traffic US से आ रहा है
    अच्छा है कि मैं महीने में 1TB तक संभाल सकता हूं, और crawling से मुझे अपने-आप में आपत्ति नहीं है, लेकिन actual visitors की stability को लेकर चिंता है। सोच रहा हूं कि Cloudflare का हाल में बनाया गया visitor payment feature चालू करूं या नहीं
    personal blog में मैं static generator इस्तेमाल करता हूं, लेकिन इस archive की समस्या यह है कि यह पुराना Drupal इस्तेमाल करता है, जिसके security patches कई सालों से बंद हैं