- 78,000 से अधिक फिल्मों का डेटा उपलब्ध कराने वाली The Numbers 5 मार्च 2026 को अचानक बंद हो गई, और 30 साल पुराने सिस्टम को निशाना बनाने वाले बड़े पैमाने के automated traffic तथा security probing के कारण पुरानी साइट को छोड़कर केवल न्यूनतम कार्यक्षमता बहाल की गई
- कुल ट्रैफ़िक में इंसानों की हिस्सेदारी केवल लगभग 10% थी, और दिसंबर 2025 से prompt-आधारित scraping तथा agentic AI traffic तेज़ी से बढ़ा, जिससे ऑपरेशंस टीम के काम के समय का लगभग 90% पुरानी साइट को चलाए रखने में लगने लगा
- लॉग में सामान्य scraping के साथ-साथ डेटा तक समय से पहले पहुंचने या उसमें हेरफेर करने की कोशिश जैसे दिखने वाले backdoor probing भी मिले, लेकिन वास्तविक outage का कारण और हमलावर की पहचान की पुष्टि नहीं हुई
- The Numbers का डेटा Polymarket के फिल्म box office prediction market के निपटान के आधार के रूप में इस्तेमाल होने लगा, जिससे public release से पहले डेटा मिलना trading advantage दे सकता है, और AI tools पुरानी साइटों की कमजोरियां सस्ते में खोज सकते हैं
- AI crawlers पाठकों को वापस लाए बिना भारी लागत और outage पैदा करके open web के आदान-प्रदान संबंध को तोड़ रहे हैं, और पुराना code तथा छोटी टीमों पर निर्भर स्वतंत्र archive, news, forum और reference sites खास तौर पर अधिक असुरक्षित हैं
फिल्म इंडस्ट्री की डेटा बुनियाद के गायब होने का एक हफ्ता
- The Numbers एक फिल्म डेटा साइट है जो box office revenue, production budget, home video और streaming data का सीधे शोध करके उपलब्ध कराती है, और जिसके सालाना 80 लाख से अधिक विज़िटर हैं
- पत्रकार, अकादमिक जगत, फिल्म निर्माता, prediction markets और Guinness World Records इसे एक प्रामाणिक स्रोत के रूप में इस्तेमाल करते हैं
- 2026 की शुरुआत में इसके डेटाबेस में 78,396 फिल्में, 178,375 theatrical release records और 236,176 लोगों की प्रविष्टियां थीं
- साइट 5 मार्च 2026 को बंद हुई और एक हफ्ते से अधिक समय तक वापस नहीं आई, फिर 13 मार्च को नए infrastructure पर एक सीमित संस्करण के रूप में बहाल की गई
- पुराने charts, फिल्म-विशिष्ट पेज और Report Builder हट गए, और केवल नवीनतम box office आंकड़ों पर केंद्रित न्यूनतम सुविधाएं बचीं
- बिना किसी ठोस स्पष्टीकरण के केवल rebuilding message दिखने पर उपयोगकर्ता नाराज़ हो गए, और यहां तक कि paid product conversion के लिए जानबूझकर features घटाने की आशंका भी उठी
1997 में शुरू हुआ 30 साल पुराना सिस्टम
- गणितज्ञ और IBM के पूर्व software developer Bruce Nash ने 17 अक्टूबर 1997 को 300 फिल्मों को ट्रैक करने वाली एक Geocities साइट शुरू की
- शुरुआत इस तरह हुई कि Access database से HTML बनाया जाता था, उसे Geocities पर डाला जाता था, और Hollywood Stock Exchange message board पर box office analysis साझा किया जाता था ताकि फिल्म stock trading में उसका उपयोग हो सके
- उस समय की 20वीं वर्षगांठ पर लिखी गई समीक्षा अब केवल Internet Archive के archived version में बची है
- दशकों में विस्तार पाई पुरानी साइट लगभग 1.6 लाख source files से करीब 20 लाख पेज उपलब्ध करा रही थी
AI crawlers से बने ट्रैफ़िक के दो बड़े झटके
- शुरुआती 25 वर्षों तक मुख्य विज़िटर इंसान, अपेक्षाकृत नियम मानने वाले search engines, और personal projects के लिए data collectors थे, और अत्यधिक scraping करने वालों को पहचानकर block किया जा सकता था
- पहला बदलाव 2024 के आसपास शुरू हुआ, जब AI training crawlers search engine scraping के साथ जुड़ गए
- AI crawlers search engines की तुलना में नियम कम मानते हैं, इसलिए साइट को स्थिर बनाए रखने के लिए management work बढ़ने लगा
- 2024 में पूरे web पर automated traffic इंसानी ट्रैफ़िक से आगे निकल गया, और बाद में Cloudflare के आंकड़ों में bots की हिस्सेदारी web page requests की 57.5% तक पहुंच गई
- दूसरी लहर दिसंबर 2025 के आसपास शुरू हुई, जब prompts के जवाब में साइट scrape करने वाले AI agents और users द्वारा बनाए गए agents ने ट्रैफ़िक को और बढ़ा दिया
- The Numbers के ट्रैफ़िक में सीधे इंसानी browsing का हिस्सा लगभग 10% था, बाकी AI bots और automated traffic थे
- दिसंबर से मार्च की शुरुआत तक टीम ने अपने काम के समय का लगभग 90% पुरानी साइट को बनाए रखने में लगाया और बचे समय में नया सिस्टम विकसित किया
crawlers को licensing path बताने वाली प्रतिक्रिया
- टीम ने साइट पर LLM द्वारा पढ़ी जा सकने वाली guidance जोड़ी, ताकि मॉडल सीधे data scrape करने के बजाय license खरीदने का तरीका बताएं
- इसके बाद data licensing inquiries लगभग 10 गुना बढ़ गईं
- ट्रैफ़िक कम करने के उपाय असरदार रहे, लेकिन 30 साल पुराने code और 1.6 लाख files की रक्षा करते हुए सेवा जारी रखने का ढांचागत बोझ खत्म नहीं हुआ
सर्वर बंद होने और security probing के निशान
- सर्वर 5 मार्च की भोर में ढह गया, और टीम ने शुरू में सिर्फ AI traffic load को कारण माना
- लॉग में सामान्य URL access के साथ backdoor खोजने की कोशिशें भी मिलीं
- संभव है कि कोई साइट पर public release से पहले data तक पहुंचना चाहता था, या users को दिखाए जाने वाले data में हेरफेर करना चाहता था
- कई महीनों तक automated scraping और probing चलती रही, लेकिन अंतिम outage किस वजह से हुआ और इसे किसने अंजाम दिया, इसकी पुष्टि नहीं हुई
- cybersecurity experts की सलाह पर पुराने सर्वर को दोबारा चालू नहीं किया गया
- backup restore करने का मतलब उन हमलावरों के सामने फिर से 1.6 लाख legacy files खोल देना होता, जिन्होंने शायद पहले से लंबे समय तक कमजोरियां खोजी थीं
- यह आकलन किया गया कि पुराना सर्वर दोबारा चालू होने के कुछ ही मिनटों में फिर बंद हो सकता है, इसलिए नए infrastructure पर न्यूनतम feature version बनाया गया
prediction market ने फिल्म डेटा को दिया मौद्रिक मूल्य
- Polymarket फिल्म opening weekend performance markets चलाता है और The Numbers के
Daily Box Office Performanceको market settlement standard के रूप में निर्दिष्ट करता है - अलग-अलग weekend markets आमतौर पर दसियों हजार से लेकर सैकड़ों हजार डॉलर तक के होते हैं, और एक साथ खुले फिल्म performance markets में कुल मिलाकर कई मिलियन डॉलर लगे हो सकते हैं
- अगर public release से पहले The Numbers का डेटा देखा जा सके, तो हर हफ्ते दूसरे traders से पहले नतीजे जानकर advance trading की जा सकती है
- prediction markets लगभग हर डेटा को आर्थिक मूल्य में बदल सकते हैं, सस्ते AI tools साइट intrusion की तकनीकी बाधा घटा देते हैं, और बड़े पैमाने के agent bots पुरानी web infrastructure की कमजोरियों को बढ़ा देते हैं
AI ने cyber attack की entry barrier घटाई
- Anthropic ने नवंबर 2025 में AI द्वारा समन्वित पहला documented cyber espionage campaign सार्वजनिक किया
- state-backed group ने लगभग 30 संस्थानों पर हमला किया, और AI ने काम का 80~90% किया
- हर campaign में इंसान केवल 4~6 decision points पर शामिल हुए
- sophisticated cyber attacks की बाधा काफी कम हो चुकी है और आगे भी कम होती दिखती है
- Anthropic की पिछली threat report के अनुसार, कम तकनीकी क्षमता वाले अपराधी भी AI की मदद से ransomware development जैसे जटिल काम कर रहे हैं, जिनके लिए पहले कई वर्षों का प्रशिक्षण चाहिए होता था
- autonomous AI penetration testing tool XBOW ने लगभग 1,060 vulnerabilities submit कीं और HackerOne की अमेरिकी रैंकिंग में नंबर 1 पर पहुंच गया
- 30 साल पुरानी साइट, जिसमें ज्ञात कमजोरियां होने की संभावना अधिक है, AI tools के लिए सस्ते में जांचने लायक attack surface बन जाती है, और जो expertise barrier पहले छोटी साइटों की रक्षा करती थी, वह काफी कमजोर हो गई है
The Numbers ने शुरू किया पूरा rebuild
- public site बंद हो गई, लेकिन The Numbers के core revenue sources प्रभावित नहीं हुए, इसलिए business खुद कायम है
- free site पिछले कुछ वर्षों में advertising पर बहुत अधिक निर्भर नहीं थी
- bulk data बेचने वाली OpusData, फिल्म निर्माताओं और निवेशकों के लिए comparative analysis reports, और Business Report इसके मुख्य व्यवसाय हैं
- 78,396 फिल्में, 178,375 release records और 236,176 लोगों की जानकारी देने वाली वेबसाइट को शून्य से फिर बनाना पड़ रहा है, इसलिए सभी features एक साथ बहाल नहीं हो पा रहे हैं
- टीम ने 2026 के public website users को छह श्रेणियों में बांटा है
- इंसान
- search engines
- LLM training workloads
- prompt-आधारित AI traffic
- agentic AI
- prediction market traders
- पहले जहां content, ads और SEO तीन तत्वों पर ध्यान था, अब हर design decision में लगभग 8~10 factors पर विचार करना पड़ता है
- नई साइट का लक्ष्य है कि वह सभी छह user types को support करे, OpusData service और Business Report subscriber features जोड़े, और आम उपयोगकर्ताओं को पुराना डेटा बेहतर रूप में लौटाए
crawling की लागत और लौटकर न आने वाले विज़िटर
- Cloudflare के platform-wise data में यह अंतर बहुत बड़ा था कि एक recommended visitor लाने के लिए साइट कितनी crawling सहती है
- Google एक visitor पर लगभग 5 pages crawl करता है
- OpenAI 1,000 से अधिक pages crawl करता है
- Anthropic 38,000 से अधिक pages crawl करता है
- search engines जो content पढ़ने के बदले पाठकों को भेजते थे, वह open web का आदान-प्रदान संबंध AI crawlers के मामले में काम नहीं करता
- बड़े पैमाने की scraping छोटी साइटों की bandwidth cost बढ़ा सकती है और पूरी service बंद करा सकती है
दूसरी साइटों को हुआ बड़े पैमाने की scraping का नुकसान
- Read the Docs में एक crawler ने एक महीने में compressed HTML के 73TB डाउनलोड किए, जिससे bandwidth cost 5,000 डॉलर से अधिक हुई
- iFixit ने Anthropic crawler से एक दिन में 10 लाख requests दर्ज कीं
- 7 कर्मचारियों वाली 3D scan बेचने वाली कंपनी Triplegangers business hours के दौरान OpenAI bot की वजह से बंद हो गई, और CEO ने इसे वस्तुतः DDoS attack बताया
- SourceHut के operator हर हफ्ते अपने काम के समय का 20~100% AI crawlers से निपटने में लगाते हैं और प्रति सप्ताह दर्जनों छोटे outages झेलते हैं
- Linux news site LWN ने लाखों IPs से आने वाले crawler traffic को distributed denial-of-service attack माना
- GNOME open source project द्वारा मापे गए ट्रैफ़िक का लगभग 97% bots था
- एक university library को अपनी catalog service बनाए रखने के लिए 48 घंटों में 16,000 IP addresses block करने पड़े
Wikipedia की लागत और घटते पाठक
- Wikimedia Foundation ने अप्रैल 2025 में गणना की कि bots Wikipedia pageviews का लगभग 35% हैं, लेकिन सबसे महंगे processing traffic में उनकी हिस्सेदारी कम से कम 65% है
- क्योंकि crawlers बड़ी मात्रा में उन पेजों को भी ले जाते हैं जिन्हें इंसान लगभग पढ़ते ही नहीं, इसलिए उनकी लागत हिस्सेदारी और अधिक हो जाती है
- छह महीने बाद Wikipedia के human pageviews साल-दर-साल लगभग 8% घटे
- उपयोगकर्ता Wikipedia पर सीधे जाने के बजाय AI summaries से ज्ञान लेने लगे
- AI systems एक तरफ बड़े पैमाने पर content ले रहे हैं, और दूसरी तरफ मूल साइट को मिलने वाले पाठक भी घटा रहे हैं
पुराना इंटरनेट जिन मान्यताओं पर बना था, वे टूट रही हैं
- AI tools शक्तिशाली होने के साथ विनाशकारी भी हैं, और उन्हें वास्तविक दुनिया में आम लोग रीयल-टाइम में परख रहे हैं
- पुराना open web इन मान्यताओं पर बना था, लेकिन अब ये सभी वर्तमान स्थिति से मेल नहीं खातीं
- अधिकांश विज़िटर इंसान होते हैं
- ट्रैफ़िक मोटे तौर पर पाठकों की संख्या के अनुपात में होता है
- साइट चलाने की लागत, ऑपरेटर को मिलने वाले मूल्य से जुड़ी होती है
- AI की उपयोगिता से इनकार करने की बात अलग है, लेकिन मौजूदा web उस ताकत और पैमाने के लिए तैयार नहीं था जो publicly accessible AI models लेकर आए हैं
crawling पर शुल्क और default block के प्रयोग
- Cloudflare ने pay-per-crawl लॉन्च किया, जिसमें साइटें AI crawlers से प्रति page शुल्क ले सकती हैं
- इसके बाद उसने pay-per-use मॉडल की घोषणा की, जिसमें content के AI answers में वास्तव में इस्तेमाल होने पर publishers को भुगतान मिलता है
- 15 सितंबर से Cloudflare ग्राहकों के ad-supported pages पर बिना भुगतान वाले
mixed-usecrawlers default रूप से blocked रहेंगे - इन नीतियों की सफलता इस बात पर निर्भर करेगी कि AI कंपनियां तकनीकी bypass किए बिना billing framework में भाग लेती हैं या नहीं
पूरी independent web ecosystem के लिए चेतावनी
- The Numbers ने अत्यधिक machine traffic और संभावित intrusion के बीच अपनी पूरी साइट खो दी, लेकिन क्योंकि public website उसका पूरा business नहीं थी, वह बच सकी
- जर्मन textile company ZEGO 37 साल से चल रही थी, लेकिन मार्च के cyber attack के बाद 6 हफ्तों तक production बंद रहने पर उसने insolvency filing की
- independent archives, hobby databases, local news, forums और reference sites पुराना code तथा छोटी टीमों या व्यक्तिगत operators पर निर्भर रहते हुए सामूहिक ज्ञान को संजोए हुए हैं
- The Numbers बेहतर संरचना के साथ वापसी की कोशिश कर रही है, और पुराने इंटरनेट के लिए बनी छोटी साइटों का इस्तेमाल करते रहना और उन्हें support करना अब सीधे उनके अस्तित्व से जुड़ गया है
1 टिप्पणियां
Hacker News टिप्पणियां
गंभीरता से पूछें तो, क्या prediction markets TheNumbers.com के लिए नई revenue stream नहीं बन सकते? संभव है कि कुछ हमलावर release से पहले के आंकड़े हासिल करके prediction markets में पक्की जानकारी के आधार पर bet लगाना चाहते रहे हों
यह साफ़ तौर पर insider trading है और बेहद अनैतिक है, लेकिन PolyMarket CEO ने कभी कहा भी था कि insider trading सेवा के उद्देश्य का हिस्सा है: https://youtu.be/ZN4njIQcSR4?si=ztyTtgjeHSJbNjSZ&t=1566
मुख्य बात सिर्फ़ यह नहीं है कि agents साइट पर लगातार request मार रहे हैं, बल्कि यह है कि वहां exploit की जा सकने वाली संभावित vulnerabilities हैं। साइट बंद होने के बाद डेटा और design को काफ़ी घटाकर वापस आई, इसकी वजह भी यही है
अगर कोई malicious user The Numbers के release से पहले के डेटा तक पहुंच जाए, तो वह हर हफ्ते बाकी traders से पहले जवाब जानकर front-run कर सकता है
Reddit पर यह अटकल देखकर कि यह free site को खराब करके users को paid product की ओर धकेलने की जानबूझकर की गई rug pull थी, सोचने लगा हूं कि आगे free resources और कम तो नहीं हो जाएंगे
पहले मैं छोटे tools open source में जारी करता था, इस उम्मीद में कि कोई उन्हें मिलते-जुलते problems हल करने में इस्तेमाल करेगा, लेकिन अब यह जानकर कि उन्हें scrape करके training data बनाया जाएगा और बाद में monetize किया जाएगा, free web में योगदान देने से हिचक होती है। उपयोगी free sites चलाने वालों का नाराज़ होना स्वाभाविक है
बात सिर्फ़ इतनी नहीं कि काम का इस्तेमाल खराब तरीके से हो रहा है, बल्कि maintenance cost और time बढ़कर वास्तविक नुकसान भी पहुंचा रहे हैं
कुछ साल पहले COVID-19 के दौरान अमेरिकी सरकार की small business grants और DOJ द्वारा indict किए गए fraudulent loans खोजने वाली site चलाई थी। पूरा public data करीब 10GB था और free में download किया जा सकता था; donations कुल मिलाकर करीब 2,000 डॉलर थे
लेकिन AI crawlers ने first screen पर मौजूद full download link के बजाय search conditions के हर combination पर pages घूम-घूमकर दर्जनों terabytes HTML download कर लिया। CloudFront cache और efficient backend के बावजूद सिर्फ़ monthly network cost करीब 1,000 डॉलर हो गई, इसलिए अगले महीने site बंद कर दी
हालांकि payment miss हो जाए तो server करीब एक हफ्ते के भीतर delete हो सकता है, इसलिए कभी भी overdue न होने दें
बदले हुए traffic mix से निपटने के लिए क्या open source technical patterns और libraries की जरूरत नहीं है? लाखों छोटी sites और creators के पास large-scale automated access से खुद बचाव करने की क्षमता नहीं है, और content जितना उपयोगी होता है, उतनी ही aggressive crawling होती है, जिससे operating cost और instability बढ़ते हैं
agents की identification, rate limiting, traffic classification, access policies, cache, verification procedures, logging, provenance checks और usage control शामिल करने वाले community management tools की जरूरत है। हर operator के अकेले नया बनाने के बजाय, आज के automated traffic के हिसाब से मजबूत common rules देने चाहिए
infected smart TVs और phones के proxy access को खुले तौर पर बेचने वाली companies भी हैं, तो क्या ऐसी IP databases बनाकर block नहीं किया जा सकता? block notice के जरिए घर के infected devices की जांच कराने को प्रेरित किया जाए, तो root cause से निपटने की संभावना है: https://news.ycombinator.com/item?id=49000864
आखिरकार बात existing traffic surge control tools पर लौट आती है। सुझाए गए tools Slashdot effect, DDoS और excessive search engine crawling रोकने के लिए दशकों से इस्तेमाल होते रहे हैं, और Cloudflare जैसी companies पहले से इस क्षेत्र में आगे हैं
AI companies सचमुच costs को socialize और profits को privatize करती हैं। The Numbers जैसी sites AI हमले झेलने की लागत उठाती हैं, लेकिन AI companies से उन्हें बदले में कुछ नहीं मिलता
अगर crawlers high-quality full data के लिए licensing fee देते, तो समस्या नहीं होती, लेकिन मुख्य बात यह है कि वे release से पहले के data तक पहुंचने के लिए vulnerabilities तक ढूंढने लगे
मुफ्त सार्वजनिक हिस्से को static site generator से दोबारा बनाकर bot-aware CDN के साथ जोड़ने के लिए यह साइट आदर्श लगती है। ऐसा करने पर लगता है कि इसे उचित लागत पर लंबे समय तक चलाया जा सकता है
मौजूदा और नई architecture, और साइट को बनाए रखने के लिए अपनाई गई mitigation तथा scaling रणनीतियों के बारे में भी जिज्ञासा है
2000 के दशक की ढीली-ढाली PHP sites भी प्रति सेकंड करीब 200 requests संभालती थीं, static sites 1,000 से ज़्यादा, और Node.js cooperative threading के साथ प्रति सेकंड 100,000 requests का दावा करता था। इसके उलट आज की sites ORM और N+1 समस्या के कारण सैकड़ों से हज़ारों database queries चलाती हैं, response में 500ms से ज़्यादा लगता है और 1,000 concurrent users पर भी बोझ महसूस होता है
language और database से स्वतंत्र Russian doll cache और dependent data की सटीक cache invalidation आम नहीं हो पाई। Laravel के touch events और Redis query cache तक आज़माए, लेकिन cache invalidation असल में अब भी अनसुलझी समस्या है; इसे खुद implement करने के बजाय शुरू से ही packages और sharding जैसी रणनीतियों पर विचार करना चाहिए
web को BitTorrent की तरह नज़दीकी peers से content पाने वाला P2P content-addressed storage बनना चाहिए था, लेकिन HTTPS/SSL और browser security model बाधा बने। trust network या zero-knowledge proofs तक की ज़रूरत पड़ सकती है, इसलिए फिलहाल लगता है कि हम पुराने ढर्रे के human verification screen में फंसे रहेंगे
2015 में मैंने Applaudience शुरू किया था, जो उस समय real-time movie ticket sales data देने वाला इकलौता service था, और calibration के दौरान TheNumbers.com के आंकड़ों से तुलना किया करता था
अब मैं दूसरा business करता हूं, लेकिन अपनी बनाई technologies में यह अब भी मेरी सबसे पसंदीदा है, इसलिए किसी दिन इसे फिर से जीवित करना चाहता हूं
बड़ी AI companies के crawlers को
robots.txtमें क्रमशःClaudeBot,Claude-SearchBot,Claude-User,GPTBot,OAI-SearchBot,PerplexityBot,Google-Extended,Google-Extended-Factual,Bingbotके लिएDisallow: /सेट करके block किया जा सकता हैcrawl-delaysupport करता ताकि server की स्थिति के हिसाब से adjust किया जा सके, लेकिन वह support नहीं करता: https://developers.google.com/crawling/docs/robots-txt/robots-txt-spec#syntaxblock करने पर search से आने वाला traffic भी और घटता दिखता है
नतीजतन अधिकतर subdirectory URLs पर एक-एक अनावश्यक request जुड़ जाती थी
मैं पुराने रूसी radio broadcasts को archive करने वाली छोटी site http://radar.lv चलाता हूं; पहले US traffic 5% था, लेकिन हाल में 90% traffic US से आ रहा है
अच्छा है कि मैं महीने में 1TB तक संभाल सकता हूं, और crawling से मुझे अपने-आप में आपत्ति नहीं है, लेकिन actual visitors की stability को लेकर चिंता है। सोच रहा हूं कि Cloudflare का हाल में बनाया गया visitor payment feature चालू करूं या नहीं
personal blog में मैं static generator इस्तेमाल करता हूं, लेकिन इस archive की समस्या यह है कि यह पुराना Drupal इस्तेमाल करता है, जिसके security patches कई सालों से बंद हैं