- सभी प्लान के ग्राहक automated traffic को Search·Agent·Training में बांटकर allow या block कर सकते हैं, जिससे पहले के एकमुश्त AI bot blocking की तुलना में ज्यादा granular policy setting संभव होगी
- वर्गीकरण का आधार AI इस्तेमाल है या नहीं, यह नहीं, बल्कि साइट पर की जाने वाली गतिविधि और content का उपयोग है; multi-purpose crawlers पर सभी संबंधित नियम लागू होंगे और purpose-specific crawlers को अलग करने की सिफारिश की गई है
- 15 सितंबर 2026 से नए domains के ad-displaying pages पर Training और Agent default रूप से block होंगे और Search allow होगा; Googlebot·Applebot·BingBot जैसे multi-purpose crawlers पर सबसे restrictive rule लागू होगा
- Enterprise Bot Management के लिए BotBase में known bots और agents की classification व detection ID search की जा सकती है, और
immediate·reference·full content use levels तथा robots.txt का use signal भी पेश किया गया है
- Verified का मतलब अब automatic allow नहीं है; RFC 7239 के
Forwarded header का उपयोग करके transitive trust के जरिए operator और content use method को intermediary layers से आगे तक पहुंचाने की कोशिश की जा रही है
AI traffic को use-case के हिसाब से control करने की जरूरत क्यों है
- पहले web crawling का रिश्ता साइट content इकट्ठा करने के बदले search referrals लौटाने वाला था, लेकिन AI training में content ले लिया जाता है और site owner को value वापस नहीं मिलती, यह समस्या रही है
- Cloudflare ने एक साल पहले one-click Block AI Bots option और Pay-Per-Crawl marketplace launch किया था
- Content owners original content को protect करना और compensation पाना चाहते हैं, लेकिन सभी automation को blanket block करने से यह जरूरत पूरी करना मुश्किल है
- छोटे sites search exposure पाने के लिए AI training भी allow करने, या training रोकने के बदले discoverability खोने जैसी choice में फंस सकते हैं
- यह मौजूदा search providers के पक्ष में संरचना है, जो search और training के लिए वही bots इस्तेमाल करते हैं
- Competitive gap घटाने की कोशिश कर रहे नए providers के लिए detection से बचने की incentive पैदा होती है
- Google Search जैसी services, जो results page पर सीधे answer देती हैं, आने के साथ यह ज्यादा महत्वपूर्ण criterion बन गया है कि bot AI है या नहीं, बजाय इसके कि वह क्या करता है, क्या store करता है और क्या redistribute करता है
Search·Agent·Training classification
- सभी customers द्वारा manage किए जा सकने वाले AI-केंद्रित use cases को तीन प्रकारों में बांटा गया है
- Search: content को पहले से collect या index कर बाद के questions का जवाब देता है, और site owner referral traffic या उसके बराबर compensation की उम्मीद कर सकता है
- Agent: इंसान की ओर से real-time tasks करता है; इसमें ChatGPT-User जैसे chat collection bots और Gemini·Claude द्वारा Chrome को operate करने वाले browser agents शामिल हैं
- Training: content लेकर model को train या fine-tune करता है, और data AI-based structure में स्थायी रूप से absorb होकर performance improvement में इस्तेमाल होता है
- एक crawler के कई purposes हो सकते हैं, इसलिए सभी लागू classifications को साथ में track किया जाता है
- Search index building, agent tasks और model training तीनों करने वाले operators को purpose-wise तीन crawlers में अलग करने की सलाह दी गई है, ताकि visit purpose और access rights साफ तौर पर बताए जा सकें
- Ad verification, feed fetching, agent transactions जैसी automated activities को भी अलग से classify किया जाता है, लेकिन Search·Agent·Training के लिए ऐसी functions दी जाती हैं जिन्हें सभी site owners सीधे manage कर सकें
सभी plans में उपलब्ध controls और नए defaults
- मौजूदा Block AI Bots preset मुख्य रूप से model training के लिए single-purpose bots को block करता था, लेकिन नई settings Search·Agent·Training-specific controls Free plan तक देती हैं
- 15 सितंबर 2026 से Cloudflare पर नए register होने वाले domains के ad-displaying pages पर ये defaults लागू होंगे
- Training और Agent default रूप से block होंगे
- Search default रूप से allow होगा
- Ads ऐसा monetization signal हैं जिन्हें humans के page पर जाकर देखने के लिए design किया गया है, इसलिए human attention में बाधा डाल सकने वाले Training और Agent को block किया जाएगा
- Search visitors को site पर लाने वाले behavior के सबसे करीब है, इसलिए default रूप से allow होगा
- Search और Training साथ करने वाले multi-purpose crawler पर सबसे restrictive rule पहले लागू होगा
- Training block चुनने वाले customers के लिए Googlebot·Applebot·BingBot भी block होंगे
- यह नए AI traffic management options और मौजूदा Block AI Bots service दोनों पर लागू होगा
- Existing customers 15 सितंबर से पहले Security settings में opt-out दिखाकर Search भी करने वाले Training crawlers के लिए existing settings बनाए रख सकते हैं
BotBase द्वारा दी जाने वाली bot visibility और behavior classification
- Enterprise Bot Management में जोड़ा गया BotBase known automated traffic का searchable database है, जिसमें Verified bots और agents शामिल हैं
- Cloudflare dashboard में पूरी Verified bots·agents list और नई classifications देखी जा सकती हैं
- किसी specific bot के traffic को filter किया जा सकता है
- Detection ID copy कर Security rules में इस्तेमाल की जा सकती है
- Dedicated screen Bot Management configuration card से access की जा सकती है
- शुरुआत में focus visibility पर है, और 2026 के दूसरे half में इसे site के known automated content को सीधे control करने वाले management center तक expand करने की योजना है
- BotBase bots को site पर कर सकने वाले behaviors के अनुसार एक या अधिक categories देता है
- Search: search results exposure के लिए crawling
- Agent: user instructions के आधार पर pages visit करने वाला agent
- Training: model training या fine-tuning के लिए crawling
- Transact: user की ओर से payment tasks
- Data Collection: price collection, competitive intelligence collection, third-party analytics
- Security Testing: vulnerability scans और penetration testing
- SEO: SEO crawling, site audits, accessibility checks
- Ads Verification: ad placement verification और ad fraud detection
- Social / Link Preview: social platforms और messaging apps के link previews
- Feed Fetching: RSS readers, podcast collectors, news feed bots
- Monitoring & Operations: uptime monitoring, webhooks, health checks
Content use levels और robots.txt signals
- Bots द्वारा collect किए गए content को store और reuse करने के तरीके को content use level से manage करने की function develop की जा रही है
immediate: सिर्फ interact करता है, store या reuse नहीं करता
reference: index करता है, कुछ हिस्से quote करता है और original text से link करता है; यह default है
full: summarize और reproduce कर सकता है
- Bot classification और content use level को combine करके “Search·SEO·Ads Verification allow करें, लेकिन सिर्फ
reference तक” जैसी policies बनाई जा सकती हैं
- Individual bots के लिए rules लिखे बिना behavior group level पर access तय किया जा सकता है
- Content Signals को extend करने वाले
use signal को robots.txt में test किया जा रहा है
use=immediate
use=reference
use=full
- robots.txt का content use value direct blocking enforce नहीं करता, बल्कि site owner की preference convey करता है
- Existing managed robots.txt में
search=yes,ai-train=no इस्तेमाल कर रहे customers के लिए use=reference जोड़ा जाएगा
User-agent: *
Content-Signal: search=yes,ai-train=no,use=reference
Allow: /
- BotBase हर bot के content use method को भी track करता है, और signal का misuse करने वाले bots Verified status खो देते हैं, इसलिए आगे allow नहीं होते
- पूरा content reproduce करने वाले bots को फिलहाल Verified status नहीं मिल सकता
Verified का बदला हुआ मतलब
- पहले सभी Verified bots default रूप से allow थे, और यह criterion Bot Fight Mode और Enterprise Bot Management rule templates में reflect होता था
- अब unverified bots default रूप से block रहेंगे, लेकिन Verified bots भी automatically allow नहीं होंगे
- Verified का मतलब relevant category में acceptable bot है, और actual access इस पर निर्भर करेगा कि Search जैसी relevant category allow है या नहीं
- Verified status पाने के लिए bot operators को दो conditions पूरी करनी होंगी
- अपनी identity ईमानदारी से दिखानी होगी
- उस ईमानदारी के आधार पर मिले access rights का misuse नहीं करना होगा
- Cloudflare classification में operator सही तरीके से reflected है या नहीं, इसे manage करने के लिए bot operator tools भी develop किए जा रहे हैं
Intermediary platforms से गुजरने वाला transitive trust
- Automation या agents को बनाने वाली company उन्हें सीधे operate नहीं भी कर सकती; एक developer platform enterprises से लेकर individual developers तक हजारों operators की requests on behalf execute कर सकता है
- Site owner→bot-owning company→end user तक जाने वाले relationship को transitive trust के रूप में define किया गया है
- RFC 7239 के
Forwarded header का उपयोग करके proxy process में खो जाने वाली operator information को request में शामिल करने का तरीका propose किया गया है
Forwarded: for="openai"
- Content use level भी साथ में भेजा जा सकता है
Forwarded: for="openai";use="reference"
- अगर site किसी specific operator को allow करती है, तो trusted intermediary layers से होकर आने वाली requests पर भी वही policy maintain की जा सकती है; detailed format web bot authentication documentation में देखा जा सकता है
- Cloudflare के पीछे web domains 20% से अधिक हैं, इसलिए trust status खोना operators के लिए वास्तविक deterrent हो सकता है
- Bot और human traffic mix होने पर transitive trust सिर्फ उन users पर लागू हो सकता है जिनके पास identity reveal करने की capacity है
- Small traffic sources के लिए privacy protection की जरूरत है
- Privacy promises निभाने की कोशिश करने वाली companies को private rate limiting जैसे alternative components की जरूरत है
Rollout status और operating principles
- नए AI traffic options अभी सभी existing customers के लिए उपलब्ध हैं और zone Settings में set किए जा सकते हैं
- नए defaults और classification system का लक्ष्य ऐसा structure बनाना है जिसमें site owners तय करें कि कौन content का इस्तेमाल कैसे करता है, और automation operators जितनी transparency से purpose बताते हैं, उन्हें उतना ज्यादा access मिले
- Web और automated traffic में बदलाव के अनुरूप detailed policies adjust की जाती रहेंगी, लेकिन content creators की choice और trust को center में रखने का principle बनाए रखा जाएगा
1 टिप्पणियां
Hacker News की राय
Googlebot search indexing और Gemini training के लिए वही crawler infrastructure इस्तेमाल करता है, इसलिए 15 सितंबर से यह Cloudflare की ‘training block’ policy के दायरे में आ जाएगा
सबसे सख्त rule पहले लागू होता है, इसलिए जिन customer sites पर training block है वहाँ Googlebot, Applebot, BingBot जैसे multipurpose crawlers भी block हो जाते हैं
search monopoly company के ऐसे व्यवहार को रोकना ही antitrust law का काम है, इसलिए उम्मीद है कि कम से कम EU regulators आगे आएँ, और access logs में मौजूद सभी Googlebot crawling records हर्जाने के आधार बन सकते हैं
Google को इस तरह content इस्तेमाल न करने के लिए ठीक तरह से मना करने का तरीका भी search में आसानी से नहीं मिला, यह बेहद निराशाजनक था
नए domains पर ads दिखाने वाले pages के training और agent crawling को default रूप से block करते हुए search को allow करने का Cloudflare का रुख थकाने वाला है, मानो वह arms race के दोनों तरफ खड़ा हो
एक तरफ agent और AI products बनाने की technology देना और दूसरी तरफ ऐसी policy चलाना—ऐसी company पर तुरंत भरोसा करना मुश्किल है
web domains के 20% से अधिक आधार पर ‘trust status’ देना या छीन लेना सकaratmak बात की तरह पेश करना भी चौंकाने वाला है
Cloudflare feature की जगह Anubis जैसे proof of work (PoW) को अपनाने पर विचार किया जाए
Cloudflare से protected sites पर CAPTCHA के बिना भी पूरी तरह block होने की घटनाएँ बढ़ रही हैं, और भले ही अलग-अलग sites बहुत महत्वपूर्ण न हों, इस तरह के फैसले इंटरनेट की बुनियाद को धीरे-धीरे कमजोर करते दिखते हैं
अगर पूरी तरह block किया गया है, तो Cloudflare से ज़्यादा संभव है कि site owner ने सभी VPNs या कुछ देशों के बाहर के users को block करने की setting की हो
यह असहज करता है कि site तक कौन पहुँच सकता है, इसका नियंत्रण लोग स्वेच्छा से एक ही बढ़ती हुई प्रभुत्वशाली company को सौंप रहे हैं
‘bot’ और ‘AI’ को reflex की तरह block करने से users की ओर से काम करने वाले AI agents भी access नहीं कर पाएँगे, इसलिए policy की बुनियाद ही गलत है
समझ नहीं आता कि Cloudflare और web आखिर किस नतीजे तक पहुँचना चाहते हैं। Anthropic, DeepMind, OpenAI, Google शायद crawling cost चुकाएँगे नहीं, और Reddit जैसे बड़े discourse suppliers के साथ private deals करना उन्हें ज़्यादा आसान लगेगा
नए information को context में लाने वाली functionality जारी रहेगी, लेकिन वह indiscriminate scraping से अलग बात है
अगर Google इस दिशा में सफल हो जाता है कि वह सवालों के सीधे जवाब दे और original sites तक users का जाना लगभग बंद हो जाए, तो web पर content public करने की आर्थिक value व्यापक रूप से खत्म हो जाएगी। ऐसा ही रहा तो Google को तकनीकी और कानूनी रूप से block कर दिया जाएगा, content नहीं मिलेगा, और नुकसान सबका होगा
वह दुनिया टिकाऊ नहीं हो सकती जिसमें सब लोग मुफ्त में काम करें और value सिर्फ Google और AI engines ले जाएँ, न ही वह जिसमें content production पूरी तरह रुक जाए, लेकिन लगभग पूरा content paywall के पीछे चला जाने की संभावना बनी हुई है
लेकिन micropayments अब तक पूरी तरह असफल रहे हैं, और अगर friction को काफी कम करने का तरीका नहीं मिला, तो अधिकतर मूल्यवान content lock हो जाएगा, discovery और access cost बढ़ेगी, और पूरा content industry तेज़ी से सिकुड़ सकता है। अगर सिर्फ बड़े भुगतान बचे, तो commercial web बहुत छोटा हो जाएगा, गुणवत्ता शायद बढ़े, लेकिन इसकी कीमत भारी होगी
leadership अलग बात है, लेकिन ऐसे फैसलों में सभी stakeholders को ध्यान में रखने के लिए IETF की सीधी भागीदारी होनी चाहिए, वरना internet fragmented हो सकता है
मौजूदा बड़ी कंपनियाँ इसे वहन कर सकती हैं और नए entrants के लिए भारी वित्तीय barrier खड़ा कर सकती हैं, इसलिए वे इसका स्वागत भी कर सकती हैं
Cloudflare customers भी अगर free या सस्ती services के जरिए अपना हिस्सा पा रहे हों, तो संभव है कि company बड़े AI players के साथ कैसा व्यवहार करती है, इससे उन्हें खास फर्क न पड़े
क्या Google, OpenAI, Grok, Claude, Perplexity को ही allow करके बाकी bots को block करने वाली setting संभव है
अभी वास्तविक visitors भेजने वाला सिर्फ Google है, लेकिन आगे दूसरे बड़े AI services भी भेज सकते हैं
‘anonymous bots block’ भी एक विकल्प हो सकता है। AI bots बढ़ने के बाद human की नकल करने वाले residential IPs से भारी requests आ रही हैं, जिससे बड़ा नुकसान हो रहा है, और इस traffic से revenue नहीं, सिर्फ cost आती है
यह भी जानना है कि Amazon CloudFront में इसे मदद करने वाला कोई feature है या नहीं
Cloudflare उन बहुत कम platforms में है जो websites को यह चुनने देते हैं कि वे AI के साथ कैसे संबंध रखें, और AI traffic को monetize करने का तरीका भी देते हैं, इसके लिए आभार
per-crawl billing program को लेकर कोई नया अपडेट है क्या
AI training block करके देखा, तो Google search bot भी block हो गया और traffic आधा रह गया, इसलिए इसकी सिफारिश नहीं करूँगा
सोचता हूँ क्या वाकई कोई इस feature का इस्तेमाल करता है। यह भी शक है कि scrapers पैसे देंगे या नहीं, और अगर देंगे भी, तो क्या वे आर्थिक रूप से सार्थक स्तर पर भुगतान करेंगे