- साइट में outage पैदा कर देने लायक अनुरोध भेजने वाले Googlebot के कई मामलों की वजह Google नहीं, बल्कि Googlebot का रूप धरने वाले बाहरी bots होते हैं
- HTTP
User-Agentको requester मनचाहे तरीके से सेट कर सकता है, इसलिए logs मेंGooglebot/2.1string भर होने से यह गारंटी नहीं होती कि वह असली Googlebot है - Impersonation bots blocking से बचने के लिए Googlebot नाम का इस्तेमाल करते हैं, और यह कई hosting providers के servers का उपयोग करने वाला एक बड़ा malicious crawler campaign भी हो सकता है
- असली Googlebot है या नहीं, इसे
hostcommand या Google द्वारा प्रकाशित IP ranges से verify करना चाहिए; जिस IP का registrant Google LLC दिखे, वह भी Google Cloud address हो सकता है, इसलिए extra verification की जरूरत है - पूरे Googlebot traffic के आधे से ज्यादा नकली हैं—ऐसा कोई data नहीं है, लेकिन service को बाधित करने वाला Googlebot traffic मुख्यतः impersonation bots से आता दिखता है
Googlebot traffic को लेकर गलतफहमियां
- Operators की शिकायतें हैं कि Google search crawler अत्यधिक traffic से site outage पैदा करता है या DDoS जैसा व्यवहार करता है
- लेकिन ऐसा destructive traffic Google की बजाय किसी अन्य actor द्वारा Googlebot नाम चुराकर भेजे गए impersonation requests हो सकते हैं
- Server logs में Googlebot string मिलने भर से Google को traffic source मान लेना सही नहीं है
User-Agent पहचान का प्रमाण नहीं है
- Googlebot जैसा दिखने वाले requests में आम तौर पर निम्न value शामिल होती है
User-Agent: Mozilla/5.0 (compatible; Googlebot/2.1; +http://www.google.com/bot.html)
- nginx logs में भी वही string दर्ज हो सकती है, लेकिन User-Agent header को requester अपनी मर्जी से किसी भी value पर set कर सकता है
- User-Agent verified authentication information नहीं, बल्कि voluntary self-identification है, इसलिए कोई भी खुद को Googlebot बता सकता है
Impersonation bots का source और scale
- Impersonating actor मौजूदा bot blocking से बचने के लिए Googlebot User-Agent का इस्तेमाल करता दिखता है
- Example log का IP Google का नहीं, बल्कि hosting provider Virtual Machine Solutions LLC द्वारा दिए गए server का निकला
- Googlebot impersonation बहुत पहले से आम तौर पर इस्तेमाल होने वाली technique है, और हाल में इसका scale बड़ा हुआ देखा गया है
- Chris Siebenmann का सुझाव है कि यह पुरानी technique कई जगहों पर एक साथ trend होने से ज्यादा, कई hosting providers से बड़ी संख्या में servers हासिल करने वाले एक malicious crawler का बड़ा campaign हो सकता है
असली Googlebot को verify करने का तरीका
- Google के Googlebot verification docs के अनुसार कुछ बार
hostcommand चलाकर, या Google द्वारा प्रकाशित IP ranges से मिलान करके verification किया जा सकता है - अधिकांश major crawlers IP lists प्रकाशित करते हैं, लेकिन उनके specific formats और operations एक-दूसरे से अलग होते हैं
- JAFAR crawler IP lists को standardize करने का proposal है, जिसकी standardization process अभी चल रही है
- IP registrant Google LLC दिखने पर भी वह Google Cloud hosting address हो सकता है, इसलिए अलग verification जरूरी है
- Google Cloud के जरिए हालिया impersonation case की पुष्टि नहीं हुई
- Verification के बाद अगर असली Googlebot अत्यधिक crawling कर रहा हो, तो Google के excessive crawling response docs का पालन करना चाहिए
भरोसेमंद bot authentication
- सिर्फ एक field जोड़ देने से malicious actors के पास उस value को ईमानदारी से set करने की कोई वजह नहीं होती
- RFC 3514 का तथाकथित
evil bitइस बात पर व्यंग्य करता है कि malicious actors ऐसे standards का पालन नहीं करते - Web Bot Auth HTTP Signatures एक अलग field से अधिक complex है, लेकिन cryptographic signatures के जरिए भरोसेमंद User-Agent implement करने का तरीका है
‘अधिकतर’ शब्द की सीमा
- पूरे Googlebot traffic में नकली traffic सच में आधे से ज्यादा है—यह साबित करने वाला कोई data नहीं है
- हालांकि sites को गंभीर रूप से बाधित करने वाले Googlebot traffic के अधिकांश मामले नकली Googlebot से आते दिखते हैं
- अनुभव के आधार पर असली Googlebot बहुत stable तरीके से काम करता है, जबकि impersonation bots site में outage आने तक requests भेज सकते हैं
1 टिप्पणियां
Lobste.rs की राय