- फ़्रांसीसी subreddit की “ट्रेन स्टेशन के जितना करीब, कबाब उतना बेस्वाद होता है” वाली परिकल्पना को Paris के डेटा से जाँचने के लिए, कबाब रेस्तराँ की रेटिंग और सबसे नज़दीकी रेल या मेट्रो प्रवेशद्वार तक की पैदल दूरी की तुलना की गई
- विश्लेषण में OSMnx से walking network और स्टेशन प्रवेशद्वार जुटाए गए, और Google Places API से “kebab” खोज परिणामों के location और rating डेटा लिए गए
- Places API की radius search सख्त सीमा की तरह नहीं बल्कि bias की तरह काम करती है, इसलिए 1km अंतर वाले hexagonal sampling और paging के जरिए अंततः 400 कबाब परोसने वाले प्रतिष्ठानों का संग्रह किया गया
- NetworkX shortest path से निकाली गई पैदल दूरी और रेटिंग का Pearson correlation coefficient कुल मिलाकर 0.091, IQR outlier हटाने के बाद 0.098, और मेट्रो को हटाने पर 0.001 रहा
- Google reviews सिर्फ स्वाद को नहीं दर्शातीं; उन पर tourism, review manipulation, review count और रेस्तराँ के प्रकार का असर पड़ सकता है, इसलिए सिर्फ Paris के डेटा से इस परिकल्पना का समर्थन करना कठिन है
परिकल्पना और विश्लेषण का दायरा
- शुरुआत फ़्रांसीसी subreddit में साझा की गई इस परिकल्पना से हुई कि “ट्रेन स्टेशन के जितना करीब, कबाब उतना बेस्वाद होता है”
- मूल पोस्ट को subreddit के अपेक्षाकृत छोटे आकार के बावजूद अच्छी प्रतिक्रिया मिली, और टिप्पणियों में इस परिकल्पना से असहमत अनुभव भी सामने आए
- अनौपचारिक “अध्ययन” के लिए Paris, France को चुना गया
- क्योंकि मूल परिकल्पना एक फ़्रेंच पोस्ट से आई थी
- Paris के केंद्र में ट्रेन स्टेशन, मेट्रो स्टेशन और कबाब की दुकानें बड़ी संख्या में हैं, इसलिए sample जुटाना आसान था
- विश्लेषण के उद्देश्य से इसे फ़्रांस-स्तरीय घटना मान लिया गया
walking network और स्टेशन प्रवेशद्वार डेटा
- OSMnx से Paris का walking network डाउनलोड कर सुरक्षित किया गया
- public transport उपयोग के संदर्भ को देखते हुए
network_type="walk"का इस्तेमाल किया गया - डेटा को EPSG:32631, UTM zone 31N में project किया गया
- public transport उपयोग के संदर्भ को देखते हुए
- स्टेशन प्रवेशद्वार
railway=subway_entranceऔरrailway=train_station_entranceके आधार पर एकत्र किए गए- इनमें लंबी दूरी के मुख्य स्टेशन ही नहीं, मेट्रो प्रवेशद्वार भी शामिल थे
- परिणामों में से सिर्फ Point geometry को filter कर इस्तेमाल किया गया
- आउटपुट को QGIS में जाँचने लायक फ़ाइलों के रूप में सहेजा गया
Google Places API से कबाब प्रतिष्ठानों का संग्रह
- रेस्तराँ डेटा के लिए Google Places API और Google reviews का उपयोग किया गया
- Google reviews पर bots, manipulation और भोजन के अलावा दूसरे अनुभव-आधारित तत्वों का असर हो सकता है, फिर भी उस समय इसे व्यावहारिक डेटा स्रोत माना गया
- Yelp API का उपयोग लागत के कारण नहीं किया गया
- Places API में polygon के भीतर खोज की सुविधा नहीं है; केवल point और radius आधारित search उपलब्ध है
- radius परिणामों को सख्ती से काटने वाला hard cut-off नहीं, बल्कि bias की तरह काम करता है
- इसी वजह से पूरे Paris को cover करने के लिए grid search जैसी sampling की ज़रूरत पड़ी
- Paris की प्रशासनिक सीमा में पश्चिम का बड़ा पार्क और पूर्व के खेल परिसर जैसे बड़े हरित क्षेत्र शामिल थे, और वहाँ कबाब प्रतिष्ठान लगभग नहीं थे; इसलिए API लागत घटाने के लिए उन्हें बाहर रखा गया
- sampling को 1km vertical spacing वाले hexagonal layout में बनाया गया
- search radius
500m * √3 ≈ 866mरखा गया - कुल 99 sample points इस्तेमाल किए गए
- search radius
- शुरुआत में paging के बिना 322 परिणाम मिले; कुछ प्रतिष्ठान छूटते दिखे, इसलिए paging जोड़ने के बाद 400 कबाब परोसने वाले प्रतिष्ठान मिले
- “kebab” search results में नाम में kebab वाले स्थान, Mediterranean श्रेणी वाले स्थान, और वे स्थान शामिल थे जिनकी reviews में kebab का उल्लेख अधिक था
- Pizza Hut जैसे कुछ मामले भी थे, जहाँ शायद सिर्फ कबाब pizza मिलता हो
- मूल API results को अध्ययन-सीमा के अनुसार clip किया गया, rating और review count को numeric में बदला गया, और जिन प्रविष्टियों की review count 0 थी उन्हें हटा दिया गया
पैदल दूरी की गणना
- लक्ष्य था हर कबाब प्रतिष्ठान से सबसे नज़दीकी स्टेशन प्रवेशद्वार तक की पैदल दूरी निकालना
- हर प्रतिष्ठान और हर प्रवेशद्वार के सभी संयोजनों पर routing करने में बहुत समय लगता, इसलिए पहले spatial index से संभावित प्रवेशद्वारों की संख्या घटाई गई
- GeoPandas के
sindexसे रेस्तराँ के 1km दायरे के भीतर मौजूद प्रवेशद्वार खोजे गए - उम्मीदवारों को सीधी दूरी के आधार पर sort करके सबसे नज़दीकी 3 ही रखे गए
- GeoPandas के
- NetworkX से walking network पर shortest path निकाला गया
- रेस्तराँ और प्रवेशद्वार, दोनों को उनके सबसे नज़दीकी network node से map किया गया
- path length में रेस्तराँ/प्रवेशद्वार बिंदुओं और network nodes के बीच की दूरी भी जोड़ी गई
- उम्मीदवार प्रवेशद्वारों में सबसे छोटी दूरी को उस रेस्तराँ की दूरी के रूप में सहेजा गया
- परिणाम डेटा को QGIS और output logs से जाँचा गया, और गणना की सटीकता पर पर्याप्त भरोसा जताया गया
परिणाम: सहसंबंध बहुत कमजोर
- पूरे डेटा में दूरी और रेटिंग का Pearson correlation coefficient 0.091 रहा
- सिर्फ दिशा देखें तो यह “जितना करीब, उतना बेस्वाद” वाली परिकल्पना के अनुकूल लग सकता है
- लेकिन सहसंबंध इतना कमजोर है कि इसे सांख्यिकीय रूप से अर्थपूर्ण कहना मुश्किल है
- चूँकि outliers Pearson correlation को काफ़ी प्रभावित कर सकते हैं, इसलिए IQR fencing से कुछ outliers हटाए गए
- हटाने के बाद correlation coefficient थोड़ा बढ़कर 0.098 हुआ
- यह मानते हुए कि मूल परिकल्पना में शायद मेट्रो शामिल नहीं थी, मेट्रो स्टेशनों को हटाकर फिर से गणना की गई
- इस स्थिति में correlation coefficient और घटकर 0.001 रह गया
- बिल्कुल कम रेटिंग वाले कुछ रेस्तराँ स्टेशन के बहुत करीब ज़रूर मिले, लेकिन कुल सहसंबंध परिकल्पना को समर्थन देने के लिए बहुत कमजोर था
सीमाएँ और आगे के विश्लेषण की संभावना
- Google reviews कबाब के स्वाद का वस्तुनिष्ठ मापदंड नहीं हैं
- staff, cleanliness और आसपास का माहौल जैसे dining experience तत्व रेटिंग को प्रभावित कर सकते हैं
- online manipulation और review fraud की संभावना भी बनी रहती है
- tourism factor भी नतीजों को प्रभावित कर सकता है
- स्थानीय नियमित ग्राहक अधिक सख्त हो सकते हैं, या पर्यटक अलग तरीके से रेटिंग दे सकते हैं
- किसी एक दिशा में निष्कर्ष नहीं निकाला गया
- Google search results कुछ हद तक उपयुक्त थे, लेकिन पूरी तरह सटीक नहीं
- query results के सभी स्थान किसी न किसी रूप में कबाब परोसते हुए लगे
- फिर भी कबाब pizza जैसे बदले हुए रूप शामिल हो सकते हैं
- review count विश्लेषण को प्रभावित कर सकती थी, लेकिन उस समय उसे सही तरह से शामिल करने का भरोसेमंद तरीका स्पष्ट नहीं था
- डेटा साझा नहीं किया गया क्योंकि इससे Google TOS के उल्लंघन की आशंका थी
- इसके बदले पुनरुत्पादन के लिए आवश्यक code flow सार्वजनिक किया गया
- मूल फ़्रेंच पोस्ट के विरोधी comments में Paris के स्टेशनों के पास अच्छे कबाब के कई उदाहरण थे, और अंग्रेज़ी में साझा किया गया उदाहरण परिकल्पना को उससे अधिक मजबूत दिखा सकता है
- Paris में किराया, मज़दूरी, tourism और population density जैसी स्थितियों का असर शुरुआती अनुमान से ज़्यादा रहा हो सकता है, इसलिए आगे विश्लेषण की गुंजाइश बनी हुई है
1 टिप्पणियां
Hacker News की रायें
नमस्ते, मैं मूल पोस्ट का लेखक हूँ
इस लेख को caffeine के नशे में लिखे जाने के एक हफ्ते से थोड़ा ज़्यादा समय बाद इंटरनेट पर इधर-उधर फैलते देखना—पहले Menéame, और अब यहाँ तक—मज़ेदार रहा, और मैं कुछ बातें जोड़ना चाहता था
यह लेख असल में कुछ हद तक एक meme था। r/gis की मूल पोस्ट के लिए मैंने बस एक तेज़ “research”, या अधिक सटीक कहें तो “analysis” किया था, लेकिन लोग इसे मेरी उम्मीद से ज़्यादा गंभीरता से लेने लगे, यह देखकर हैरानी हुई। लगता है अच्छा kebab वाकई अहम मुद्दा है
जैसा कि दूसरों ने कहा, “hypothesis” को verify करने के लिए linear correlation का इस्तेमाल शायद उचित नहीं था। जिस French लेख ने मुझे पहली बार यह देखने पर मजबूर किया, उसकी wording से कुछ ऐसा ही संकेत मिलता था, लेकिन पीछे मुड़कर देखें तो किसी तय radius के भीतर के kebab restaurants औसतन बाकी से ज़्यादा खराब होने की संभावना ज़्यादा है
और Paris शायद study के लिए काफी खराब जगह थी। यह ऐसा शहर है जहाँ बहुत अच्छे kebab restaurants संयोग से railway stations के पास हैं
अब लगता है Part 2 शुरू करनी चाहिए
Paris की metro ने मूल रूप से tram network के बड़े हिस्से को replace किया था, इसलिए station density दूसरे metro systems से ज़्यादा है। Paris में ऐसा kebab restaurant ढूँढना बहुत मुश्किल होगा जो metro station से 500m के भीतर न हो
इसलिए study का अर्थ dilute हो जाता है। मैंने शायद ही कभी महसूस किया हो कि metro station आसपास के इलाके पर खराब असर डालता है; बल्कि लगभग उल्टा ही लगता है
अगर सिर्फ Paris के बड़े train stations शामिल किए जाते, तो यह कहीं ज़्यादा दिलचस्प होता। algorithmically यह मुश्किल काम नहीं रहा होगा
गैर-metro stations, जैसे Gare du Nord जैसे TER “mainline” stations तक की दूरी शायद ज़्यादा representative result दे सकती है
दिलचस्पी से इंतज़ार करूँगा
location और quality के बीच मूल रूप से correlation नहीं होना चाहिए। लेकिन हम सिर्फ वे restaurants देख रहे हैं जो अभी “operating” हैं, इसलिए bias आ जाता है
सरल करें तो restaurants की location अच्छी/खराब और food अच्छी/खराब हो सकती है। जिसकी location भी खराब और food भी खराब हो, वह restaurant लंबे समय तक survive नहीं करता
जब ऐसे “bad/bad” restaurants हटा दिए जाते हैं, तो correlation बनता हुआ दिखता है, लेकिन वह collider bias की वजह से है
“पूरे Pearson correlation coefficient 0.091 के साथ, data दिखाता है कि यह सच भी हो सकता है!” इस हिस्से पर sandwich खाते-खाते मेरा लगभग गला अटक गया था। अफसोस, वह kebab नहीं था
शायद इस लेख का title बदलना चाहिए। अभी top comments में से आधे यह मान रहे हैं कि study ने hypothesis confirm कर दी है
“पूरे Pearson correlation coefficient 0.091 के साथ, data दिखाता है कि यह सच भी हो सकता है! अगर इस बात को नज़रअंदाज़ कर दें कि correlation इतना कमजोर है कि उसे ‘statistically insignificant’ कहना भी काफी उदार assessment होगा”
400 samples में Google reviews में 3 stars से कम वाले kebab restaurants 17 हैं, और इन्हें “bad kebab” कह लेते हैं
वे सभी “bad kebab” अपने सबसे नज़दीकी station से 500m के भीतर हैं। 500m से दूर कोई bad kebab restaurant नहीं है
इसलिए अगर आपने कभी खराब doner kebab खाया है, तो सुरक्षित रूप से मान सकते हैं कि वह आपने train station के पास वाले kebab restaurant से खरीदा था
शायद station के पास kebab खाने वाले इतने ज़्यादा होते हैं कि average kebab भी profitable हो जाता है
Berlin में kebab shops की संख्या बहुत ज़्यादा है। शायद हजारों होंगी
ज़्यादातर मोहल्लों के अंदर हैं और आसपास के local regulars आते हैं। quality में बहुत ज़्यादा फर्क है; कई जगहें food बेचने से ज़्यादा money laundering business के लिए बनी लगती हैं। cash-only, खराब hygiene, और service भी उदासीन
ऐसी जगहें business point of view से अक्सर बिल्कुल sense नहीं बनातीं। मतलब money laundering को छोड़ दें तो। वे पुरानी और गंदी दिखती हैं, customers कम होते हैं, इसलिए पहचानना आसान है। अगर lunch या dinner time पर कोई खा नहीं रहा है, तो बचना बेहतर है
इसके उलट सचमुच बेहतरीन जगहें भी हैं, जहाँ proper charcoal grill इस्तेमाल होता है, staff अपना काम जानता है और friendly होता है, और customer handling पर focus रहता है। ऐसी जगहें शानदार होती हैं और आम तौर पर value for money भी अच्छी होती है। कुछ जगहें meat खुद marinate करती हैं और standard kebab तक सीमित नहीं रहतीं
अगर Berlin जाएँ, तो जिस इलाके में हों वहाँ कहाँ जाना चाहिए, इस पर सलाह लेना अच्छा रहेगा। कुछ कमाल के kebab restaurants हैं, और आम तौर पर वे बहुत पुराने होते हैं
तीसरी category late-night या tourist-heavy जगहों में होती है, और travelers या drunk लोगों जैसे उन customers को target करती है जो शायद regular नहीं बनेंगे। इस customer base के लिए competition कड़ा है, और कुछ options इतने अच्छे भी हैं कि लोग खास तौर पर घूमकर खाने जाते हैं। कई जगहें operations अच्छी तरह चलाती हैं और throughput तथा consistency optimize करती हैं, लेकिन जरूरी नहीं कि high quality को target करें
हमारे शहर में भी ऐसी जगहें हैं और हर बार देखकर समझ नहीं आता। अगर कोई खाता ही नहीं, तो वे पैसे कैसे launder करती हैं? शायद मैं सुस्त या भोला हूँ, लेकिन मुझे समझ नहीं आता कि जहाँ सच में products नहीं बिकते, ऐसे business में money laundering का structure कैसे काम करता है
ट्रेन स्टेशन से दूरी और कबाब reviews के बीच कोई correlation नहीं मिला, या और सटीक कहें तो correlation नहीं है—ऐसा नतीजा मिला। statistics class के लिए अच्छी study है
ज़्यादा सटीक कहावत शायद यह होगी: “अच्छा कबाब कहीं भी बिक सकता है, लेकिन खराब कबाब सिर्फ ट्रेन स्टेशन के पास ही बिक सकता है”
कुल quality के बजाय minimum viable quality देखें तो दूरी के साथ linear correlation जैसा दिखता है। 5% quantile regression इस्तेमाल करें तो distribution की lower boundary आसानी से मिल सकती है
यह बड़ा फर्क है। Paris में सैकड़ों Metro stations हैं, और लगभग हर जगह कोई station पास ही है
मूल इरादा शायद ट्रेन station तक की दूरी रहा होगा। अगर Paris, Rome जैसा है, तो railway stations के पास सस्ते hostels और हालिया immigrants की रहने की जगहें होती हैं
मान लें x=[-5..+5], y=[25,16,9,4,1,0,1,4,9,16,25], यानी x²। Pearson correlation coefficient R² 0 होगा। हमें पता है कि y, x पर निर्भर करता है, लेकिन linear तरीके से निर्भर नहीं करता
TripAdvisor पर Best Kebab के reviews पढ़ना मुझे हमेशा पसंद है। यह Queen Street train station के ठीक बगल में है, इसलिए study से भी मेल खाता है
https://www.tripadvisor.co.uk/Restaurant_Review-g186534-d125...
“खाना अधपका था ही, ऊपर से chips और cheese में pubic hair मिला, और जब हमने समस्या बताने की कोशिश की तो वे चाकू लेकर हमारे पीछे दौड़े। Dundas Street तक। बिल्कुल shock कर देने वाला”
इसी तरह Venice में मैंने theory बनाई थी कि pizza slice की कीमत से San Marco तक की दूरी का अंदाज़ा लगाया जा सकता है। जितना महंगा, उतना पास। कभी verify नहीं किया, लेकिन heatmap में देखना मजेदार होगा
anecdotal तौर पर coffee के साथ भी यही है। office lobby coffee shops बिना exception भयानक होती हैं। कोई ठीक-ठाक जगह हमेशा कम से कम 5–10 मिनट पैदल दूर होती है
असली results देखें तो(https://preview.redd.it/znmnejgab5je1.png?width=1000&format=...), न positive correlation दिखता है न negative। हालांकि subjectively मैं उस hypothesis की पुष्टि कर सकता हूं
exception के तौर पर Cologne Ehrenfeld का Kebapland Aachen जाने वाली main railway line की छाया में है और Ehrenfeld U-Bahn के ऊपर है
Köln में मिलने वाला अब तक का सबसे अच्छा कबाब, और प्रति euro सबसे बेहतरीन meal है
paid ad नहीं है, बस पागलपन की हद तक tasty है
मैंने यह observe किया
दुनिया के हैरान कर देने वाले कई इलाकों में “New York Pizza”, “Manhattan Pizza” जैसे नामों वाली pizza shops हैं
वहां की pizza, असली New York pizza shops में मिलने वाले पतले, greasy slice pizza से कितनी मिलती-जुलती है, यह उस location के New York से दूर जाने के साथ inversely proportional है
Boston की New York Pizza काफी मिलती-जुलती है। QLD Brisbane की New York Pizza तुलना में alien food है, और लगता है वहां “pepperoni” और “salami” को interchangeable माना जाता है
author minimum publishable unit खोज रहा है, लेकिन उस standard पर भी खरा नहीं उतरता। publish न करने की सलाह है
यहां “Halal Beef Pepperoni” का practically सिर्फ एक wholesale supplier है, और लगता है इस तरफ की non-chain pizza shops ने local religious sensitivities के हिसाब से उसी को standard बना लिया है
गीले meat-flavoured पोछे जैसा लगता है, और तीखापन बिल्कुल नहीं है
“Brooklyn Slice” नया खुल रहा है, और लगता है वे regular salami को promote कर रहे हैं। अगर जरा भी spicy हुआ तो game बदल जाएगा
पहले New Zealand में रहता था