1 पॉइंट द्वारा GN⁺ 2025-02-25 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • फ़्रांसीसी subreddit की “ट्रेन स्टेशन के जितना करीब, कबाब उतना बेस्वाद होता है” वाली परिकल्पना को Paris के डेटा से जाँचने के लिए, कबाब रेस्तराँ की रेटिंग और सबसे नज़दीकी रेल या मेट्रो प्रवेशद्वार तक की पैदल दूरी की तुलना की गई
  • विश्लेषण में OSMnx से walking network और स्टेशन प्रवेशद्वार जुटाए गए, और Google Places API से “kebab” खोज परिणामों के location और rating डेटा लिए गए
  • Places API की radius search सख्त सीमा की तरह नहीं बल्कि bias की तरह काम करती है, इसलिए 1km अंतर वाले hexagonal sampling और paging के जरिए अंततः 400 कबाब परोसने वाले प्रतिष्ठानों का संग्रह किया गया
  • NetworkX shortest path से निकाली गई पैदल दूरी और रेटिंग का Pearson correlation coefficient कुल मिलाकर 0.091, IQR outlier हटाने के बाद 0.098, और मेट्रो को हटाने पर 0.001 रहा
  • Google reviews सिर्फ स्वाद को नहीं दर्शातीं; उन पर tourism, review manipulation, review count और रेस्तराँ के प्रकार का असर पड़ सकता है, इसलिए सिर्फ Paris के डेटा से इस परिकल्पना का समर्थन करना कठिन है

परिकल्पना और विश्लेषण का दायरा

  • शुरुआत फ़्रांसीसी subreddit में साझा की गई इस परिकल्पना से हुई कि “ट्रेन स्टेशन के जितना करीब, कबाब उतना बेस्वाद होता है
  • मूल पोस्ट को subreddit के अपेक्षाकृत छोटे आकार के बावजूद अच्छी प्रतिक्रिया मिली, और टिप्पणियों में इस परिकल्पना से असहमत अनुभव भी सामने आए
  • अनौपचारिक “अध्ययन” के लिए Paris, France को चुना गया
    • क्योंकि मूल परिकल्पना एक फ़्रेंच पोस्ट से आई थी
    • Paris के केंद्र में ट्रेन स्टेशन, मेट्रो स्टेशन और कबाब की दुकानें बड़ी संख्या में हैं, इसलिए sample जुटाना आसान था
    • विश्लेषण के उद्देश्य से इसे फ़्रांस-स्तरीय घटना मान लिया गया

walking network और स्टेशन प्रवेशद्वार डेटा

  • OSMnx से Paris का walking network डाउनलोड कर सुरक्षित किया गया
    • public transport उपयोग के संदर्भ को देखते हुए network_type="walk" का इस्तेमाल किया गया
    • डेटा को EPSG:32631, UTM zone 31N में project किया गया
  • स्टेशन प्रवेशद्वार railway=subway_entrance और railway=train_station_entrance के आधार पर एकत्र किए गए
    • इनमें लंबी दूरी के मुख्य स्टेशन ही नहीं, मेट्रो प्रवेशद्वार भी शामिल थे
    • परिणामों में से सिर्फ Point geometry को filter कर इस्तेमाल किया गया
  • आउटपुट को QGIS में जाँचने लायक फ़ाइलों के रूप में सहेजा गया

Google Places API से कबाब प्रतिष्ठानों का संग्रह

  • रेस्तराँ डेटा के लिए Google Places API और Google reviews का उपयोग किया गया
    • Google reviews पर bots, manipulation और भोजन के अलावा दूसरे अनुभव-आधारित तत्वों का असर हो सकता है, फिर भी उस समय इसे व्यावहारिक डेटा स्रोत माना गया
    • Yelp API का उपयोग लागत के कारण नहीं किया गया
  • Places API में polygon के भीतर खोज की सुविधा नहीं है; केवल point और radius आधारित search उपलब्ध है
    • radius परिणामों को सख्ती से काटने वाला hard cut-off नहीं, बल्कि bias की तरह काम करता है
    • इसी वजह से पूरे Paris को cover करने के लिए grid search जैसी sampling की ज़रूरत पड़ी
  • Paris की प्रशासनिक सीमा में पश्चिम का बड़ा पार्क और पूर्व के खेल परिसर जैसे बड़े हरित क्षेत्र शामिल थे, और वहाँ कबाब प्रतिष्ठान लगभग नहीं थे; इसलिए API लागत घटाने के लिए उन्हें बाहर रखा गया
  • sampling को 1km vertical spacing वाले hexagonal layout में बनाया गया
    • search radius 500m * √3 ≈ 866m रखा गया
    • कुल 99 sample points इस्तेमाल किए गए
  • शुरुआत में paging के बिना 322 परिणाम मिले; कुछ प्रतिष्ठान छूटते दिखे, इसलिए paging जोड़ने के बाद 400 कबाब परोसने वाले प्रतिष्ठान मिले
    • “kebab” search results में नाम में kebab वाले स्थान, Mediterranean श्रेणी वाले स्थान, और वे स्थान शामिल थे जिनकी reviews में kebab का उल्लेख अधिक था
    • Pizza Hut जैसे कुछ मामले भी थे, जहाँ शायद सिर्फ कबाब pizza मिलता हो
  • मूल API results को अध्ययन-सीमा के अनुसार clip किया गया, rating और review count को numeric में बदला गया, और जिन प्रविष्टियों की review count 0 थी उन्हें हटा दिया गया

पैदल दूरी की गणना

  • लक्ष्य था हर कबाब प्रतिष्ठान से सबसे नज़दीकी स्टेशन प्रवेशद्वार तक की पैदल दूरी निकालना
  • हर प्रतिष्ठान और हर प्रवेशद्वार के सभी संयोजनों पर routing करने में बहुत समय लगता, इसलिए पहले spatial index से संभावित प्रवेशद्वारों की संख्या घटाई गई
    • GeoPandas के sindex से रेस्तराँ के 1km दायरे के भीतर मौजूद प्रवेशद्वार खोजे गए
    • उम्मीदवारों को सीधी दूरी के आधार पर sort करके सबसे नज़दीकी 3 ही रखे गए
  • NetworkX से walking network पर shortest path निकाला गया
    • रेस्तराँ और प्रवेशद्वार, दोनों को उनके सबसे नज़दीकी network node से map किया गया
    • path length में रेस्तराँ/प्रवेशद्वार बिंदुओं और network nodes के बीच की दूरी भी जोड़ी गई
    • उम्मीदवार प्रवेशद्वारों में सबसे छोटी दूरी को उस रेस्तराँ की दूरी के रूप में सहेजा गया
  • परिणाम डेटा को QGIS और output logs से जाँचा गया, और गणना की सटीकता पर पर्याप्त भरोसा जताया गया

परिणाम: सहसंबंध बहुत कमजोर

  • पूरे डेटा में दूरी और रेटिंग का Pearson correlation coefficient 0.091 रहा
    • सिर्फ दिशा देखें तो यह “जितना करीब, उतना बेस्वाद” वाली परिकल्पना के अनुकूल लग सकता है
    • लेकिन सहसंबंध इतना कमजोर है कि इसे सांख्यिकीय रूप से अर्थपूर्ण कहना मुश्किल है
  • चूँकि outliers Pearson correlation को काफ़ी प्रभावित कर सकते हैं, इसलिए IQR fencing से कुछ outliers हटाए गए
    • हटाने के बाद correlation coefficient थोड़ा बढ़कर 0.098 हुआ
  • यह मानते हुए कि मूल परिकल्पना में शायद मेट्रो शामिल नहीं थी, मेट्रो स्टेशनों को हटाकर फिर से गणना की गई
    • इस स्थिति में correlation coefficient और घटकर 0.001 रह गया
  • बिल्कुल कम रेटिंग वाले कुछ रेस्तराँ स्टेशन के बहुत करीब ज़रूर मिले, लेकिन कुल सहसंबंध परिकल्पना को समर्थन देने के लिए बहुत कमजोर था

सीमाएँ और आगे के विश्लेषण की संभावना

  • Google reviews कबाब के स्वाद का वस्तुनिष्ठ मापदंड नहीं हैं
    • staff, cleanliness और आसपास का माहौल जैसे dining experience तत्व रेटिंग को प्रभावित कर सकते हैं
    • online manipulation और review fraud की संभावना भी बनी रहती है
  • tourism factor भी नतीजों को प्रभावित कर सकता है
    • स्थानीय नियमित ग्राहक अधिक सख्त हो सकते हैं, या पर्यटक अलग तरीके से रेटिंग दे सकते हैं
    • किसी एक दिशा में निष्कर्ष नहीं निकाला गया
  • Google search results कुछ हद तक उपयुक्त थे, लेकिन पूरी तरह सटीक नहीं
    • query results के सभी स्थान किसी न किसी रूप में कबाब परोसते हुए लगे
    • फिर भी कबाब pizza जैसे बदले हुए रूप शामिल हो सकते हैं
  • review count विश्लेषण को प्रभावित कर सकती थी, लेकिन उस समय उसे सही तरह से शामिल करने का भरोसेमंद तरीका स्पष्ट नहीं था
  • डेटा साझा नहीं किया गया क्योंकि इससे Google TOS के उल्लंघन की आशंका थी
    • इसके बदले पुनरुत्पादन के लिए आवश्यक code flow सार्वजनिक किया गया
  • मूल फ़्रेंच पोस्ट के विरोधी comments में Paris के स्टेशनों के पास अच्छे कबाब के कई उदाहरण थे, और अंग्रेज़ी में साझा किया गया उदाहरण परिकल्पना को उससे अधिक मजबूत दिखा सकता है
  • Paris में किराया, मज़दूरी, tourism और population density जैसी स्थितियों का असर शुरुआती अनुमान से ज़्यादा रहा हो सकता है, इसलिए आगे विश्लेषण की गुंजाइश बनी हुई है

1 टिप्पणियां

 
GN⁺ 2025-02-25
Hacker News की रायें
  • नमस्ते, मैं मूल पोस्ट का लेखक हूँ
    इस लेख को caffeine के नशे में लिखे जाने के एक हफ्ते से थोड़ा ज़्यादा समय बाद इंटरनेट पर इधर-उधर फैलते देखना—पहले Menéame, और अब यहाँ तक—मज़ेदार रहा, और मैं कुछ बातें जोड़ना चाहता था
    यह लेख असल में कुछ हद तक एक meme था। r/gis की मूल पोस्ट के लिए मैंने बस एक तेज़ “research”, या अधिक सटीक कहें तो “analysis” किया था, लेकिन लोग इसे मेरी उम्मीद से ज़्यादा गंभीरता से लेने लगे, यह देखकर हैरानी हुई। लगता है अच्छा kebab वाकई अहम मुद्दा है
    जैसा कि दूसरों ने कहा, “hypothesis” को verify करने के लिए linear correlation का इस्तेमाल शायद उचित नहीं था। जिस French लेख ने मुझे पहली बार यह देखने पर मजबूर किया, उसकी wording से कुछ ऐसा ही संकेत मिलता था, लेकिन पीछे मुड़कर देखें तो किसी तय radius के भीतर के kebab restaurants औसतन बाकी से ज़्यादा खराब होने की संभावना ज़्यादा है
    और Paris शायद study के लिए काफी खराब जगह थी। यह ऐसा शहर है जहाँ बहुत अच्छे kebab restaurants संयोग से railway stations के पास हैं
    अब लगता है Part 2 शुरू करनी चाहिए

    • मुझे हैरानी है कि study में metro stations तक क्यों शामिल किए गए। मूल quote में सिर्फ train stations की बात थी
      Paris की metro ने मूल रूप से tram network के बड़े हिस्से को replace किया था, इसलिए station density दूसरे metro systems से ज़्यादा है। Paris में ऐसा kebab restaurant ढूँढना बहुत मुश्किल होगा जो metro station से 500m के भीतर न हो
      इसलिए study का अर्थ dilute हो जाता है। मैंने शायद ही कभी महसूस किया हो कि metro station आसपास के इलाके पर खराब असर डालता है; बल्कि लगभग उल्टा ही लगता है
      अगर सिर्फ Paris के बड़े train stations शामिल किए जाते, तो यह कहीं ज़्यादा दिलचस्प होता। algorithmically यह मुश्किल काम नहीं रहा होगा
    • Paris एक special case है। उसका metro network शानदार है, इसलिए हर जगह station पास है
      गैर-metro stations, जैसे Gare du Nord जैसे TER “mainline” stations तक की दूरी शायद ज़्यादा representative result दे सकती है
      दिलचस्पी से इंतज़ार करूँगा
    • यह typical collider bias जैसा दिखता है
      location और quality के बीच मूल रूप से correlation नहीं होना चाहिए। लेकिन हम सिर्फ वे restaurants देख रहे हैं जो अभी “operating” हैं, इसलिए bias आ जाता है
      सरल करें तो restaurants की location अच्छी/खराब और food अच्छी/खराब हो सकती है। जिसकी location भी खराब और food भी खराब हो, वह restaurant लंबे समय तक survive नहीं करता
      जब ऐसे “bad/bad” restaurants हटा दिए जाते हैं, तो correlation बनता हुआ दिखता है, लेकिन वह collider bias की वजह से है
    • मैं कहना चाहता हूँ कि लेख वाकई बहुत अच्छे से लिखा गया है
      “पूरे Pearson correlation coefficient 0.091 के साथ, data दिखाता है कि यह सच भी हो सकता है!” इस हिस्से पर sandwich खाते-खाते मेरा लगभग गला अटक गया था। अफसोस, वह kebab नहीं था
    • अब Ig Nobel paper का इंतज़ार करूँगा
  • शायद इस लेख का title बदलना चाहिए। अभी top comments में से आधे यह मान रहे हैं कि study ने hypothesis confirm कर दी है
    “पूरे Pearson correlation coefficient 0.091 के साथ, data दिखाता है कि यह सच भी हो सकता है! अगर इस बात को नज़रअंदाज़ कर दें कि correlation इतना कमजोर है कि उसे ‘statistically insignificant’ कहना भी काफी उदार assessment होगा”

    • असल में मैं लेखक से अलग निष्कर्ष पर पहुँचा। दिए गए statistics को मैं ऐसे देख रहा हूँ
      400 samples में Google reviews में 3 stars से कम वाले kebab restaurants 17 हैं, और इन्हें “bad kebab” कह लेते हैं
      वे सभी “bad kebab” अपने सबसे नज़दीकी station से 500m के भीतर हैं। 500m से दूर कोई bad kebab restaurant नहीं है
      इसलिए अगर आपने कभी खराब doner kebab खाया है, तो सुरक्षित रूप से मान सकते हैं कि वह आपने train station के पास वाले kebab restaurant से खरीदा था
      शायद station के पास kebab खाने वाले इतने ज़्यादा होते हैं कि average kebab भी profitable हो जाता है
    • यह study है कि topic जितना ज़्यादा आम लोगों की दिलचस्पी वाला हो, HN users के असल लेख पढ़ने की संभावना उतनी ज़्यादा हो जाती है
    • यही अच्छी तरह दिखाता है कि बेहतर clinical journals paper titles में results स्पष्ट और specific रूप से बताने पर साफ़ प्रतिबंध क्यों लगाते हैं
    • title के अंत में बस एक question mark लगा दें तो आसानी से ठीक हो सकता है
  • Berlin में kebab shops की संख्या बहुत ज़्यादा है। शायद हजारों होंगी
    ज़्यादातर मोहल्लों के अंदर हैं और आसपास के local regulars आते हैं। quality में बहुत ज़्यादा फर्क है; कई जगहें food बेचने से ज़्यादा money laundering business के लिए बनी लगती हैं। cash-only, खराब hygiene, और service भी उदासीन
    ऐसी जगहें business point of view से अक्सर बिल्कुल sense नहीं बनातीं। मतलब money laundering को छोड़ दें तो। वे पुरानी और गंदी दिखती हैं, customers कम होते हैं, इसलिए पहचानना आसान है। अगर lunch या dinner time पर कोई खा नहीं रहा है, तो बचना बेहतर है
    इसके उलट सचमुच बेहतरीन जगहें भी हैं, जहाँ proper charcoal grill इस्तेमाल होता है, staff अपना काम जानता है और friendly होता है, और customer handling पर focus रहता है। ऐसी जगहें शानदार होती हैं और आम तौर पर value for money भी अच्छी होती है। कुछ जगहें meat खुद marinate करती हैं और standard kebab तक सीमित नहीं रहतीं
    अगर Berlin जाएँ, तो जिस इलाके में हों वहाँ कहाँ जाना चाहिए, इस पर सलाह लेना अच्छा रहेगा। कुछ कमाल के kebab restaurants हैं, और आम तौर पर वे बहुत पुराने होते हैं
    तीसरी category late-night या tourist-heavy जगहों में होती है, और travelers या drunk लोगों जैसे उन customers को target करती है जो शायद regular नहीं बनेंगे। इस customer base के लिए competition कड़ा है, और कुछ options इतने अच्छे भी हैं कि लोग खास तौर पर घूमकर खाने जाते हैं। कई जगहें operations अच्छी तरह चलाती हैं और throughput तथा consistency optimize करती हैं, लेकिन जरूरी नहीं कि high quality को target करें

    • हो सकता है यह अनजान सवाल हो, लेकिन मैं हमेशा सोचता हूँ कि ऐसी money laundering kebab shops चलती कैसे हैं
      हमारे शहर में भी ऐसी जगहें हैं और हर बार देखकर समझ नहीं आता। अगर कोई खाता ही नहीं, तो वे पैसे कैसे launder करती हैं? शायद मैं सुस्त या भोला हूँ, लेकिन मुझे समझ नहीं आता कि जहाँ सच में products नहीं बिकते, ऐसे business में money laundering का structure कैसे काम करता है
    • money laundering से ज़्यादा लगता है कि ज़्यादातर मामलों में यह tax evasion होगा। risk भी कम है
  • ट्रेन स्टेशन से दूरी और कबाब reviews के बीच कोई correlation नहीं मिला, या और सटीक कहें तो correlation नहीं है—ऐसा नतीजा मिला। statistics class के लिए अच्छी study है

    • correlation भले न हो, लेकिन scatter plot का दायां निचला quadrant असल में खाली दिखता है, और यह एक अहम insight है
      ज़्यादा सटीक कहावत शायद यह होगी: “अच्छा कबाब कहीं भी बिक सकता है, लेकिन खराब कबाब सिर्फ ट्रेन स्टेशन के पास ही बिक सकता है”
      कुल quality के बजाय minimum viable quality देखें तो दूरी के साथ linear correlation जैसा दिखता है। 5% quantile regression इस्तेमाल करें तो distribution की lower boundary आसानी से मिल सकती है
    • मुझे लगता है यह study Metro station तक की दूरी के साथ correlation खोज रही है
      यह बड़ा फर्क है। Paris में सैकड़ों Metro stations हैं, और लगभग हर जगह कोई station पास ही है
      मूल इरादा शायद ट्रेन station तक की दूरी रहा होगा। अगर Paris, Rome जैसा है, तो railway stations के पास सस्ते hostels और हालिया immigrants की रहने की जगहें होती हैं
    • सख्ती से कहें तो उसने linear correlation नहीं पाया
      मान लें x=[-5..+5], y=[25,16,9,4,1,0,1,4,9,16,25], यानी x²। Pearson correlation coefficient R² 0 होगा। हमें पता है कि y, x पर निर्भर करता है, लेकिन linear तरीके से निर्भर नहीं करता
  • TripAdvisor पर Best Kebab के reviews पढ़ना मुझे हमेशा पसंद है। यह Queen Street train station के ठीक बगल में है, इसलिए study से भी मेल खाता है
    https://www.tripadvisor.co.uk/Restaurant_Review-g186534-d125...
    “खाना अधपका था ही, ऊपर से chips और cheese में pubic hair मिला, और जब हमने समस्या बताने की कोशिश की तो वे चाकू लेकर हमारे पीछे दौड़े। Dundas Street तक। बिल्कुल shock कर देने वाला”

    • संदर्भ के लिए, “Knifey Chaseies” उस Glasgow का ऐतिहासिक खेल है जहां यह दुकान है। यानी local tradition में immigrant-style का तड़का जुड़ गया
    • रात के आखिर में इस कबाब shop के पास से गुजरने की बहुत यादें हैं। मैं confirm कर सकता हूं कि यह मेरे खाए सबसे खराब में से था, लेकिन chips ठीक थे
  • इसी तरह Venice में मैंने theory बनाई थी कि pizza slice की कीमत से San Marco तक की दूरी का अंदाज़ा लगाया जा सकता है। जितना महंगा, उतना पास। कभी verify नहीं किया, लेकिन heatmap में देखना मजेदार होगा

  • anecdotal तौर पर coffee के साथ भी यही है। office lobby coffee shops बिना exception भयानक होती हैं। कोई ठीक-ठाक जगह हमेशा कम से कम 5–10 मिनट पैदल दूर होती है

    • office के अंदर वाली machine से मिलने वाली coffee तो और भी खराब होती है
    • original post लिखने वाले को rail access और quality के बीच कोई correlation नहीं मिला
    • कभी-कभी वह किसी दूसरे office building की lobby में भी होती है
  • असली results देखें तो(https://preview.redd.it/znmnejgab5je1.png?width=1000&format=...), न positive correlation दिखता है न negative। हालांकि subjectively मैं उस hypothesis की पुष्टि कर सकता हूं

  • exception के तौर पर Cologne Ehrenfeld का Kebapland Aachen जाने वाली main railway line की छाया में है और Ehrenfeld U-Bahn के ऊपर है
    Köln में मिलने वाला अब तक का सबसे अच्छा कबाब, और प्रति euro सबसे बेहतरीन meal है
    paid ad नहीं है, बस पागलपन की हद तक tasty है

  • मैंने यह observe किया
    दुनिया के हैरान कर देने वाले कई इलाकों में “New York Pizza”, “Manhattan Pizza” जैसे नामों वाली pizza shops हैं
    वहां की pizza, असली New York pizza shops में मिलने वाले पतले, greasy slice pizza से कितनी मिलती-जुलती है, यह उस location के New York से दूर जाने के साथ inversely proportional है
    Boston की New York Pizza काफी मिलती-जुलती है। QLD Brisbane की New York Pizza तुलना में alien food है, और लगता है वहां “pepperoni” और “salami” को interchangeable माना जाता है

    • “pepperoni” और “salami” क्या, दोस्त, spicy sausage तो बस spicy sausage ही है
    • यह काम थोड़ा extra data देता है, लेकिन पहले से आम hypothesis—यानी दूरी जितनी कम, स्वाद उतना करीब—को फिर से propose करने भर तक सीमित है
      author minimum publishable unit खोज रहा है, लेकिन उस standard पर भी खरा नहीं उतरता। publish न करने की सलाह है
    • Brisbane के दक्षिण में Logan जाएं तो हालत और खराब हो जाती है
      यहां “Halal Beef Pepperoni” का practically सिर्फ एक wholesale supplier है, और लगता है इस तरफ की non-chain pizza shops ने local religious sensitivities के हिसाब से उसी को standard बना लिया है
      गीले meat-flavoured पोछे जैसा लगता है, और तीखापन बिल्कुल नहीं है
      “Brooklyn Slice” नया खुल रहा है, और लगता है वे regular salami को promote कर रहे हैं। अगर जरा भी spicy हुआ तो game बदल जाएगा
    • fair कहें तो pepperoni literally spicy salami ही है। chili pepper डाला हुआ salami, और नाम में “pepper” भी वहीं से आया है
    • सुना है कि Italy से जितना दूर जाते हैं, pizza पर उतने ही adventurous ingredients चढ़ते जाते हैं
      पहले New Zealand में रहता था