1 पॉइंट द्वारा GN⁺ 2023-10-02 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • Harvard Digital Data Design Institute और BCG के फील्ड एक्सपेरिमेंट ने 758 consultants पर यह आकलन किया कि AI knowledge workers की productivity और quality को कितना बदलता है
  • कार्यों को consultants के वास्तविक काम के करीब रखते हुए creativity, analytical thinking, writing, persuasiveness शामिल किए गए, ताकि साधारण benchmark की बजाय वास्तविक कार्य-प्रयोगशीलता देखी जा सके
  • ChatGPT-4 ने उन कार्यों में, जहाँ AI अच्छी तरह फिट बैठता है, काम की गति 25% से अधिक, human evaluation performance 40% से अधिक, और task completion rate 12% से अधिक बढ़ाई
  • सभी कामों में एक जैसा प्रभाव नहीं मिला, और मजबूत व कमजोर क्षेत्रों में बँटी jagged technological frontier एक मुख्य सीमा के रूप में सामने आई
  • व्यावहारिक उपयोग में इसे काम बाँटकर सौंपने वाले Centaurs और workflow में AI को घोलने-मिलाने वाले Cyborgs में बाँटा गया; हर task के लिए मानव और AI के संयोजन को परखना ज़रूरी है

BCG consultants पर फील्ड एक्सपेरिमेंट

  • Harvard Digital Data Design Institute के Karim Lakhani आदि ने Boston Consulting Group(BCG) के साथ मिलकर AI का knowledge worker productivity और quality पर प्रभाव आंका
  • प्रयोग में 758 consultants शामिल थे, जो BCG के individual contributor workforce का 7% थे
  • कार्यों को consultants के रोज़मर्रा के काम के दायरे को दर्शाने के लिए चुना गया
    • रचनात्मकता

    • विश्लेषणात्मक सोच

    • लेखन क्षमता

      • प्रेरकता

प्रदर्शन में सुधार और सीमाएँ

  • जिन task क्षेत्रों में AI अच्छी तरह काम करता है, वहाँ ChatGPT-4 ने प्रदर्शन को काफ़ी बढ़ाया
    • काम की गति 25% से अधिक बढ़ी
    • human evaluation मानकों पर प्रदर्शन 40% से अधिक बढ़ा
    • task completion rate 12% से अधिक बढ़ी
  • इसके उलट, AI का प्रदर्शन सभी tasks में एक-सा नहीं था
    • कुछ कामों में इसने बेहतरीन नतीजे दिए, लेकिन दूसरे कामों में कमी दिखाई
    • इस अंतर को jagged technological frontier के रूप में समेटा गया

ज्ञान-आधारित काम में दिखे उपयोग के दो तरीके

  • AI उपयोगकर्ता मोटे तौर पर दो पैटर्न में बँटते हैं
    • Centaurs: इंसान और AI के बीच काम बाँटते और delegate करते हैं
    • Cyborgs: अपने workflow में AI को integrate करते हैं
  • AI का उपयोग करना है या नहीं, इस दो-टूक सोच से अधिक महत्वपूर्ण यह है कि हर workflow में इंसान और AI का संयोजन क्या मूल्य पैदा करता है

1 टिप्पणियां

 
GN⁺ 2023-10-02
Hacker News की राय
  • ये असाइनमेंट GPT के लिए बिल्कुल फिट लगते हैं: creativity, analytical thinking, writing, persuasion जैसे क्षेत्रों में जूतों के 10 ideas, market segmentation, press release, और कर्मचारियों के लिए inspirational memo लिखवाने जैसे काम
    पहले असाइनमेंट पर GPT का जवाब: https://chat.openai.com/share/db7556f7-6036-4b3d-a61a-9cd253...
    पूरे आत्मविश्वास के साथ GPT hallucination आम management consulting material से लगभग अलग पहचान में नहीं आता

    • अगर काम इस तरह का है कि “ideas खास नहीं हैं, spreadsheet है, marketing copy की किसी को परवाह नहीं, senior-management style की बकवास से कोई inspired नहीं होता”, तो वह शुरुआत से ही कम value वाला है और LLM के लिए लगभग perfect input है
    • सिर्फ output देखें तो बात सही है, लेकिन knowledge worker की value मुख्यतः input की quality से आती है
      ग्राहक “10 ideas” नहीं, बल्कि “business और market understanding पर आधारित 10 valuable ideas” चाहता है। अगर management consultant इस सवाल का जवाब “boat shoes” जैसा दे, तो वह ग्राहक को लंबे समय तक बनाए नहीं रख पाएगा
      इसी तरह software engineering में भी अगर “code की 10 lines लिखो” कहा जाए, तो कहा जा सकता है कि वह ChatGPT द्वारा रोज़ निकाले जाने वाले code से अलग नहीं दिखता
    • “dog walkers के लिए, built-in poop bag dispenser” को नापसंद करूं या पसंद, समझ नहीं आता, और “visually impaired लोगों के लिए, haptic feedback” — haptic shoes वाकई बड़ा innovative है
    • अगर पूरे आत्मविश्वास वाला GPT hallucination management consulting material जैसा है, तो Harvard और उसके आसपास की संस्थाओं के लिए भी यह काफी फिट लगता है
      मेरे employer ने McKinsey को कुछ बार hire किया था, जो HYP graduates को hire करने के लिए जानी जाती है, और output, नरम शब्दों में कहें तो, कमजोर था। ऐसी संस्थाओं के साथ मेरा अनुभव मोटे तौर पर ऐसा ही रहा है
      मुझे पता है कि यह सिर्फ anecdote है, लेकिन ऐसी studies में confirmation bias काफी दिखता है
    • GPT का जवाब ऐसे पढ़ता है जैसे MAD magazine से लिया गया हो
  • इस study ने मुख्य बात दबा दी। LLM कुछ tasks में बेहतर था, लेकिन दूसरे tasks में उसने प्रदर्शन को असल में खराब कर दिया
    पहला task study में जिसे “boundary के अंदर” कहा गया है, एक generalist task था, इसलिए performance बढ़ना surprising नहीं है। मजबूत domain knowledge के बिना भी एक well-defined क्षेत्र की research करना LLM की strengths के अनुरूप है। शुरुआती consultants career की शुरुआत में business analyst जैसी role में जो काम करते हैं, वे भी आम तौर पर ऐसे ही generalist tasks होते हैं
    LLM बहुत सारी जानकारी को generalize कर चुका है, इसलिए ऐसी general research में मजबूत है, लेकिन वही generalization उसकी कमजोरी भी है। इसे किसी research क्षेत्र के journalist जैसा समझिए। अखबार पढ़ते समय लगता है कि insights मिल रही हैं, लेकिन जैसे ही मैं अपने अच्छे से ज्ञात क्षेत्र पर article पढ़ता हूं, तुरंत दिख जाता है कि analysis में कई flaws हैं और वह विषय को मेरे स्तर तक नहीं समझता
    दूसरा “boundary के बाहर” task spreadsheet analysis, interviews, और evidence-backed गहरे analysis की मांग करता था, जो वे काम हैं जिनमें मौजूदा LLM कमजोर हैं। इसलिए non-LLM group को 84.5% मिला, जबकि LLM users सिर्फ 60~70.6% तक रहे
    निष्कर्ष यह है कि LLM generalized research के लिए शानदार हैं, लेकिन specialized analytical work के लिए कम उपयुक्त हैं

    • यह Gell-Mann amnesia का नया version लगता है। मैं इसे LLm-man amnesia कहना चाहूंगा
      programming question पूछने पर ChatGPT करीब 20% hallucinate करता है, और मैं इतना skilled हूं कि उसे पकड़ सकूं। दूसरे क्षेत्रों के बारे में पूछते समय भी शायद कम से कम उतनी ही hallucination और misinformation मानकर चलना चाहिए
    • LLM आम तौर पर उन कामों में मजबूत हैं जिन्हें average knowledge worker अच्छी तरह करता है या relatively जल्दी train होकर अच्छी तरह कर सकता है
    • LLM की journalist से तुलना अच्छा insight है
  • यह मजेदार है। GPT-3/4 की writing ability भी impressive है, लेकिन उससे ज्यादा shocking बात यह है कि human writing में कितना bluff भरा होता है
    “business consultant” ऐसी bluff-heavy writing की जरूरत वाली roles का शिखर है, और ChatGPT best business consultant से भी ज्यादा business consultant जैसा behave कर सकता है
    workplace में seriously लिए जाने के लिए कभी-कभी concise idea या data को कई pages के document या slide deck में inflate करना पड़ता है। तभी दूसरे लोग तुरंत पहचानते हैं कि “effort लगाया गया है”
    अभी ChatGPT के लिए सबसे fit role शायद concise writing को लेकर उसे बहुत लंबे और fluff से भरे document में expand करना है। receiving side लंबे document या slides को झेलकर “काम हुआ है” मान लेगी, और फिर उसे दोबारा ChatGPT में डालकर original core points का summary निकलवाएगी

    • अधिकतर लोगों ने इस पर focus किया कि LLM क्या कर सकते हैं, लेकिन उतना ही या उससे भी ज्यादा interesting यह है कि वे क्या नहीं कर सकते और क्यों
      जब हम कहते हैं कि “LLM text generate कर सकते हैं”, तो हम 10-lane highway जितने चौड़े brush से painting कर रहे होते हैं। लगता है कि writing असल में क्या है और उसकी कौन-कौन सी categories और levels हैं, इसके लिए हमारी vocabulary काफी limited है
      उदाहरण के लिए polite emails, LinkedIn-style inspirational spam, corporate phrasing में GPT पहले attempt से ही humans को पछाड़ देता है—यह मजेदार है और मेरे हिसाब से पूरी तरह expected भी। इसके उलट Game of Thrones की अगली किताब या अच्छी literary writing मांगें तो यह boring, generic, clichés और खाली plot/characters से भरा होकर ढह जाता है
      अब writing के landscape को बेहतर conceptual space में map करना होगा। अभी तो ऐसा लगता है कि हम arithmetic और abstract algebra के बराबर difference तक अलग नहीं कर पा रहे हैं
  • LLM भाषा-संबंधी कामों में हैरान करने वाली हद तक अच्छे हैं। जिसे पहले लोग natural language processing कहते थे, उसका ज़्यादातर हिस्सा अब लगभग दब चुका है। सारांश बनाना, सवाल-जवाब, sentiment analysis वगैरह सचमुच चौंकाने वाले स्तर पर हैं
    ऐसे generative कामों में भी ये बहुत मजबूत हैं जहाँ “तथ्य” की सीमाएँ साफ़ नहीं होतीं और जिन्हें Pynchon के उपन्यास की तरह घनी तरह से आपस में फिट होना ज़रूरी नहीं होता। छोटी कहानियाँ, opinion pieces, product copy—ये 1 मिनट में 20 ideas को prototype की तरह निकाल सकने वाला productivity amplifier हैं
    लेकिन मौजूदा स्थिति मोटे तौर पर यहीं तक है। Natural language को latent space में उठाकर कुछ हद तक अलग किए जा सकने वाले concepts बनाए जाते हैं, फिर affine transformation जैसी कोई चीज़ की जाती है, और फिर उसे वापस नीचे उतारा जाता है
    कंप्यूटर के लिहाज़ से यह बेहद प्रभावशाली है, लेकिन अगर सवाल यह हो कि क्या यह सच में किसी महंगे Penn graduate की जगह ले सकता है, तो संभव है कि पैसे जिस चीज़ के लिए दिए जा रहे हों वह चमकदार product strategy insight नहीं, बल्कि कुछ और हो

    • मुझे जिज्ञासा है कि AI को कानून में दक्ष होने में कितना समय लगेगा। अभी जिन भाषा-कार्य में यह अच्छा है, वे कला-कार्य जैसे हैं। यह ऐसे problems हल करता है जिनका solution space बहुत बड़ा है और जो छोटे बदलावों के प्रति robust हैं
      जैसे किसी गुस्सैल पेड़-मानव की तस्वीर में थोड़ा बदलाव कर दें, तो भी वह शायद अच्छी गुस्सैल पेड़-मानव तस्वीर ही रहेगी
    • सहमत होना मुश्किल है। LLM, domain कितना भी सीमित क्यों न हो, कोई भी काम भरोसेमंद तरीके से नहीं कर पाते
      output स्वीकार्य दिखता है क्योंकि इंसान अपने मानव दिमाग से दरारें भर देता है। इंसान खराब output पहचान लेता है, छोटी ambiguities सुलझा देता है, और मामूली factual/logical errors को अनजाने में ठीक कर देता है
      लेकिन LLM के result को किसी दूसरे computer program में सीधे नहीं डालेंगे। इससे पारंपरिक natural language processing के ज़्यादातर काम बाहर हो जाते हैं
    • “जिसे पहले लोग natural language processing कहते थे, उसका ज़्यादातर हिस्सा अब दब चुका है” — यह बात ज़्यादातर production service use cases में सच होने के लिए LLM को कम से कम 10 गुना तेज़ होना होगा
      मैं आम तौर पर मानता हूँ कि ये ऐसे काम काफ़ी अच्छी तरह कर सकते हैं, लेकिन बड़े datasets पर चलाने के लिए performance अभी पर्याप्त नहीं है
    • अगर खास तौर पर natural-language-processed text माँगा जाए तो यह बहुत अच्छा कर देता है
      लेकिन फिर तुरंत कहता है कि उसे वैसे ही इस्तेमाल न करें क्योंकि यह “अनैतिक” है
  • यह इस बारे में ज़्यादा बताता है कि BCG consultants कितने बेकार हैं

    • LLM में भी शायद वही पुरानी कहावत लागू होती है कि “media हर चीज़ पर सही है, बस उस field को छोड़कर जिसमें मैं expert हूँ।” LLM output भी मुझे हर field में अच्छा दिखता है, बस मेरी expert field को छोड़कर
      जिन लोगों का writing या editing background नहीं है, वे सोचते हैं कि LLM उस field में क्रांति ला देगा। असली writers और editors LLM output को एक बार देखकर समझ जाते हैं कि उसे ठीक करने में उतना ही समय लगेगा जितना शुरू से लिखने में, इसलिए उसका असल में कोई value नहीं है
      इसी तरह जो लोग programming नहीं कर सकते या subject की समझ उथली है—खासकर वे managers जो technical दिखना चाहते हैं—वे LLM output देखकर सोचते हैं कि यह तुरंत deploy करने लायक है, जबकि अच्छे programmers देखते हैं कि इसमें इतने बड़े और छोटे issues हैं कि इसे ठीक करना शुरू से लिखने की तुलना में worthwhile नहीं है
    • ज़्यादातर management consultants बेकार होते हैं, लेकिन एक reality भी है जिसे स्वीकार करना होगा
      20–30 engineers की team में आम तौर पर केवल एक ऐसा engineer होता है जो technically भी शानदार होता है और लोगों से deal करने में भी अच्छा—जिसे देखकर लगता है “यह हमारे साथ क्यों है?” लेकिन उसका स्वभाव कितना भी अच्छा हो, काम तो काम है, और वह management कैसी होनी चाहिए इसका सिर्फ hint देता है। वह videogames भी खेलता है, उसका परिवार भी है और life भी, इसलिए company कहाँ जा रही है, management और गैरज़रूरी responsibilities में उसकी दिलचस्पी नहीं होती। ऊपर से senior लोग उसे सिर्फ “engineer” के रूप में देखते हैं, “manager” के रूप में नहीं
      बाकी engineers और managers भी “यह मेरी problem नहीं” वाला रवैया रख लें, तो communication का अजीब खालीपन बनता है। Product के करीब काम करने वाला engineer manager से बात नहीं करना चाहता, क्योंकि डर होता है कि बात “अगर तुम्हें इतना पता है तो तुम ही कर लो?” में बदल जाएगी; manager engineer से बात नहीं करना चाहता, क्योंकि डर होता है कि बात “अगर तुम्हें इतनी रुचि है तो तुम ही कर लो?” में बदल जाएगी
      manager और engineer के बीच बढ़ती इस दूरी में management consultant प्रवेश करता है। Senior management द्वारा दी गई flexibility की वजह से management consultant engineer और manager के बीच आ-जा सकता है, किसी से भी बात कर सकता है, और “तो तुम ही कर लो?” में बंधता नहीं। वह report देता है और एक महीने में manager/engineer की एक साल की salary ले जाता है
      ईमानदारी से देखें तो company को जो करना चाहिए, वह जानते हुए भी न कहे जाने वाली बहुत-सी चीज़ें होती हैं। क्योंकि कहने से काम बढ़ता है और risk भी। “अच्छा” management consultant ऐसी “करना नहीं चाहते, लेकिन करना चाहिए” वाली चीज़ें ढूँढकर senior management को report करता है, और management उन कामों को करवाने का system बनाता है। अगर किसी को management consultant चाहिए, तो मुझे hire कर सकते हैं। मैं 20 तरीकों से बताऊँगा कि आपकी company क्यों खास अच्छी नहीं है, जिनमें से 18 ChatGPT generate करेगा
    • कुछ हद तक सहमत हूँ। LLM ने मेरे programming output को मुख्य तौर पर JSDoc और PR descriptions लिखने में बढ़ाया है। ये वे काम हैं जिन्हें मैं खास करना नहीं चाहता
    • यह study बस इतना दिखाती है कि BCG consultants के काम का 40% असल value-add के बिना noise है। लगता है customers को अब 40% discount माँगना चाहिए
    • GPT जब भी कुछ करता है, तब “यह [target] के बारे में ज़्यादा बताता है” वाला वाक्य बार-बार दोहराया जाना ही ज़्यादा कुछ बताता है
      मज़ेदार है कि किसी भी thread में ऐसे comment का अनुमान लगाया जा सकता है। “यह [insert] के बारे में ज़्यादा बताता है” बार-बार लिखते रहने से expression खुद अपना meaning खो देता है। क्या कुछ ज़्यादा meaningful नहीं कहा जा सकता?
  • हैरानी की बात नहीं। GPT डराने वाली हद तक अच्छा है, और programming के साथ भी बहुत अच्छे से फिट बैठता है
    GPT-4 से code लिखने को कहता हूँ और देखता हूँ कि वह चलता है या नहीं, लेकिन उस code को जस का तस copy-paste करना कम ही होता है। codebase के context के हिसाब से खुद फिर से लिखता हूँ। फिर भी जब पक्का न हो कि करना कैसे है, तो यह काफी समय बचा देता है
    कभी-कभी सुझाव पसंद नहीं आते, लेकिन वह भी उपयोगी होता है। अक्सर problem space दिमाग में और साफ हो जाता है

    • कल पहली बार ChatGPT को code के लिए इस्तेमाल किया
      उसे एक काफी पेचीदा काम दिया जिसका जवाब Google से नहीं मिल रहा था और यह भी पक्का नहीं था कि संभव है या नहीं। requirement यह थी: “एक Python object दिया हो, तो उन functions की सूची दो जिन्होंने इस object को argument के रूप में लिया। मौजूदा code को modify नहीं कर सकते, सिर्फ object structure बदल सकते हैं”
      शुरुआत में उसने function बदलने, decorator से wrap करने, current stack trace देखने जैसे ठीक से फिट न बैठने वाले ideas दिए, लेकिन कुछ बार बातचीत के बाद उसने Python tracer को intercept करने वाले तरीके से हल करने को कहा, और वह सच में काम कर गया
      चौंकाने वाली बात यह थी कि training data में ऐसा कुछ देखा होगा, ऐसा नहीं लगता, फिर भी उसने टुकड़ों को जोड़ लिया। लगभग इंसानी स्तर के करीब था। पूछने पर उसने debugger के साथ interfere कर सकने जैसी limitation भी आसानी से समझा दी
    • प्रकाशित लेख programming task के बारे में नहीं, बल्कि “strategy consultants” के लिए text generation के बारे में है
      original के page 10 के example कुछ ऐसे हैं: उपेक्षित markets या sports को target करने वाले नए shoes के 10+ ideas सुझाना, users के आधार पर footwear industry की market segmentation, product promotion press release का draft लिखना, और employees को यह समझाने वाला inspirational memo लिखना कि product competitors से बेहतर क्यों है
      निजी तौर पर मुझे इसमें असली value बहुत कम दिखती है
    • GPT-4 को problem समझाने की क्रिया खुद भी कभी-कभी जवाब जितनी मददगार होती है। लगभग enhanced rubber duck debugging जैसी
    • यह “चलने तक अलग-अलग चीजें try करते रहो” वाली programming से बस एक कदम दूर है
      मेरा मतलब यह नहीं कि आप वैसे programmer हैं, लेकिन यह ऐसे type के programmers को निश्चित रूप से संभव बना देता है
    • सचमुच बहुत बोलने वाला rubber duck है: https://en.wikipedia.org/wiki/Rubber_duck_debugging
  • एक पूर्व consultant के तौर पर, अगला साफ सवाल दिमाग में आता है। consultants को पूरी तरह हटाकर GPT-4 को सीधे clients के लिए काम करने दिया जाए तो क्या होगा?
    client को consultant से काम करवाने के लिए requirements समझानी पड़ती हैं, results review करने पड़ते हैं, feedback देना पड़ता है, और कुछ meetings में भी जाना पड़ता है
    लेकिन अगर GPT-4 consultants को इतना बेहतर बना देता है, तो लगता है वह उनका काम भी कर सकता है। बाहर की group के साथ काम न करने से होने वाली communication cost reduction को भी जोड़ दें, तो client बाहरी consultant की cost और management burden हटाकर फायदा सीधे खुद क्यों नहीं लेगा?
    खासकर तब, जब client पहले से domain expert हो और उसे सिर्फ extra manpower चाहिए हो। उदाहरण के लिए, marketing brand manager अपने product और marketing को अच्छी तरह जानता है, लेकिन internal headcount limits जैसी वजहों से ज्यादा resources चाहिए हों तो वह marketing consultants के साथ काम कर सकता है
    मुझे आश्चर्य है कि BCG ने इस study में भाग लेने के implications को आखिर तक सोचा है या नहीं। “consultants clients की बेहतर मदद करें” से “clients की सीधे मदद करें और दिखा दें कि consultants की बहुत जरूरत नहीं” तक की दूरी बहुत छोटी लगती है
    खासकर अगर client एक intern रखकर उसे GPT-4 दे दे

    • BCG या McKinsey जैसी firms आम तौर पर responsibility avoidance के लिए होती हैं
      CEO के नजरिए से, उन्हें बुलाओ, बहुत पैसा दो, उनसे plan और strategy बनवाओ; अगर सब ठीक चला तो credit ले लो, और अगर नहीं चला तो कह दो “मैंने McKinsey experts के साथ close work किया था। इसलिए यह मेरी जिम्मेदारी नहीं है”
  • HN prediction करने में सचमुच खराब है। कुछ ही महीने पहले तक comments भरे पड़े थे जिनमें पूरे confidence से कहा जा रहा था कि LLMs बस stochastic parrots हैं और कुछ हासिल नहीं कर पाएंगे
    “अगली AI winter बस आने ही वाली है, यह खयाल दिमाग से नहीं निकलता” — हाँ, बिल्कुल
    [0] https://news.ycombinator.com/item?id=23886325

    • किसने दावा किया कि management consultants stochastic parrots नहीं हैं?
    • उस comment में यह भी कहा गया था, “अगर आप content marketing spam को cost-effectively replace करने का तरीका ढूंढ रहे हैं, तो अच्छा है। आप सफल हो गए”
      और article पढ़ें तो जिस output level की बात हो रही है, वह लगभग ठीक इसी तरह का है। उपेक्षित markets या sports को target करने वाले नए shoes के 10+ ideas, footwear industry की market segmentation, product promotion press release, competitors से बेहतर होने की वजहों वाला employee inspiration memo — ऐसी चीजें
      इसके अलावा, दूसरे task में non-LLM group ने कहीं बेहतर किया
    • मुझे नहीं पता कि यह paper बहुत कुछ prove करता है या नहीं। press release उगलना stochastic parrot जैसा task ही लगता है
    • prediction गलत होना ठीक है। जो सहन करना मुश्किल है, वह है recalibration का पूरी तरह अभाव
      अगर आपने बेतुकी तरह खराब prediction की है, तो इसका मतलब है कि उस चीज के बारे में आपका model गलत है और उसे update करने की जरूरत है
      लेकिन अगर model को बिल्कुल ठीक किए बिना आप लगातार prediction करते रहें, तो यह बड़ी समस्या है
    • वह comment शायद HN hall of fame में जाएगा, उस व्यक्ति की तरह जिसने कहा था कि Dropbox को rsync जैसी चीज से आसानी से replace किया जा सकता है
  • समय के साथ बहुत-सा office work GPT जैसी services से optimize हो जाएगा
    मुझे इतना technical sense था कि मेरे office work में कई काम repeatable और script से handle किए जा सकते हैं, लेकिन इतना नहीं कि खुद scripts लिख सकूँ। ChatGPT की वजह से मैं वे scripts बना पाया, और उन्हें पूरी तरह काम करने लायक बनाने में करीब 15–20 घंटे लगे
    Python scripting का बहुत थोड़ा ज्ञान था और pandas या xlswriter जैसी चीजों के बारे में बिल्कुल नहीं जानता था, लेकिन मैं कुछ ऐसा बना पाया जो हफ्ते में 20–25 घंटे बचा देता है
    HN पर programming में अच्छे लोग बहुत हैं, इसलिए लगता है वे ChatGPT जैसी services द्वारा non-programmers के लिए खुलने वाली दुनिया को underestimate करते हैं। दूसरी तरफ, यह बिना जिज्ञासा वाले लोगों को कम सीखने वाला भी बना सकता है। पहले मैं कई snapd services को script से रोकना सीखने के लिए Google पर खोजकर चीजें जोड़ता, लेकिन अब ChatGPT से पूछता हूँ और एक मिनट से भी कम में working script मिल जाती है

    • पूरी तरह सहमत। “क्या X संभव है, कैसे करें” से शुरू करके, जिन समस्याओं के लिए search terms तक नहीं पता थे, उनके rough proof-of-concepts कई बार बना लिए
  • सार में ध्यान देने लायक दो बातें हैं
    इसमें “AI की क्षमताओं की सीमा के भीतर आने वाले 18 वास्तविक consulting tasks” कहा गया है। यानी उन्होंने जानबूझकर वे tasks चुने जिन्हें GPT-4 कर सकता था। GPT-4 जो काम नहीं कर सकता, वे बहुत हैं, इसलिए जब कहा जाए कि performance में बड़ी बढ़ोतरी हुई, तब भी यह संदर्भ रखना चाहिए कि बात GPT-4 के लिए अच्छी तरह फिट बैठने वाले tasks तक सीमित है
    साथ ही इसमें कहा गया है, “औसत से कम प्रदर्शन करने वालों में उनके अपने score की तुलना में 43% और औसत से ऊपर प्रदर्शन करने वालों में 17% बढ़ोतरी हुई।” GPT-4 के लिए खास तौर पर अनुकूल tasks ही चुने गए थे, फिर भी औसत से ऊपर प्रदर्शन करने वालों का सुधार 17% था। अगर कुल मिलाकर ऐसा इज़ाफ़ा दिखता है तो यह अब भी प्रभावशाली है, लेकिन कुछ लोग इसे जिस तरह बेचने की कोशिश कर रहे हैं, उसके मुकाबले 17% मुझे काफी छोटा लगता है

    • औसत से कम प्रदर्शन करने वालों के लिए GPT output को जस का तस स्वीकार करना ज़्यादा आसान हो सकता है। क्योंकि उसमें review और edit करने की क्षमता कम होती है
      औसत से ऊपर प्रदर्शन करने वालों को अपनी क्षमता पर भरोसा होता है, इसलिए वे GPT output में ज़्यादा काट-छांट करने की संभावना रखते हैं। इसलिए औसत से कम वाला group final output ज़्यादा जल्दी बना लेता है, और इस test में time limit थी, इसलिए speed महत्वपूर्ण रही होगी
      ChatGPT लंबा-चौड़ा लिखने में बहुत मज़बूत है, और marketing copy और inspirational messages स्वभाव से ही verbose होते हैं। यानी tasks बिना मदद वाले ChatGPT के लिए tailor-made थे, इसलिए high performers उलटे नुकसान में रहे
    • आप इसे कम आंक रहे हैं। फायदे compound होकर जमा होते हैं
      efficiency में छोटी बढ़ोतरी long-term growth में बड़ी बढ़त बन जाती है। 17% भी बहुत बड़ा improvement है