- Harvard Digital Data Design Institute और BCG के फील्ड एक्सपेरिमेंट ने 758 consultants पर यह आकलन किया कि AI knowledge workers की productivity और quality को कितना बदलता है
- कार्यों को consultants के वास्तविक काम के करीब रखते हुए creativity, analytical thinking, writing, persuasiveness शामिल किए गए, ताकि साधारण benchmark की बजाय वास्तविक कार्य-प्रयोगशीलता देखी जा सके
- ChatGPT-4 ने उन कार्यों में, जहाँ AI अच्छी तरह फिट बैठता है, काम की गति 25% से अधिक, human evaluation performance 40% से अधिक, और task completion rate 12% से अधिक बढ़ाई
- सभी कामों में एक जैसा प्रभाव नहीं मिला, और मजबूत व कमजोर क्षेत्रों में बँटी jagged technological frontier एक मुख्य सीमा के रूप में सामने आई
- व्यावहारिक उपयोग में इसे काम बाँटकर सौंपने वाले Centaurs और workflow में AI को घोलने-मिलाने वाले Cyborgs में बाँटा गया; हर task के लिए मानव और AI के संयोजन को परखना ज़रूरी है
BCG consultants पर फील्ड एक्सपेरिमेंट
- Harvard Digital Data Design Institute के Karim Lakhani आदि ने Boston Consulting Group(BCG) के साथ मिलकर AI का knowledge worker productivity और quality पर प्रभाव आंका
- प्रयोग में 758 consultants शामिल थे, जो BCG के individual contributor workforce का 7% थे
- कार्यों को consultants के रोज़मर्रा के काम के दायरे को दर्शाने के लिए चुना गया
-
रचनात्मकता
-
विश्लेषणात्मक सोच
-
लेखन क्षमता
- प्रेरकता
-
प्रदर्शन में सुधार और सीमाएँ
- जिन task क्षेत्रों में AI अच्छी तरह काम करता है, वहाँ ChatGPT-4 ने प्रदर्शन को काफ़ी बढ़ाया
- काम की गति 25% से अधिक बढ़ी
- human evaluation मानकों पर प्रदर्शन 40% से अधिक बढ़ा
- task completion rate 12% से अधिक बढ़ी
- इसके उलट, AI का प्रदर्शन सभी tasks में एक-सा नहीं था
- कुछ कामों में इसने बेहतरीन नतीजे दिए, लेकिन दूसरे कामों में कमी दिखाई
- इस अंतर को jagged technological frontier के रूप में समेटा गया
ज्ञान-आधारित काम में दिखे उपयोग के दो तरीके
- AI उपयोगकर्ता मोटे तौर पर दो पैटर्न में बँटते हैं
- Centaurs: इंसान और AI के बीच काम बाँटते और delegate करते हैं
- Cyborgs: अपने workflow में AI को integrate करते हैं
- AI का उपयोग करना है या नहीं, इस दो-टूक सोच से अधिक महत्वपूर्ण यह है कि हर workflow में इंसान और AI का संयोजन क्या मूल्य पैदा करता है
1 टिप्पणियां
Hacker News की राय
ये असाइनमेंट GPT के लिए बिल्कुल फिट लगते हैं: creativity, analytical thinking, writing, persuasion जैसे क्षेत्रों में जूतों के 10 ideas, market segmentation, press release, और कर्मचारियों के लिए inspirational memo लिखवाने जैसे काम
पहले असाइनमेंट पर GPT का जवाब: https://chat.openai.com/share/db7556f7-6036-4b3d-a61a-9cd253...
पूरे आत्मविश्वास के साथ GPT hallucination आम management consulting material से लगभग अलग पहचान में नहीं आता
ग्राहक “10 ideas” नहीं, बल्कि “business और market understanding पर आधारित 10 valuable ideas” चाहता है। अगर management consultant इस सवाल का जवाब “boat shoes” जैसा दे, तो वह ग्राहक को लंबे समय तक बनाए नहीं रख पाएगा
इसी तरह software engineering में भी अगर “code की 10 lines लिखो” कहा जाए, तो कहा जा सकता है कि वह ChatGPT द्वारा रोज़ निकाले जाने वाले code से अलग नहीं दिखता
मेरे employer ने McKinsey को कुछ बार hire किया था, जो HYP graduates को hire करने के लिए जानी जाती है, और output, नरम शब्दों में कहें तो, कमजोर था। ऐसी संस्थाओं के साथ मेरा अनुभव मोटे तौर पर ऐसा ही रहा है
मुझे पता है कि यह सिर्फ anecdote है, लेकिन ऐसी studies में confirmation bias काफी दिखता है
इस study ने मुख्य बात दबा दी। LLM कुछ tasks में बेहतर था, लेकिन दूसरे tasks में उसने प्रदर्शन को असल में खराब कर दिया
पहला task study में जिसे “boundary के अंदर” कहा गया है, एक generalist task था, इसलिए performance बढ़ना surprising नहीं है। मजबूत domain knowledge के बिना भी एक well-defined क्षेत्र की research करना LLM की strengths के अनुरूप है। शुरुआती consultants career की शुरुआत में business analyst जैसी role में जो काम करते हैं, वे भी आम तौर पर ऐसे ही generalist tasks होते हैं
LLM बहुत सारी जानकारी को generalize कर चुका है, इसलिए ऐसी general research में मजबूत है, लेकिन वही generalization उसकी कमजोरी भी है। इसे किसी research क्षेत्र के journalist जैसा समझिए। अखबार पढ़ते समय लगता है कि insights मिल रही हैं, लेकिन जैसे ही मैं अपने अच्छे से ज्ञात क्षेत्र पर article पढ़ता हूं, तुरंत दिख जाता है कि analysis में कई flaws हैं और वह विषय को मेरे स्तर तक नहीं समझता
दूसरा “boundary के बाहर” task spreadsheet analysis, interviews, और evidence-backed गहरे analysis की मांग करता था, जो वे काम हैं जिनमें मौजूदा LLM कमजोर हैं। इसलिए non-LLM group को 84.5% मिला, जबकि LLM users सिर्फ 60~70.6% तक रहे
निष्कर्ष यह है कि LLM generalized research के लिए शानदार हैं, लेकिन specialized analytical work के लिए कम उपयुक्त हैं
programming question पूछने पर ChatGPT करीब 20% hallucinate करता है, और मैं इतना skilled हूं कि उसे पकड़ सकूं। दूसरे क्षेत्रों के बारे में पूछते समय भी शायद कम से कम उतनी ही hallucination और misinformation मानकर चलना चाहिए
यह मजेदार है। GPT-3/4 की writing ability भी impressive है, लेकिन उससे ज्यादा shocking बात यह है कि human writing में कितना bluff भरा होता है
“business consultant” ऐसी bluff-heavy writing की जरूरत वाली roles का शिखर है, और ChatGPT best business consultant से भी ज्यादा business consultant जैसा behave कर सकता है
workplace में seriously लिए जाने के लिए कभी-कभी concise idea या data को कई pages के document या slide deck में inflate करना पड़ता है। तभी दूसरे लोग तुरंत पहचानते हैं कि “effort लगाया गया है”
अभी ChatGPT के लिए सबसे fit role शायद concise writing को लेकर उसे बहुत लंबे और fluff से भरे document में expand करना है। receiving side लंबे document या slides को झेलकर “काम हुआ है” मान लेगी, और फिर उसे दोबारा ChatGPT में डालकर original core points का summary निकलवाएगी
जब हम कहते हैं कि “LLM text generate कर सकते हैं”, तो हम 10-lane highway जितने चौड़े brush से painting कर रहे होते हैं। लगता है कि writing असल में क्या है और उसकी कौन-कौन सी categories और levels हैं, इसके लिए हमारी vocabulary काफी limited है
उदाहरण के लिए polite emails, LinkedIn-style inspirational spam, corporate phrasing में GPT पहले attempt से ही humans को पछाड़ देता है—यह मजेदार है और मेरे हिसाब से पूरी तरह expected भी। इसके उलट Game of Thrones की अगली किताब या अच्छी literary writing मांगें तो यह boring, generic, clichés और खाली plot/characters से भरा होकर ढह जाता है
अब writing के landscape को बेहतर conceptual space में map करना होगा। अभी तो ऐसा लगता है कि हम arithmetic और abstract algebra के बराबर difference तक अलग नहीं कर पा रहे हैं
LLM भाषा-संबंधी कामों में हैरान करने वाली हद तक अच्छे हैं। जिसे पहले लोग natural language processing कहते थे, उसका ज़्यादातर हिस्सा अब लगभग दब चुका है। सारांश बनाना, सवाल-जवाब, sentiment analysis वगैरह सचमुच चौंकाने वाले स्तर पर हैं
ऐसे generative कामों में भी ये बहुत मजबूत हैं जहाँ “तथ्य” की सीमाएँ साफ़ नहीं होतीं और जिन्हें Pynchon के उपन्यास की तरह घनी तरह से आपस में फिट होना ज़रूरी नहीं होता। छोटी कहानियाँ, opinion pieces, product copy—ये 1 मिनट में 20 ideas को prototype की तरह निकाल सकने वाला productivity amplifier हैं
लेकिन मौजूदा स्थिति मोटे तौर पर यहीं तक है। Natural language को latent space में उठाकर कुछ हद तक अलग किए जा सकने वाले concepts बनाए जाते हैं, फिर affine transformation जैसी कोई चीज़ की जाती है, और फिर उसे वापस नीचे उतारा जाता है
कंप्यूटर के लिहाज़ से यह बेहद प्रभावशाली है, लेकिन अगर सवाल यह हो कि क्या यह सच में किसी महंगे Penn graduate की जगह ले सकता है, तो संभव है कि पैसे जिस चीज़ के लिए दिए जा रहे हों वह चमकदार product strategy insight नहीं, बल्कि कुछ और हो
जैसे किसी गुस्सैल पेड़-मानव की तस्वीर में थोड़ा बदलाव कर दें, तो भी वह शायद अच्छी गुस्सैल पेड़-मानव तस्वीर ही रहेगी
output स्वीकार्य दिखता है क्योंकि इंसान अपने मानव दिमाग से दरारें भर देता है। इंसान खराब output पहचान लेता है, छोटी ambiguities सुलझा देता है, और मामूली factual/logical errors को अनजाने में ठीक कर देता है
लेकिन LLM के result को किसी दूसरे computer program में सीधे नहीं डालेंगे। इससे पारंपरिक natural language processing के ज़्यादातर काम बाहर हो जाते हैं
मैं आम तौर पर मानता हूँ कि ये ऐसे काम काफ़ी अच्छी तरह कर सकते हैं, लेकिन बड़े datasets पर चलाने के लिए performance अभी पर्याप्त नहीं है
लेकिन फिर तुरंत कहता है कि उसे वैसे ही इस्तेमाल न करें क्योंकि यह “अनैतिक” है
यह इस बारे में ज़्यादा बताता है कि BCG consultants कितने बेकार हैं
जिन लोगों का writing या editing background नहीं है, वे सोचते हैं कि LLM उस field में क्रांति ला देगा। असली writers और editors LLM output को एक बार देखकर समझ जाते हैं कि उसे ठीक करने में उतना ही समय लगेगा जितना शुरू से लिखने में, इसलिए उसका असल में कोई value नहीं है
इसी तरह जो लोग programming नहीं कर सकते या subject की समझ उथली है—खासकर वे managers जो technical दिखना चाहते हैं—वे LLM output देखकर सोचते हैं कि यह तुरंत deploy करने लायक है, जबकि अच्छे programmers देखते हैं कि इसमें इतने बड़े और छोटे issues हैं कि इसे ठीक करना शुरू से लिखने की तुलना में worthwhile नहीं है
20–30 engineers की team में आम तौर पर केवल एक ऐसा engineer होता है जो technically भी शानदार होता है और लोगों से deal करने में भी अच्छा—जिसे देखकर लगता है “यह हमारे साथ क्यों है?” लेकिन उसका स्वभाव कितना भी अच्छा हो, काम तो काम है, और वह management कैसी होनी चाहिए इसका सिर्फ hint देता है। वह videogames भी खेलता है, उसका परिवार भी है और life भी, इसलिए company कहाँ जा रही है, management और गैरज़रूरी responsibilities में उसकी दिलचस्पी नहीं होती। ऊपर से senior लोग उसे सिर्फ “engineer” के रूप में देखते हैं, “manager” के रूप में नहीं
बाकी engineers और managers भी “यह मेरी problem नहीं” वाला रवैया रख लें, तो communication का अजीब खालीपन बनता है। Product के करीब काम करने वाला engineer manager से बात नहीं करना चाहता, क्योंकि डर होता है कि बात “अगर तुम्हें इतना पता है तो तुम ही कर लो?” में बदल जाएगी; manager engineer से बात नहीं करना चाहता, क्योंकि डर होता है कि बात “अगर तुम्हें इतनी रुचि है तो तुम ही कर लो?” में बदल जाएगी
manager और engineer के बीच बढ़ती इस दूरी में management consultant प्रवेश करता है। Senior management द्वारा दी गई flexibility की वजह से management consultant engineer और manager के बीच आ-जा सकता है, किसी से भी बात कर सकता है, और “तो तुम ही कर लो?” में बंधता नहीं। वह report देता है और एक महीने में manager/engineer की एक साल की salary ले जाता है
ईमानदारी से देखें तो company को जो करना चाहिए, वह जानते हुए भी न कहे जाने वाली बहुत-सी चीज़ें होती हैं। क्योंकि कहने से काम बढ़ता है और risk भी। “अच्छा” management consultant ऐसी “करना नहीं चाहते, लेकिन करना चाहिए” वाली चीज़ें ढूँढकर senior management को report करता है, और management उन कामों को करवाने का system बनाता है। अगर किसी को management consultant चाहिए, तो मुझे hire कर सकते हैं। मैं 20 तरीकों से बताऊँगा कि आपकी company क्यों खास अच्छी नहीं है, जिनमें से 18 ChatGPT generate करेगा
मज़ेदार है कि किसी भी thread में ऐसे comment का अनुमान लगाया जा सकता है। “यह [insert] के बारे में ज़्यादा बताता है” बार-बार लिखते रहने से expression खुद अपना meaning खो देता है। क्या कुछ ज़्यादा meaningful नहीं कहा जा सकता?
हैरानी की बात नहीं। GPT डराने वाली हद तक अच्छा है, और programming के साथ भी बहुत अच्छे से फिट बैठता है
GPT-4 से code लिखने को कहता हूँ और देखता हूँ कि वह चलता है या नहीं, लेकिन उस code को जस का तस copy-paste करना कम ही होता है। codebase के context के हिसाब से खुद फिर से लिखता हूँ। फिर भी जब पक्का न हो कि करना कैसे है, तो यह काफी समय बचा देता है
कभी-कभी सुझाव पसंद नहीं आते, लेकिन वह भी उपयोगी होता है। अक्सर problem space दिमाग में और साफ हो जाता है
उसे एक काफी पेचीदा काम दिया जिसका जवाब Google से नहीं मिल रहा था और यह भी पक्का नहीं था कि संभव है या नहीं। requirement यह थी: “एक Python object दिया हो, तो उन functions की सूची दो जिन्होंने इस object को argument के रूप में लिया। मौजूदा code को modify नहीं कर सकते, सिर्फ object structure बदल सकते हैं”
शुरुआत में उसने function बदलने, decorator से wrap करने, current stack trace देखने जैसे ठीक से फिट न बैठने वाले ideas दिए, लेकिन कुछ बार बातचीत के बाद उसने Python tracer को intercept करने वाले तरीके से हल करने को कहा, और वह सच में काम कर गया
चौंकाने वाली बात यह थी कि training data में ऐसा कुछ देखा होगा, ऐसा नहीं लगता, फिर भी उसने टुकड़ों को जोड़ लिया। लगभग इंसानी स्तर के करीब था। पूछने पर उसने debugger के साथ interfere कर सकने जैसी limitation भी आसानी से समझा दी
original के page 10 के example कुछ ऐसे हैं: उपेक्षित markets या sports को target करने वाले नए shoes के 10+ ideas सुझाना, users के आधार पर footwear industry की market segmentation, product promotion press release का draft लिखना, और employees को यह समझाने वाला inspirational memo लिखना कि product competitors से बेहतर क्यों है
निजी तौर पर मुझे इसमें असली value बहुत कम दिखती है
मेरा मतलब यह नहीं कि आप वैसे programmer हैं, लेकिन यह ऐसे type के programmers को निश्चित रूप से संभव बना देता है
एक पूर्व consultant के तौर पर, अगला साफ सवाल दिमाग में आता है। consultants को पूरी तरह हटाकर GPT-4 को सीधे clients के लिए काम करने दिया जाए तो क्या होगा?
client को consultant से काम करवाने के लिए requirements समझानी पड़ती हैं, results review करने पड़ते हैं, feedback देना पड़ता है, और कुछ meetings में भी जाना पड़ता है
लेकिन अगर GPT-4 consultants को इतना बेहतर बना देता है, तो लगता है वह उनका काम भी कर सकता है। बाहर की group के साथ काम न करने से होने वाली communication cost reduction को भी जोड़ दें, तो client बाहरी consultant की cost और management burden हटाकर फायदा सीधे खुद क्यों नहीं लेगा?
खासकर तब, जब client पहले से domain expert हो और उसे सिर्फ extra manpower चाहिए हो। उदाहरण के लिए, marketing brand manager अपने product और marketing को अच्छी तरह जानता है, लेकिन internal headcount limits जैसी वजहों से ज्यादा resources चाहिए हों तो वह marketing consultants के साथ काम कर सकता है
मुझे आश्चर्य है कि BCG ने इस study में भाग लेने के implications को आखिर तक सोचा है या नहीं। “consultants clients की बेहतर मदद करें” से “clients की सीधे मदद करें और दिखा दें कि consultants की बहुत जरूरत नहीं” तक की दूरी बहुत छोटी लगती है
खासकर अगर client एक intern रखकर उसे GPT-4 दे दे
CEO के नजरिए से, उन्हें बुलाओ, बहुत पैसा दो, उनसे plan और strategy बनवाओ; अगर सब ठीक चला तो credit ले लो, और अगर नहीं चला तो कह दो “मैंने McKinsey experts के साथ close work किया था। इसलिए यह मेरी जिम्मेदारी नहीं है”
HN prediction करने में सचमुच खराब है। कुछ ही महीने पहले तक comments भरे पड़े थे जिनमें पूरे confidence से कहा जा रहा था कि LLMs बस stochastic parrots हैं और कुछ हासिल नहीं कर पाएंगे
“अगली AI winter बस आने ही वाली है, यह खयाल दिमाग से नहीं निकलता” — हाँ, बिल्कुल
[0] https://news.ycombinator.com/item?id=23886325
और article पढ़ें तो जिस output level की बात हो रही है, वह लगभग ठीक इसी तरह का है। उपेक्षित markets या sports को target करने वाले नए shoes के 10+ ideas, footwear industry की market segmentation, product promotion press release, competitors से बेहतर होने की वजहों वाला employee inspiration memo — ऐसी चीजें
इसके अलावा, दूसरे task में non-LLM group ने कहीं बेहतर किया
अगर आपने बेतुकी तरह खराब prediction की है, तो इसका मतलब है कि उस चीज के बारे में आपका model गलत है और उसे update करने की जरूरत है
लेकिन अगर model को बिल्कुल ठीक किए बिना आप लगातार prediction करते रहें, तो यह बड़ी समस्या है
समय के साथ बहुत-सा office work GPT जैसी services से optimize हो जाएगा
मुझे इतना technical sense था कि मेरे office work में कई काम repeatable और script से handle किए जा सकते हैं, लेकिन इतना नहीं कि खुद scripts लिख सकूँ। ChatGPT की वजह से मैं वे scripts बना पाया, और उन्हें पूरी तरह काम करने लायक बनाने में करीब 15–20 घंटे लगे
Python scripting का बहुत थोड़ा ज्ञान था और pandas या xlswriter जैसी चीजों के बारे में बिल्कुल नहीं जानता था, लेकिन मैं कुछ ऐसा बना पाया जो हफ्ते में 20–25 घंटे बचा देता है
HN पर programming में अच्छे लोग बहुत हैं, इसलिए लगता है वे ChatGPT जैसी services द्वारा non-programmers के लिए खुलने वाली दुनिया को underestimate करते हैं। दूसरी तरफ, यह बिना जिज्ञासा वाले लोगों को कम सीखने वाला भी बना सकता है। पहले मैं कई snapd services को script से रोकना सीखने के लिए Google पर खोजकर चीजें जोड़ता, लेकिन अब ChatGPT से पूछता हूँ और एक मिनट से भी कम में working script मिल जाती है
सार में ध्यान देने लायक दो बातें हैं
इसमें “AI की क्षमताओं की सीमा के भीतर आने वाले 18 वास्तविक consulting tasks” कहा गया है। यानी उन्होंने जानबूझकर वे tasks चुने जिन्हें GPT-4 कर सकता था। GPT-4 जो काम नहीं कर सकता, वे बहुत हैं, इसलिए जब कहा जाए कि performance में बड़ी बढ़ोतरी हुई, तब भी यह संदर्भ रखना चाहिए कि बात GPT-4 के लिए अच्छी तरह फिट बैठने वाले tasks तक सीमित है
साथ ही इसमें कहा गया है, “औसत से कम प्रदर्शन करने वालों में उनके अपने score की तुलना में 43% और औसत से ऊपर प्रदर्शन करने वालों में 17% बढ़ोतरी हुई।” GPT-4 के लिए खास तौर पर अनुकूल tasks ही चुने गए थे, फिर भी औसत से ऊपर प्रदर्शन करने वालों का सुधार 17% था। अगर कुल मिलाकर ऐसा इज़ाफ़ा दिखता है तो यह अब भी प्रभावशाली है, लेकिन कुछ लोग इसे जिस तरह बेचने की कोशिश कर रहे हैं, उसके मुकाबले 17% मुझे काफी छोटा लगता है
औसत से ऊपर प्रदर्शन करने वालों को अपनी क्षमता पर भरोसा होता है, इसलिए वे GPT output में ज़्यादा काट-छांट करने की संभावना रखते हैं। इसलिए औसत से कम वाला group final output ज़्यादा जल्दी बना लेता है, और इस test में time limit थी, इसलिए speed महत्वपूर्ण रही होगी
ChatGPT लंबा-चौड़ा लिखने में बहुत मज़बूत है, और marketing copy और inspirational messages स्वभाव से ही verbose होते हैं। यानी tasks बिना मदद वाले ChatGPT के लिए tailor-made थे, इसलिए high performers उलटे नुकसान में रहे
efficiency में छोटी बढ़ोतरी long-term growth में बड़ी बढ़त बन जाती है। 17% भी बहुत बड़ा improvement है