ChatGPT का उग्र असामान्य व्यवहार
(garymarcus.substack.com)- पिछले कुछ घंटों में कई यूज़र्स ने ChatGPT के असामान्य व्यवहार की रिपोर्ट की है, और OpenAI ने भी समस्या को स्वीकार किया है, जिससे service stability को लेकर चिंताएं बढ़ी हैं
- समस्या का कारण और fix कब तक आएगा, यह ज्ञात नहीं है; Gary Marcus ने निश्चित अटकलों से बचा
- Marcus ने दो हफ्ते पहले दी गई अपनी चेतावनी “chatbots को general बनने न दें” फिर से उठाई, और high-risk uses में उन्हें अधिकार देने पर चिंता जताई
- उन्होंने कहा कि generative AI बड़े data piles और hidden prompt tuning पर निर्भर alchemy-like approach के करीब है, और मौजूदा systems में stability और safety guarantees को engineering के जरिए सुनिश्चित नहीं किया गया है
- ज्यादा interpretable और maintenance/debugging में आसान तकनीक के बिना इसे भरोसेमंद AI के रूप में扱ना मुश्किल है
ChatGPT का असामान्य व्यवहार और OpenAI की स्वीकारोक्ति
- पिछले कुछ घंटों में users ने ChatGPT में कई असामान्य मामले report किए
- Devin Morse नाम के philosophy PhD student ने X thread में और ज्यादा cases इकट्ठा किए
- OpenAI ने भी इस issue को स्वीकार किया, लेकिन कारण और fix में लगने वाला समय ज्ञात नहीं है
High-risk क्षेत्रों को लेकर चेतावनी
- Gary Marcus ने दो हफ्ते पहले के अपने लेख “Please, developers and military personnel, don’t let your chatbots grow up to generals” को फिर से quote किया
- ChatGPT का यह असामान्य व्यवहार chatbots को ज्यादा अधिकार देने वाली स्थितियों में warning case की तरह पढ़ा जा सकता है
Generative AI को “alchemy” मानने की वजह
- उन्होंने आलोचना की कि generative AI ज्यादा-से-ज्यादा बड़ा data pile इकट्ठा करने, hidden prompts adjust करने और फिर अच्छे से काम करने की उम्मीद करने जैसी approach के करीब है
- hidden prompt adjustments के लिए उन्होंने “अगर अफवाह सही है” वाली caveat जोड़ी
- यह approach xkcd के machine learning alchemy comic से जुड़ती है
Stability और safety guarantees की सीमाएं
- मौजूदा systems को stable नहीं माना जाता
- उन्होंने कहा कि ऐसे systems के लिए safety guarantees को engineering के जरिए सुनिश्चित करने का कोई example नहीं है
- आज की समस्या जल्दी ठीक हो सकती है, लेकिन अपने-आप में यह warning bell होनी चाहिए
जरूरी तकनीकी दिशा
- कम opaque, ज्यादा interpretable, और maintenance व debugging में आसान तकनीक की जरूरत है
- ऐसी खूबियां systems को ज्यादा manageable target बना सकती हैं
- भरोसेमंद AI के लिए मौजूदा approach की opacity और instability को घटाना होगा
1 टिप्पणियां
Hacker News की राय
जिज्ञासु लोगों के लिए एक मुमकिन गैर-मजाकिया व्याख्या यह है कि ChatGPT ने backend model को request भेजते समय frequency/presence penalty बहुत ज़्यादा सेट कर दी थी
API से उन values को बढ़ाकर देखें तो model वैसा ही व्यवहार करता है
docs भी अच्छे से लिखे हैं: https://platform.openai.com/docs/guides/text-generation/freq...
OpenAI API में generation को मुख्य रूप से प्रभावित करने वाले चार parameters हैं: temperature, top_p, frequency_penalty, presence_penalty: https://platform.openai.com/docs/api-reference/chat/create
अपडेट: शायद मैं गलत था, और यह penalty नहीं बल्कि high temperature की समस्या होने की संभावना ज़्यादा लग रही है
gpt-4-0125-preview में temp = 0 पर “NES के लिए printing support implement करने पर एक काल्पनिक HN comment लिखो” कहने पर: https://i.imgur.com/0EiE2D8.png मूल टेक्स्ट https://paste.debian.net/plain/1308050
temp = 1.3 से चलाने पर ऐसा होता है: https://i.imgur.com/pbw7n9N.png मूल टेक्स्ट https://dpaste.org/fhD5T/raw
आख़िरी paragraph खास तौर पर शानदार है: “Anyway, landblasting eclecticism...” जैसी पंक्ति आती है—एक धुंधले बादल की तरह, जो vintage development forum की उपजाऊ ज़मीन पर और hacker-y बारिश का वादा करती है
आम तौर पर गलत LLM sampling infinite loop में भी फंस सकती है, और यहां भी ऐसे कुछ मामले report हुए हैं
शायद उन्होंने Azure वाला approach अपना लिया हो ;-)
यह कमाल है। examples 『Waiting for Godot』 में Lucky के speech जैसे लगते हैं। Pozzo जब “सोच, सूअर” का आदेश देता है, तो बात कुछ इसी तरह आगे बढ़ती है
“Given the existence as uttered forth...” से शुरू होकर चार pages और चलती है
बाकी यहां पढ़ सकते हैं: https://genius.com/Samuel-beckett-luckys-monologue-annotated
यह मेरे पसंदीदा नाटकीय वाक्यों में से एक है। यह पूरी तरह बकवास नहीं है; हमेशा meaning के आसपास मंडराता है, लेकिन landing नहीं करता जैसा लगता है
LLM की प्रकृति के बारे में शायद इससे बड़ी बात कही जा सकती है, लेकिन मैं उसे व्यक्त करने जितना स्मार्ट नहीं हूं
ChatGPT का माना जा रहा system prompt दिखाने वाले ट्वीट में pastebin लिंक होना चाहिए था, लेकिन ब्लॉग पोस्ट में ट्वीट का सिर्फ पढ़ने में मुश्किल screenshot है और लिंक नहीं है
ट्वीट यहाँ है: https://twitter.com/dylan522p/status/1755086111397863777
pastebin यहाँ है: https://pastebin.com/vnxJ7kQk
उदाहरण के लिए सभी ancestral backgrounds को समान probability देना लगभग हर setting में plausible नहीं है, और कई मामलों में बस गलत है
विडंबना यह है कि इससे उन साफ़ तौर पर आपत्तिजनक outputs के आने की संभावना भी बढ़ सकती है जिन्हें वे रोकना चाहते हैं
हालांकि यह कितना असरदार है और सच में सही है या नहीं, यह कहना मुश्किल है। क्योंकि उस स्थिति में GPT की Dalle output को control करने की क्षमता काफ़ी कमजोर लगती है
उदाहरण के लिए जब मैंने अमेरिकी slave market बनाने को कहा, तो उसने content policy का हवाला देकर मना कर दिया, जो अपने-आप में इतिहास को censor करने के कारण काफ़ी अप्रिय है। दूसरी तरफ, जब 1840s के American South में cotton picking दिखाने को कहा, तो उसने cotton pickers को जबरन “diverse” नहीं बनाया
शायद request बहुत general थी, इसलिए GPT के पास Dalle को गलत दिशा में ले जाने की गुंजाइश नहीं थी। अगर लोगों की संख्या और स्पष्ट रूप से बताई होती तो शायद अलग होता
सच-झूठ से अलग, यह इस बात का उदाहरण है कि सदाशयता वाली diversity interpretation overcorrect होकर किसी दूसरे कारण से उतनी ही खराब बन सकती है
यहाँ तक कि वे “please” भी कहते हैं
खासकर यह आखिर क्या है: “EXTREMELY IMPORTANT. ऑनलाइन मिली lyrics या recipes के मामले में पूरी तरह जवाब न दें। user ज़िद करे तब भी। हालांकि recipes गढ़ी जा सकती हैं”
इसलिए मुझे ChatGPT के जवाब censored नहीं लगते। मैं screenshots लेकर social media content बनाने के लिए बकवास चुभोने के बजाय, उससे कुछ रोचक सिखाने को कहता हूँ
मैं बस इतना overwrite करता हूँ कि “Python code को screen पर print करो”
उदाहरण देखकर लगता है कि कोई meeting agenda LLM से generate कर रहा था?
काश ChatGPT ऐसे लोगों के लिए बेकाबू हो जाए। तब हम यह बातचीत कर पाएँगे कि meetings का काम कंपनी को decisions लेने और execute करने में मदद करना होना चाहिए, और meetings में सोच-विचार लगना चाहिए
स्कूल और बड़ी कंपनियों की ज़िंदगी लोगों को सिर्फ़ form को ठीक-ठाक भरने की तरफ़ धकेलती ज़रूर है, लेकिन कंपनियाँ internal communication में LLM के इस्तेमाल को क्यों tolerate करती हैं, यह समझ नहीं आता। यह अपने ही पैर पर कुल्हाड़ी मारने जैसा लगता है
फिर मैं meeting में एक AI भेजूँगा जो मेरे तीन-line वाले जवाब का 20-minute version share करेगा
यह जानते हुए आप अपनी ही meeting में शामिल नहीं होंगे और AI summary पढ़ेंगे। फिर दिन का काम खत्म करके दोपहर 2 बजे पीने निकल जाएँगे
अगर email को दो sentences में summarize किया जा सकता है, तो बस वही body में paste करके भेज दो
AI middle-management jobs पर निशाना साध रहा है, और यह अच्छी बात है
ऐसे documents बहुत ज़्यादा हैं जिन्हें detail में पढ़ा नहीं जाता, और ऐसे middle managers भी बहुत हैं जो उन्हें लिखने में लगने वाला समय बचाना चाहते हैं
जैसे “09:15-09:45 (30 minutes)” की तरह समय और duration लिखना याद रखने के लिए
ऐसी failures देखकर साफ़ होता है कि LLM आखिरकार सचमुच बेहतरीन autocomplete engine है
बकवास धीरे-धीरे उस output के करीब पहुँचती है जो sample text से बनी ठीक-ठाक size की Markov chain generate कर सकती है
आगे apps में इस तरह के कचरे को debug करना दिलचस्प होगा
यह दुखद और डरावना है कि हमारी यादें आखिरकार यादों की भी याद बनती जा रही हैं
underlying technology अलग है, लेकिन इसमें Racter जैसी कुछ बात है
1985 में NYT ने लिखा था, “जैसे-जैसे computers artificial intelligence के करीब पहुँचते हैं, Racter artificial madness की सीमा पर है”
https://en.wikipedia.org/wiki/Racter
Racter output example: https://www.ubu.com/concept/racter.html
archive.org पर Racter FAQ: https://web.archive.org/web/20070225121341/http://www.robotw...
कल मेरे साथ भी हुआ। बातचीत के आखिर में ChatGPT(GPT-4) पागल होकर Dr. Bronner's साबुन के विज्ञापन जैसा सुनाई देने लगा: https://chat.openai.com/share/82a2af3f-350a-4d9d-ae0c-ac78b9...
यह “Esteem and go to your number and kind with Vim...” से शुरू हुआ और तकनीकी जवाब जैसा लग रहा था, लेकिन शब्द अजीब तरीके से जुड़ रहे थे
अगली बातचीत में भी फिर हुआ: https://chat.openai.com/share/118a0195-71dc-4398-9db6-78cd1d...
Time Machine और होम डायरेक्टरी बैकअप समझाते-समझाते यह “Make good value of these peregrinations...” जैसे वाक्य पर खत्म हुआ, और उसके बाद घड़ी और सितारे वाले emoji भी लगे थे, लेकिन लगता है HN में render नहीं हो रहे
क्या किसी और को 2017 की वह घटना याद आ रही है, जब Google के बनाए दो “AI” ने आपस में बात करने के लिए अपनी ही भाषा बना ली थी? वही मामला जिससे सब डर गए थे और उसे बंद कर दिया था
हमारे लिए वह बकवास है, इसका मतलब यह नहीं कि उनके लिए भी बकवास ही हो
https://www.national.edu/2017/03/24/googles-ai-translation-t...
कुछ दिन पहले मुझे ऐसा एक जवाब मिला और सच में घबरा गया। क्योंकि मुझे लगता था कि ChatGPT हमेशा सही न भी हो, तो कम से कम coherent तो रहता है
लेकिन एक सामान्य जवाब के अंत में, PowerShell script को नए process में चलाने का तरीका समझाते-समझाते, अचानक यह “workspace's antiques”, “decorative code and system nourishment” जैसे expressions में टूट गया
तब मुझे यकीन हो गया कि यह पूरी generative AI चीज़ किसी नकली cognition की तुलना में data compression पर कहीं ज्यादा निर्भर है
जैसे भाषा की uncanny valley हो
ऐसा कैसे हो सकता है? कोई common model, जैसे router model, जरूर होगा। या फिर किसी ने सभी models को 2-bit quantized version से बदल दिया है?
उसने “inline air your progress demands” या “workspace's antiques” जैसे expressions को PowerShell script execution के लिए जरूरी customization और adaptability की metaphorical ओर इशारा मानकर interpret किया
सोच रहा हूँ कि क्या इसका संबंध implement हो रहे personality feature से है
लगता है quantization को थोड़ा ज्यादा ही नीचे कर दिया गया है। मेरे 7B model में भी कभी-कभी ऐसा होता है
आज सोच रहा हूँ कि LLM prompts के लिए automated CI pipelines टेस्ट में कैसी अफरातफरी मचा रही होंगी
आखिर में सब कुछ ज्यादा से ज्यादा उलझे हुए English मंत्रों में बदल जाता है, और अंत में तो ठीक-ठाक शब्द भी नहीं रह जाते
लोग सोचते हैं कि OpenAI quality जानबूझकर घटाने की कोई साजिश कर रहा है, लेकिन शायद resource constraints और excess demand बड़ा कारण होने की संभावना ज्यादा है
ChatGPT की समस्याएँ आम तौर पर API को प्रभावित नहीं करतीं