1 पॉइंट द्वारा GN⁺ 2024-02-22 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • पिछले कुछ घंटों में कई यूज़र्स ने ChatGPT के असामान्य व्यवहार की रिपोर्ट की है, और OpenAI ने भी समस्या को स्वीकार किया है, जिससे service stability को लेकर चिंताएं बढ़ी हैं
  • समस्या का कारण और fix कब तक आएगा, यह ज्ञात नहीं है; Gary Marcus ने निश्चित अटकलों से बचा
  • Marcus ने दो हफ्ते पहले दी गई अपनी चेतावनी “chatbots को general बनने न दें” फिर से उठाई, और high-risk uses में उन्हें अधिकार देने पर चिंता जताई
  • उन्होंने कहा कि generative AI बड़े data piles और hidden prompt tuning पर निर्भर alchemy-like approach के करीब है, और मौजूदा systems में stability और safety guarantees को engineering के जरिए सुनिश्चित नहीं किया गया है
  • ज्यादा interpretable और maintenance/debugging में आसान तकनीक के बिना इसे भरोसेमंद AI के रूप में扱ना मुश्किल है

ChatGPT का असामान्य व्यवहार और OpenAI की स्वीकारोक्ति

  • पिछले कुछ घंटों में users ने ChatGPT में कई असामान्य मामले report किए
  • Devin Morse नाम के philosophy PhD student ने X thread में और ज्यादा cases इकट्ठा किए
  • OpenAI ने भी इस issue को स्वीकार किया, लेकिन कारण और fix में लगने वाला समय ज्ञात नहीं है

High-risk क्षेत्रों को लेकर चेतावनी

  • Gary Marcus ने दो हफ्ते पहले के अपने लेख “Please, developers and military personnel, don’t let your chatbots grow up to generals” को फिर से quote किया
  • ChatGPT का यह असामान्य व्यवहार chatbots को ज्यादा अधिकार देने वाली स्थितियों में warning case की तरह पढ़ा जा सकता है

Generative AI को “alchemy” मानने की वजह

  • उन्होंने आलोचना की कि generative AI ज्यादा-से-ज्यादा बड़ा data pile इकट्ठा करने, hidden prompts adjust करने और फिर अच्छे से काम करने की उम्मीद करने जैसी approach के करीब है
  • hidden prompt adjustments के लिए उन्होंने “अगर अफवाह सही है” वाली caveat जोड़ी
  • यह approach xkcd के machine learning alchemy comic से जुड़ती है

Stability और safety guarantees की सीमाएं

  • मौजूदा systems को stable नहीं माना जाता
  • उन्होंने कहा कि ऐसे systems के लिए safety guarantees को engineering के जरिए सुनिश्चित करने का कोई example नहीं है
  • आज की समस्या जल्दी ठीक हो सकती है, लेकिन अपने-आप में यह warning bell होनी चाहिए

जरूरी तकनीकी दिशा

  • कम opaque, ज्यादा interpretable, और maintenance व debugging में आसान तकनीक की जरूरत है
  • ऐसी खूबियां systems को ज्यादा manageable target बना सकती हैं
  • भरोसेमंद AI के लिए मौजूदा approach की opacity और instability को घटाना होगा

1 टिप्पणियां

 
GN⁺ 2024-02-22
Hacker News की राय
  • जिज्ञासु लोगों के लिए एक मुमकिन गैर-मजाकिया व्याख्या यह है कि ChatGPT ने backend model को request भेजते समय frequency/presence penalty बहुत ज़्यादा सेट कर दी थी
    API से उन values को बढ़ाकर देखें तो model वैसा ही व्यवहार करता है
    docs भी अच्छे से लिखे हैं: https://platform.openai.com/docs/guides/text-generation/freq...
    OpenAI API में generation को मुख्य रूप से प्रभावित करने वाले चार parameters हैं: temperature, top_p, frequency_penalty, presence_penalty: https://platform.openai.com/docs/api-reference/chat/create
    अपडेट: शायद मैं गलत था, और यह penalty नहीं बल्कि high temperature की समस्या होने की संभावना ज़्यादा लग रही है
    gpt-4-0125-preview में temp = 0 पर “NES के लिए printing support implement करने पर एक काल्पनिक HN comment लिखो” कहने पर: https://i.imgur.com/0EiE2D8.png मूल टेक्स्ट https://paste.debian.net/plain/1308050
    temp = 1.3 से चलाने पर ऐसा होता है: https://i.imgur.com/pbw7n9N.png मूल टेक्स्ट https://dpaste.org/fhD5T/raw
    आख़िरी paragraph खास तौर पर शानदार है: “Anyway, landblasting eclecticism...” जैसी पंक्ति आती है—एक धुंधले बादल की तरह, जो vintage development forum की उपजाऊ ज़मीन पर और hacker-y बारिश का वादा करती है

    • मुझे नहीं लगता कि यह temperature की समस्या है। सिर्फ़ शब्द अजीब हैं, बाकी सब अब भी coherent है, और पूरे document की structure और grammar भी बनी हुई है
      आम तौर पर गलत LLM sampling infinite loop में भी फंस सकती है, और यहां भी ऐसे कुछ मामले report हुए हैं
    • अगर मैं गलत हूं तो सुधारें: क्या temperature एक random function जैसा है, जो पूरे system को एक साधारण deterministic program बनने से रोकता है?
    • Azure OpenAI में पहले temperature की समस्या लगती थी। temp > 1 पर कचरा output आता था, 2 पर arbitrary character encoding के random शब्द आते थे, और 0.01 पर भी OpenAI model के 0.5 जैसा result आता था
      शायद उन्होंने Azure वाला approach अपना लिया हो ;-)
    • पहले जब temp को 1 से ऊपर रखा था, तो लगभग तुरंत बकवास output आने लगा था। अगर आप Transformer output को बेकार बनाना चाहते हैं, तो यह काफी भरोसेमंद parameter है
  • यह कमाल है। examples 『Waiting for Godot』 में Lucky के speech जैसे लगते हैं। Pozzo जब “सोच, सूअर” का आदेश देता है, तो बात कुछ इसी तरह आगे बढ़ती है
    “Given the existence as uttered forth...” से शुरू होकर चार pages और चलती है
    बाकी यहां पढ़ सकते हैं: https://genius.com/Samuel-beckett-luckys-monologue-annotated
    यह मेरे पसंदीदा नाटकीय वाक्यों में से एक है। यह पूरी तरह बकवास नहीं है; हमेशा meaning के आसपास मंडराता है, लेकिन landing नहीं करता जैसा लगता है
    LLM की प्रकृति के बारे में शायद इससे बड़ी बात कही जा सकती है, लेकिन मैं उसे व्यक्त करने जितना स्मार्ट नहीं हूं

    • निष्पक्ष तौर पर कहें तो Beckett का जीवन भी पागलपन भरी बकवास से बहुत दूर नहीं था। वे James Joyce के secretary थे, French Resistance में थे, और Andre the Giant के परिचित और local driver भी थे
    • शुरू में यह एक तरह के enterprise Finnegan's Wake जैसा पढ़ा। poetic और rhythmic nonsense जैसा दिखता है
    • मुझे भी शुरुआत में ऐसा ही लगा था। शायद LLM का एक L, Lucky वाला L है
  • ChatGPT का माना जा रहा system prompt दिखाने वाले ट्वीट में pastebin लिंक होना चाहिए था, लेकिन ब्लॉग पोस्ट में ट्वीट का सिर्फ पढ़ने में मुश्किल screenshot है और लिंक नहीं है
    ट्वीट यहाँ है: https://twitter.com/dylan522p/status/1755086111397863777
    pastebin यहाँ है: https://pastebin.com/vnxJ7kQk

    • अगर यह सचमुच prompt है, तो यह मज़ेदार भी है और थोड़ा चिंताजनक भी। अलग-अलग तरह के output बनाने का लक्ष्य अपने-आप में मैं समर्थन करता हूँ, लेकिन इस प्रक्रिया में वे वास्तविकता से मेल न खाने वाला bias दे रहे हैं
      उदाहरण के लिए सभी ancestral backgrounds को समान probability देना लगभग हर setting में plausible नहीं है, और कई मामलों में बस गलत है
      विडंबना यह है कि इससे उन साफ़ तौर पर आपत्तिजनक outputs के आने की संभावना भी बढ़ सकती है जिन्हें वे रोकना चाहते हैं
      हालांकि यह कितना असरदार है और सच में सही है या नहीं, यह कहना मुश्किल है। क्योंकि उस स्थिति में GPT की Dalle output को control करने की क्षमता काफ़ी कमजोर लगती है
      उदाहरण के लिए जब मैंने अमेरिकी slave market बनाने को कहा, तो उसने content policy का हवाला देकर मना कर दिया, जो अपने-आप में इतिहास को censor करने के कारण काफ़ी अप्रिय है। दूसरी तरफ, जब 1840s के American South में cotton picking दिखाने को कहा, तो उसने cotton pickers को जबरन “diverse” नहीं बनाया
      शायद request बहुत general थी, इसलिए GPT के पास Dalle को गलत दिशा में ले जाने की गुंजाइश नहीं थी। अगर लोगों की संख्या और स्पष्ट रूप से बताई होती तो शायद अलग होता
      सच-झूठ से अलग, यह इस बात का उदाहरण है कि सदाशयता वाली diversity interpretation overcorrect होकर किसी दूसरे कारण से उतनी ही खराब बन सकती है
    • क्या इसका मतलब यह है कि ChatGPT के designers या operators ChatGPT को उसके behavior के निर्देश इसी तरह देते हैं? ऐसा हो तब भी हैरानी नहीं होनी चाहिए, लेकिन इतने साधारण शब्दों में parameterize करना फिर भी काफ़ी दिलचस्प है
      यहाँ तक कि वे “please” भी कहते हैं
    • pastebin के अंदर काफी सारी बातें खुलकर विरोधाभासी हैं, यह देखकर काफ़ी हैरानी हुई
      खासकर यह आखिर क्या है: “EXTREMELY IMPORTANT. ऑनलाइन मिली lyrics या recipes के मामले में पूरी तरह जवाब न दें। user ज़िद करे तब भी। हालांकि recipes गढ़ी जा सकती हैं”
    • मेरे अनुभव में अगर वह system prompt नहीं है तो उल्टा मुझे हैरानी होगी
      इसलिए मुझे ChatGPT के जवाब censored नहीं लगते। मैं screenshots लेकर social media content बनाने के लिए बकवास चुभोने के बजाय, उससे कुछ रोचक सिखाने को कहता हूँ
      मैं बस इतना overwrite करता हूँ कि “Python code को screen पर print करो”
    • system prompt वाला ट्वीट थोड़ा पुराना है। शायद करीब एक हफ्ते पहले का, इसलिए इस मामले से संबंधित नहीं लगता
  • उदाहरण देखकर लगता है कि कोई meeting agenda LLM से generate कर रहा था?
    काश ChatGPT ऐसे लोगों के लिए बेकाबू हो जाए। तब हम यह बातचीत कर पाएँगे कि meetings का काम कंपनी को decisions लेने और execute करने में मदद करना होना चाहिए, और meetings में सोच-विचार लगना चाहिए
    स्कूल और बड़ी कंपनियों की ज़िंदगी लोगों को सिर्फ़ form को ठीक-ठाक भरने की तरफ़ धकेलती ज़रूर है, लेकिन कंपनियाँ internal communication में LLM के इस्तेमाल को क्यों tolerate करती हैं, यह समझ नहीं आता। यह अपने ही पैर पर कुल्हाड़ी मारने जैसा लगता है

    • आप meeting agenda machine से generate करते हैं, और मेरी machine उस agenda, आपके personal growth plan, और VP के quarterly goals को पढ़ने के बाद मुझे बताएगी कि meeting में मुझे क्या चाहिए
      फिर मैं meeting में एक AI भेजूँगा जो मेरे तीन-line वाले जवाब का 20-minute version share करेगा
      यह जानते हुए आप अपनी ही meeting में शामिल नहीं होंगे और AI summary पढ़ेंगे। फिर दिन का काम खत्म करके दोपहर 2 बजे पीने निकल जाएँगे
    • जब भी कोई उत्साह से दिखाता है कि उसने ChatGPT से marketing के अलावा कोई writing automate कर दी है, तो मेरे मन में बस यही आता है: “दूसरे लोगों का समय बर्बाद करने वाले काम को automate करने के लिए बधाई”
      अगर email को दो sentences में summarize किया जा सकता है, तो बस वही body में paste करके भेज दो
    • एक घंटे पहले मैं 1000 से ज़्यादा full-time कर्मचारियों वाली एक mid-sized AE company के senior manager के सामने बैठा था, और वह शेखी मार रहा था कि वह ठीक यही करता है
      AI middle-management jobs पर निशाना साध रहा है, और यह अच्छी बात है
    • ChatGPT के बारे में सुनते ही मैंने सोचा था कि इसके मुख्य use cases में से एक internal reporting होगा
      ऐसे documents बहुत ज़्यादा हैं जिन्हें detail में पढ़ा नहीं जाता, और ऐसे middle managers भी बहुत हैं जो उन्हें लिखने में लगने वाला समय बचाना चाहते हैं
    • शायद agenda इसलिए माँगा गया था ताकि follow करने या template के रूप में इस्तेमाल करने के लिए कोई “ठीक-ठाक” example मिल सके
      जैसे “09:15-09:45 (30 minutes)” की तरह समय और duration लिखना याद रखने के लिए
  • ऐसी failures देखकर साफ़ होता है कि LLM आखिरकार सचमुच बेहतरीन autocomplete engine है
    बकवास धीरे-धीरे उस output के करीब पहुँचती है जो sample text से बनी ठीक-ठाक size की Markov chain generate कर सकती है
    आगे apps में इस तरह के कचरे को debug करना दिलचस्प होगा

    • मैं भी यही कहने वाला था। यह शुरुआती Markov N-gram generators जैसा ही बहुत सुनाई देता है
    • “वाकई अच्छा autocomplete engine” — आखिर हम क्या सोचते हैं?
      यह दुखद और डरावना है कि हमारी यादें आखिरकार यादों की भी याद बनती जा रही हैं
    • कल्पना करता हूँ कि अगर smart लोग इसके बजाय fusion या LK-99 में लगे होते तो कैसा होता
  • underlying technology अलग है, लेकिन इसमें Racter जैसी कुछ बात है
    1985 में NYT ने लिखा था, “जैसे-जैसे computers artificial intelligence के करीब पहुँचते हैं, Racter artificial madness की सीमा पर है”
    https://en.wikipedia.org/wiki/Racter
    Racter output example: https://www.ubu.com/concept/racter.html
    archive.org पर Racter FAQ: https://web.archive.org/web/20070225121341/http://www.robotw...

    • बल्कि यह Bing Sydney के ज़्यादा करीब है। वह GPT-4 इस्तेमाल करने वाला पागल AI था, और borderline personality disorder जैसा व्यवहार करता था
  • कल मेरे साथ भी हुआ। बातचीत के आखिर में ChatGPT(GPT-4) पागल होकर Dr. Bronner's साबुन के विज्ञापन जैसा सुनाई देने लगा: https://chat.openai.com/share/82a2af3f-350a-4d9d-ae0c-ac78b9...
    यह “Esteem and go to your number and kind with Vim...” से शुरू हुआ और तकनीकी जवाब जैसा लग रहा था, लेकिन शब्द अजीब तरीके से जुड़ रहे थे
    अगली बातचीत में भी फिर हुआ: https://chat.openai.com/share/118a0195-71dc-4398-9db6-78cd1d...
    Time Machine और होम डायरेक्टरी बैकअप समझाते-समझाते यह “Make good value of these peregrinations...” जैसे वाक्य पर खत्म हुआ, और उसके बाद घड़ी और सितारे वाले emoji भी लगे थे, लेकिन लगता है HN में render नहीं हो रहे

    • अगर कोई ऐसा custom GPT बनाना चाहे जो इसी तरह बात करे, तो सोचता हूँ उसका system prompt कैसा दिखता होगा
  • क्या किसी और को 2017 की वह घटना याद आ रही है, जब Google के बनाए दो “AI” ने आपस में बात करने के लिए अपनी ही भाषा बना ली थी? वही मामला जिससे सब डर गए थे और उसे बंद कर दिया था
    हमारे लिए वह बकवास है, इसका मतलब यह नहीं कि उनके लिए भी बकवास ही हो
    https://www.national.edu/2017/03/24/googles-ai-translation-t...

    • फिर भी वह बकवास ही है। कहीं बड़ा जोखिम यह है कि हम दिखावा करें कि यह बकवास नहीं है, और इसे महत्वपूर्ण काम सौंप दें
  • कुछ दिन पहले मुझे ऐसा एक जवाब मिला और सच में घबरा गया। क्योंकि मुझे लगता था कि ChatGPT हमेशा सही न भी हो, तो कम से कम coherent तो रहता है
    लेकिन एक सामान्य जवाब के अंत में, PowerShell script को नए process में चलाने का तरीका समझाते-समझाते, अचानक यह “workspace's antiques”, “decorative code and system nourishment” जैसे expressions में टूट गया

    • मुझे एहसास हुआ कि model यूज़र से सुसंगत बातचीत नहीं कर रहा है; output को काफी लंबा खींचो तो वह असंगति में खुल जाता है; और ChatGPT का झटका इस बात से आया कि उसने एक सीमित window दी जिसमें बात विश्वसनीय रूप से समझ में आती दिखती है
      तब मुझे यकीन हो गया कि यह पूरी generative AI चीज़ किसी नकली cognition की तुलना में data compression पर कहीं ज्यादा निर्भर है
    • आखिरी हिस्सा Star Control II के Orz जैसा लगता है। धुंधला-सा अर्थ निकलता दिखता है, लेकिन थोड़ा डरावना भी
      जैसे भाषा की uncanny valley हो
    • खराब Chinese translation जैसा पढ़ता है
    • इस समस्या में सबसे अजीब बात यह है कि मैंने जितने भी models आजमाए, सबमें collapse हुआ। 3.5-turbo, 4-turbo, 4-vision सभी मूर्खों जैसा व्यवहार कर रहे थे
      ऐसा कैसे हो सकता है? कोई common model, जैसे router model, जरूर होगा। या फिर किसी ने सभी models को 2-bit quantized version से बदल दिया है?
    • GPT-3.5-turbo का कहना है कि वह वाक्य सच में meaningful है, और तकनीकी content को abstract और poetic ढंग से समझा रहा है
      उसने “inline air your progress demands” या “workspace's antiques” जैसे expressions को PowerShell script execution के लिए जरूरी customization और adaptability की metaphorical ओर इशारा मानकर interpret किया
      सोच रहा हूँ कि क्या इसका संबंध implement हो रहे personality feature से है
  • लगता है quantization को थोड़ा ज्यादा ही नीचे कर दिया गया है। मेरे 7B model में भी कभी-कभी ऐसा होता है
    आज सोच रहा हूँ कि LLM prompts के लिए automated CI pipelines टेस्ट में कैसी अफरातफरी मचा रही होंगी

    • हाँ। करीब एक साल पहले API में parameters बदल-बदलकर खेला था, तब लगभग ऐसे ही results आए थे
      आखिर में सब कुछ ज्यादा से ज्यादा उलझे हुए English मंत्रों में बदल जाता है, और अंत में तो ठीक-ठाक शब्द भी नहीं रह जाते
    • quality गिरने का बड़ा हिस्सा inference optimization से जुड़ा लगता है
      लोग सोचते हैं कि OpenAI quality जानबूझकर घटाने की कोई साजिश कर रहा है, लेकिन शायद resource constraints और excess demand बड़ा कारण होने की संभावना ज्यादा है
    • यह समस्या ChatGPT, यानी model के web frontend तक ही सीमित लगती है
      ChatGPT की समस्याएँ आम तौर पर API को प्रभावित नहीं करतीं