- Project Sid एक तकनीकी रिपोर्ट रिपॉज़िटरी है, जो दिखाती है कि 10~1000+ AI एजेंट एक एजेंट समाज के भीतर कैसे व्यवहार करते हैं और कैसे प्रगति करते हैं
- इसका मानना है कि मौजूदा AI एजेंट मूल्यांकन अकेले या छोटे समूहों तक सीमित रहे हैं, इसलिए इंटरैक्शन की रेंज और जटिलता सीमित रही है
- PIANO, Parallel Information Aggregation via Neural Orchestration आर्किटेक्चर है, जो एजेंटों को मनुष्यों और अन्य एजेंटों के साथ रियल-टाइम इंटरैक्शन करते हुए कई आउटपुट स्ट्रीम्स में संगति बनाए रखने देता है
- Minecraft वातावरण में, मानव इतिहास से प्रेरित civilization benchmark के जरिए बड़े पैमाने के सिमुलेशन में एजेंट प्रदर्शन का मूल्यांकन किया जाता है
- शुरुआती नतीजों में एजेंटों ने स्वायत्त रूप से विशेषज्ञ भूमिकाएँ बनाईं, सामूहिक नियमों का पालन किया या उन्हें बदला, और सांस्कृतिक·धार्मिक प्रसार में भाग लिया — इस तरह AI सभ्यता की दिशा में महत्वपूर्ण मील के पत्थर हासिल किए
Project Sid जिस समस्या को संबोधित करता है
- अब तक AI एजेंटों का मूल्यांकन मुख्य रूप से अलग-थलग स्थितियों या छोटे समूहों में किया गया है
- ऐसी सेटिंग्स में एजेंटों के बीच इंटरैक्शन की रेंज और जटिलता सीमित रहती है
- यह काम इस समस्या-बोध से शुरू होता है कि बड़े पैमाने का स्वायत्त एजेंट सिमुलेशन, जो सभ्यता-प्रक्रिया के पूरे स्पेक्ट्रम को दर्शाए, अभी तक पर्याप्त रूप से नहीं खोजा गया है
PIANO आर्किटेक्चर
- Project Sid PIANO आर्किटेक्चर प्रस्तावित करता है
- इसका पूरा नाम Parallel Information Aggregation via Neural Orchestration है
- यह एजेंटों को मनुष्यों और अन्य एजेंटों के साथ रियल-टाइम इंटरैक्शन करने में सक्षम बनाता है
- इसका लक्ष्य कई आउटपुट स्ट्रीम्स में संगति बनाए रखना है
सिमुलेशन और मूल्यांकन का तरीका
- मूल्यांकन Minecraft वातावरण में किया गया
- बड़े पैमाने के सिमुलेशन के भीतर एजेंट प्रदर्शन का मूल्यांकन करने के लिए, मानव इतिहास से प्रेरित civilization benchmark का उपयोग किया गया
- प्रयोग का पैमाना 10~1000+ AI एजेंटों को शामिल करता है
देखे गए एजेंट व्यवहार
- सिमुलेशन दिखाता है कि एजेंट सार्थक प्रगति प्रदर्शित कर सकते हैं
- देखे गए व्यवहारों में निम्न शामिल हैं
- स्वायत्त रूप से विशेषज्ञ भूमिकाएँ विकसित करना
- सामूहिक नियमों का पालन करना और आवश्यकता पड़ने पर उन्हें बदलना
- सांस्कृतिक और धार्मिक प्रसार में भाग लेना
सामग्री और उद्धरण जानकारी
- पेपर दो स्थानों पर उपलब्ध है
- arXiv:2411.00114
- रिपॉज़िटरी के भीतर PDF फ़ाइल
2024-10-31.pdf
- उद्धरण जानकारी
Altera.AL, 2024,arXiv preprint arXiv:2411.00114के रूप में दी गई है - Project Sid के शुरुआती नतीजों का निष्कर्ष है कि यह बड़े पैमाने के सामाजिक सिमुलेशन, एजेंट संगठनात्मक बुद्धिमत्ता, और AI के मानव सभ्यता में एकीकरण के लिए नई खोज दिशाएँ खोलता है
1 टिप्पणियां
Hacker News की राय
ऐसा लगता है कि एक ही LLM के कई instances से higher-order behavior निकालने में कुछ information-theoretic सीमाएँ हैं
पिछले साल मैंने multi-agent simulation बनाने में काफ़ी समय लगाया, और हर दिन उसी निष्कर्ष पर पहुँचा। अंत में यह घुमा-फिराकर की गई prompt engineering जैसा ही है; mental model के तौर पर उपयोगी हो सकता है, लेकिन पूरी चीज़ को कुछ SQL tables और functions में flatten किया जा सकता है। हर “agent” मूलतः prompts बनाने वाले string template से mapped एक SQL view जैसा है
मुझे नहीं लगता कि असली 3D world या wall-clock जैसी चीज़ों की ज़रूरत है। Prompt generation process के नीचे कोई plausible representation बिछा देने से LLM meaningful तरीके से ज़्यादा समृद्ध होता नहीं दिखता। LLM के अंदर स्पष्ट रूप से कोई “inner world” नहीं है, इसलिए उसे rich external environment देकर “खुश” करने की कोशिश ज़्यादा मायनेदार नहीं लगती
कभी controllable rigging और textured meshes को games में इस्तेमाल लायक बनाया जा सके तो अलग बात है, लेकिन अभी यह consistent game storyline में मदद करने लायक भरोसेमंद कहानी on the fly नहीं बना पाता। Map generation को भी मौजूदा procedural generation algorithms से आगे कुछ चाहिए, ऐसा नहीं लगता, और ये examples भी अब तक pre-made assets पर निर्भर हैं। ये implementations static meshes को ज़मीन पर plausible तरीके से रखना भी स्थिरता से नहीं कर पाते लगते हैं
NPCs में भी वास्तव में कितनी value है, यह संदिग्ध है। हो सकता है यह सिर्फ़ novelty हो और एक घंटे की value भी न दे। भले ही LLM तत्काल वाक्यों से guided story progression बनाए, मुझे संदेह है कि वह professional writer के बनाए dialogue tree जितना अच्छा या उससे बेहतर होगा
यह Civ idea कुछ हद तक नया approach लगता है, लेकिन conceptually बहुत कुछ जोड़ता नहीं दिखता। फिर भी यह सीखना कि क्या काम नहीं करता, अपने-आप में valuable है। हालांकि ऐसे ideas ज़्यादातर problem की तलाश में buzzword-style solutions होते हैं, या इंसान से सस्ता creativity source होते हैं, लेकिन quality compromise बड़ा होता है और developers को इतना tuning करना पड़ता है कि actual cost saving भी अस्पष्ट हो जाती है
Technical artist होने के नाते शायद मैं human creativity की value को ज़्यादा मानने के bias में हूँ, लेकिन साथ ही game development के लिए LLM tools का main target audience भी शायद मैं ही हूँ, और अभी तक convince नहीं हुआ हूँ
Commercial interests attention और participation खींचते हैं, इसका मैं पूरा समर्थन करता हूँ। यह निश्चित रूप से शानदार काम है, लेकिन situation को कहीं ज़्यादा honestly पेश करना और ऐसे लोगों को आकर्षित करना ज़्यादा उचित होगा जिनके पास सच में ball को आगे बढ़ाने की expertise और awareness हो
Experiments में गलत हुई दस हज़ार चीज़ें public करना और उनसे निकले common-sense conclusions को summarize करना कहीं ज़्यादा दिलचस्प होगा। ऊपर बताए निष्कर्षों जैसे insightful और सही points चाहिए
इस industry और उसके enablers को गलत methodology से जीतने की कोशिश करते हुए, AI field और industry में paradigm shift लाने के लिए तैयार creative लोगों को बाहर धकेलने वाली प्रवृत्ति से आगे बढ़ना होगा
सभी prompts आप खुद भी लिख सकते हैं, लेकिन तब वह shared reality बस author की imagination होगी और author dungeon master की भूमिका निभा रहा होगा
Minecraft environment का मकसद agent की “inner world” को enrich करना या उसे “खुश” करना नहीं है। मकसद एक shared environment के भीतर इंसानों के लिए समझने योग्य tasks बनाना है, ताकि अलग-अलग compositions वाले agent groups के behavior और performance को measure किया जा सके
मुझे पता है कि ऐसी बात कहना शायद माहौल के ख़िलाफ़ है, लेकिन संदेह है कि आपने article पढ़ा भी है या नहीं। यह comment research के findings या इस्तेमाल की गई techniques पर लगभग बात ही नहीं करता
ज़रूरी नहीं कि सब same model हों; हर agent की “chain of thought” को narrow और focused रखने वाली context management महत्वपूर्ण हो सकती है
पहला हिस्सा मूल रूप से mixture-of-experts (MoE) जिस चीज़ को संभालता है वही है, और छोटे models में मैंने देखा है कि scope और context सीमित करने पर वे कहीं बेहतर काम करते हैं। अगर उसका result उन्हें वह काम कराने लगे जो एक single large model नहीं कर पाता, तो क्या उसे higher-order behavior नहीं कहा जाएगा?
“inner world” न होने वाली बात सही है, लेकिन शायद इसी वजह से उसे एक देना advantage हो सकता है। जैसे LLM को code execution tool देने पर वह खुद run करके बेहतर code लिखने लगता है, वैसे 3D world real-world problems को अलग तरह से explore करने का playground बन सकता है। अगर ऐसा होता है, तो उसे higher-order behavior माना जा सकता है
LLM में sampler के temperature के ज़रिए बहुत थोड़ी entropy ही आती है
यह सच में artificial intelligence agent के क़रीब लगता है
इसमें memory, will, autonomy, OODA loop जैसी structure, और persistent environment है। बहुत अच्छा concept है, और मुझे लगता है कि यहाँ से सीखी गई बातें ज़्यादा सामान्य business problems पर भी लागू हो सकती हैं
बस अच्छा होगा अगर executives यह समझें कि कुछ prompts का एक-दूसरे की ओर outputs उगलना “state-of-the-art agentic AI” नहीं है
लेकिन हो सकता है उनकी नौकरी executives को ऐसी चीज़ बेचने पर टिकी हो जो असली innovation जैसी दिखे
मौजूदा agents में भी अक्सर memory और ऊपर बताए कई तत्व पहले से होते हैं
मैंने पेपर देखा, और मुझे भरोसा है कि यह पेपर झूठे दावों के ढेर पर गढ़ा गया है
दावे ईमानदार नहीं लगते, और peer review के बिना इन्हें ज्यों का त्यों स्वीकार नहीं किया जाना चाहिए। दिए गए charts और graphics भी, जब दावों के साथ उनकी लागू होने की क्षमता देखी जाए, तो कई मामलों में बेहद सफाई से बनाए गए fake लगते हैं
अभी किसी भी तरह का LLM प्रस्तावित काम नहीं कर सकता। व्यावसायिक हितों के लिहाज से मंशा अच्छी हो सकती है, लेकिन साफ कहें तो यह पेपर ऐसे पढ़ा जाता है जैसे simulation के अंदर AI agents के समूह ने चुनाव-संबंधी गतिविधियों का समन्वय किया हो। ऐसे दावों के लिए काफी सबूत चाहिए, जो दिए नहीं गए
दिए गए prompts का वर्णित LLM application तरीके से बिल्कुल कोई संबंध नहीं है
“चुनाव” वाला experiment एक पहले से परिभाषित scenario था, चुनावी गतिविधियों का कोई “समन्वय” नहीं हुआ था। पहले से assigned “influencers” ने PIANO में built-in conversation system का इस्तेमाल किया, sentiment simulation ने अपने-आप collect किया, और “Election Manager” भी एक और पहले से परिभाषित agent था
खास तौर पर experiment का यह हिस्सा यह देखने के लिए design किया गया था कि PIANO framework के कुछ modules के होने या न होने से behavior पर क्या असर पड़ता है
चुनावी गतिविधि का प्रभाव शायद बहुत कम रहा होगा, लेकिन agents का एक-दूसरे को prompt करके LLM के चुनाव-संबंधी latent space में ले जाना असंभव संभावना नहीं लगता
इसी स्तर की कठोरता और ईमानदारी से कहें तो यह जलन से निकली बकवास लगती है और पेपर के बड़े हिस्से को साफ तौर पर गलत समझती है
अगर एक agent का tax collector बनना और दूसरे agent का tax system को चुनौती देना बिना hardcoding के उभरा है, तो वह सच में impressive है
मैंने इस समस्या पर काफी सोचा है। मैं न philosopher हूं न AI researcher, इसलिए यह काफी हद तक अटकल है, लेकिन अगर मैं खुद करता तो principles से शुरू करता और system को समय के साथ evolve या discover होने देता
principles self-preservation, food, shelter, reproduction, communication, memory जैसी चीजें होंगी, और इन्हें risk-reward calculation के lens से देखने जैसा होगा। क्या “known” है और क्या “unknown” है, यह तय करना भी key हो सकता है, लेकिन binary तरीके से नहीं
“memory” के कई मतलब हो सकते हैं, लेकिन अगर इसे ऐसे function के रूप में code किया जाए जिसमें कोई entity कोई action करके कोई outcome बनाती है, और उस outcome को दिए गए risk-reward profile की तुलना empirical test values से होती है जो बहुत negative से बहुत positive तक जाते हैं, तो यह individual और collective दोनों के लिए व्यापक रूप से उपयोगी लगता है
वहीं से दूसरों से जुड़ने की जरूरत, resource conflicts, risk-taking, unknown की exploration, सीखी हुई चीजें share करना, risk-reward को refine करना वगैरह निकलते हैं। ईश्वर जैसे dungeon master के तौर पर आप सभ्यता को पहले से defined technologies, inventions और places discover करने की ओर guide भी कर सकते हैं। यह थोड़ा cheat है और progress को rails पर डालने जैसा है, लेकिन इसे ज्यादा useful, interesting और relatable भी बनाता है
computation बहुत भारी लगती है, लेकिन game को real-time में चलना जरूरी नहीं है
मेरे हिसाब से human condition का बड़ा हिस्सा “life”, “freedom”, “love/connection”, “greed” से समझाया जा सकता है
repository के video को देखकर मुझे “culture”, “memes”, “religion” को शुरू से ही मिला देने का तरीका पसंद नहीं आया। बेहतर होगा कि communication की जरूरत और collective memory से निकले belief systems को share करने की प्रक्रिया में ये चीजें emerge होने दी जाएं। इस analysis के उद्देश्य के लिए यह शायद बिना फर्क वाला distinction भी लग सकता है। साथ ही “tax बहुत ज्यादा है!” अगर उसके नीचे के “जीने के लिए resources पर्याप्त नहीं हैं” के बिना आता है, तो यह बहुत mechanical human imitation जैसा लगेगा
https://en.wikipedia.org/wiki/Society_of_Mind
यह किताब पहली बार 1986 में आई थी, और Minsky ने 1970 के दशक की शुरुआत से विकसित की गई “society of mind” theory को पहली बार समग्र रूप में समझाया था। यह 30 chapters में बंटे 270 स्वतंत्र essays से बनी है, और इसका CD-ROM version भी था
Minsky mind की society को समझाते हुए language, memory, learning जैसी processes कैसे काम करती हैं, इस पर theory पेश करते हैं, और consciousness, sense of self, free will जैसी concepts को भी cover करते हैं। इसलिए कई लोग The Society of Mind को philosophical work भी मानते हैं
यह किसी खास AI या cognitive science claim को prove करने के लिए लिखी किताब नहीं है, और physical brain structure को भी cover नहीं करती। इसके बजाय यह mind और thinking conceptual level पर कैसे काम करते हैं, इस पर ideas का collection है
इस field के AI को non-expert की तरह समझने के लिए भी यह काफी readable है
कुछ क्षेत्रों को बड़ा फायदा होगा, लेकिन artificial intelligence खुद अभी वहां तक पहुंची है, ऐसा मुझे नहीं लगता। Games को बड़ा फायदा मिलने वाला लगता है
reinforcement learning में हर जीत पर policy modify होगी, लेकिन generative AI में यह कैसे काम करेगा, यह जानने की उत्सुकता है
memes और genes दोनों memory हैं, लेकिन time scale अलग है
यह वाकई शानदार खिलौने जैसा दिखता है
हालांकि वैज्ञानिक शोध के नज़रिए से यह खास उपयोगी नहीं लगता। ऐसा नहीं लगता कि प्रयोग के design पर बहुत विचार किया गया है, और कोई स्पष्ट लक्ष्य भी नहीं दिखता। शक होता है कि आजकल academic research के standards सच में इतने कम हो गए हैं क्या
वे खुद इसे technical report कहते हैं, और ऐसे format में स्पष्ट research question के बिना “हमने यह किया” और detailed report देना आम तौर पर ज़्यादा स्वीकार्य होता है। फिर भी यह report काफी बिखरी हुई लगती है
specialization और cultural transmission वाले sections दोनों दिलचस्प थे, लेकिन exact experimental design details की कमी थी, इसलिए लगा कि दोनों में से किसी एक पर focus किया होता तो बेहतर होता
multi-agent case में external metrics पर focus न करना भी खलता है। single-agent benchmark “block type तक लगने वाला समय” जैसा external metric देखता है, लेकिन multi-agent analysis role specialization, meme spread जैसे internal measurements तक सीमित लगता है। group multi-agent system ने economic productivity या complexity जैसे metrics पर single agent से ज़्यादा हासिल किया या नहीं, यह नहीं दिखा
यह specialization section से साफ तौर पर जुड़ा है, लेकिन अगर यह नहीं देखा जाए कि emergent role division के economic outcomes या preconditions थे या नहीं, तो संदेह होता है कि पूरी चीज़ कुछ हद तक pantomime तो नहीं
कुछ लोग speed और उसके साथ आने वाली uncertainty को पसंद करते हैं
सोच रहा हूँ कि Altera ने जिस तरह की AI “civilization” सुझाई है, वह अगर पूरी civilization के लिए काम करने लायक reward system बना सके, तो क्या वह single LLM की तुलना में AGI के लिए बेहतर paradigm हो सकती है
मसलन जैसे modern states GDP maximize करने की कोशिश करते हैं, अगर यह AI civilization [scientific_output] या [code_quality] या किसी और evaluation metric को maximize करने की कोशिश करे, तो क्या यह उसी लक्ष्य पर काम कर रहे single AI agent से बेहतर नतीजे दे सकती है
mind और AI में दिलचस्पी रखने वालों को strongly recommend करता हूँ। यह किताब अपने thesis के अलग-अलग पहलुओं को one-page essays में cover करती है, और इसका format Martin Luther जैसा कहने लायक दिलचस्प है
बेशक चमकदार pure LLM approach की तरफ भीड़ में यह थोड़ा पीछे छूट गया, लेकिन मुझे लगता है कि knowledge गायब होने से ज्यादा यह user base के अचानक बहुत बड़े हो जाने का नतीजा है। experts अभी भी इस perspective को ध्यान में रखते हैं, और कभी-कभी इसे “ensemble” के नाम से discuss करते हैं
अच्छा उदाहरण GPT-4 है, जहाँ मेरी समझ के मुताबिक बड़ा performance gain मुख्यतः mixture of experts इस्तेमाल करने से आया, जो agent society या model ensemble का लगभग synonym ही है
बहुत शानदार दिखता है। “civilization” के benefits को लेकर skeptical हूँ, लेकिन कम से कम इससे एक दिलचस्प simulation game तो बन सकता है
इसलिए शायद civilization की बजाय Civilization के लिए बेहतर हो
Civ में इतने बेवकूफी भरे traps हैं कि अच्छी strategy AI को economically hardcode करना मुश्किल है, और दुश्मन को cheat करने देकर problem solve करना बस irritate करता है। artificial neural network को “classical” AI के खिलाफ लगातार तब तक खिलाना जब तक वह हर difficulty level को लगातार न हरा दे, और फिर tiers बनाना — यह approach interesting होगी। लगता है किसी ने पहले ही किया होगा, लेकिन मुझे material नहीं मिला
हालांकि मैं skeptical हूँ कि बहुत खराब Civ neural network का भी inference-time compute cost कितना होगा। असल में यह कैसे scale होगा, नहीं जानता, लेकिन grandmaster-level होना जरूरी नहीं, फिर भी dumb mistakes का distribution long tail रखता है
DeepMind की Starcraft 2 AI AlphaZero से अलग है क्योंकि Starcraft perfect-information game नहीं है। शुरू में बार-बार पिटने से बचने के लिए इस AI को human game database चाहिए। नए game में ऐसा training data मिलना मुश्किल है। Civ भी दूसरे 4X strategy games की तुलना में artistic expression पर ज्यादा जोर देता आया है, और हर नए wonder के आने पर AI को retrain करना पड़े तो यह बहुत बड़ा बोझ हो सकता है
मैं skeptical हूँ कि यह project जिस तरह पेश किया गया है, वैसे सच में काम करता है या नहीं, लेकिन Minecraft engine के ऊपर Civilization game बनाने का idea बहुत दिलचस्प है
खासकर Hearthstone याद आता है
“चलो feast plan करें”, “ठीक है, मैं लकड़ी इकट्ठा करके लाता हूँ” से stakes भी ज़्यादा बड़े और ज़्यादा realistic हैं
fair कहें तो paper में शायद इसका ज़िक्र हो सकता है। वैसे भी यह पता नहीं कैसे preprint का preprint जैसा है
Dwarf Fortress याद आता है। हजारों सालों का dwarf world time, बदलता terrain, dwarf kingdoms का rise और fall simulate करने के बाद, player-controlled सात dwarves को map पर छोड़ देता है और कहता है “मज़े करो!”
यह उन areas को खोजने के लिए उपयोगी toy model हो सकता है जहाँ वास्तविक civilizations के behavior को predict किया जा सकता है या नहीं, लेकिन यहाँ AI breakthrough नहीं दिखता
Project Sid 6.7 आए तो पता नहीं
content देखकर लगा था कि यह कुछ साल बाद की film होगी। 90s cyberpunk movies पसंद हैं तो देखने लायक है
https://www.imdb.com/title/tt0114857/
https://en.wikipedia.org/wiki/Virtuosity
blog announcement post भी है: https://digitalhumanity.substack.com/p/project-sid-many-agen...
पेपर पढ़ने पर ऐसा लगता है मानो मुख्य बात उलट गई हो
एजेंट अलग-अलग तौर पर Minecraft वास्तव में नहीं खेल सकते, और जो काम उन्हें दिए गए हैं या जिनके लिए उन्होंने खुद हामी भरी है, उन्हें भी सफलतापूर्वक पूरा नहीं कर पाते। एक तरह से यह कुत्ते को इंसानों के कपड़े पहनाकर उसे इंसान जैसी सभ्यता घोषित करने जैसा है
ऊपर से मुख्य घटक असल में hardcoded हैं। संभव सामाजिक प्रकार, और शायद role names भी ऐसे ही लगते हैं। social organization का मतलब क्या होना चाहिए, यह भी ठीक से समझ नहीं आता। बहुत से बहुत कहा जा सकता है कि यह agent framework गेम NPCs में काम आ सकता है—यानी बस इतना दावा कि एजेंट अपनी roles और factions बनाए रखते हैं
एजेंट “legal structures का उपयोग कर सकते हैं” वाला दावा खास तौर पर भरोसेमंद नहीं लगता। क्योंकि “legal structures का उपयोग करो” कई agent actions में पहले से ही ठूँसा हुआ है। इसे असली मानव समाज तक बढ़ाने की कोशिश हास्यास्पद है, और authors का sociology और anthropology को बेफिक्री से नजरअंदाज करना भी मदद नहीं करता
कुछ और संदिग्ध दावे भी हैं। मैंने कहा कि मुझे “विश्वास” है कि role names hardcoded हैं, लेकिन अगर मैंने कुछ miss नहीं किया है तो जानकारी अस्वीकार्य हद तक अस्पष्ट है। agent prompts में कहीं भी नई role बनाने या खुद role assign करने जैसा कोई तत्व नहीं दिखता। हो सकता है मैंने कुछ miss किया हो, लेकिन जितना पढ़ता हूँ उतना और उलझता जाता हूँ
वे दावा करते हैं कि एजेंटों ने Minecraft के 12 दिनों में long-term social relationships बनाए, लेकिन वह वास्तविक समय में सिर्फ चार घंटे हैं, और एजेंट वास्तविक समय ही अनुभव करते हैं। Minecraft के एक दिन की लंबाई मायने नहीं रखती। “long-term social relationships बनाना” और “legal structures का उपयोग” सिर्फ बढ़ा-चढ़ाकर कहना नहीं, बल्कि बेईमानी जैसा लगता है
memes और religion propagation वाला हिस्सा GPT-4 के training data contamination को पूरी तरह नजरअंदाज करता है। summarized meme साफ दिखाता है कि उसे वास्तविक दुनिया के Pastafarian meme की जानकारी है, इसलिए यह निष्कर्ष निकालना कि यह meme “फैला”, गलत है। कहीं अधिक संभावना है कि वह उन एजेंटों के भीतर trigger हुआ जो पहले से उस meme को जानते थे। समझ नहीं आता कि उन्होंने सचमुच किसी नए fake religion से experiment क्यों नहीं किया
“oak log crafting syndrome” जैसे कुछ meme examples नए लगते हैं, लेकिन “meditation circle” या “vintage fashion and retro projects” जैसी चीजों का Minecraft से कोई संबंध नहीं है और वे लगभग निश्चित रूप से GPT-4 की hallucination हैं
कुल मिलाकर, ईमानदार research करनी हो तो GPT-4 का उपयोग करना एक भयानक गलती लगता है
उदाहरण के लिए, अगर n×n board state को world model के रूप में दिया जाए और सीमित choices उपलब्ध कराई जाएँ, तो agent गेम को स्थिर तरीके से खेल सकता है और game master को अपने decisions समझा सकता है। इससे यह भ्रम पैदा होता है कि agent reasoning कर रहा है
आखिरकार, मुझे लगता है कि यह world model को सरल choice problems में तोड़ने की encoding problem है
[1] https://jdsemrau.substack.com/p/evaluating-consciousness-and...