- जनरेटिव इमेज AI latent space, noise removal, और text-to-image कनेक्शन के ज़रिए विश्वसनीय-से परिणाम बनाता है, लेकिन मनचाही खास image को ठीक-ठीक पाने में इसकी संरचनात्मक सीमाएँ हैं
- Stable Diffusion लाखों images में noise जोड़कर और उन्हें चरणबद्ध तरीके से restore करना सीखकर, pure noise से विश्वसनीय images बनाता है
- text prompt को word space से image space में कई बार बदलना पड़ता है, और एक बार में आम तौर पर लगभग 75 शब्द ही संभाले जा सकते हैं, इसलिए बारीक control मुश्किल होता है
- simple blog header या SEO के लिए लिखे गए articles जैसे काम, जहाँ output बहुत महत्वपूर्ण नहीं होता, वहाँ generative AI जल्दी replacement बन सकता है; लेकिन composition, pose, style, color जैसी सटीक constraints के लिए illustrator का input चाहिए
- commercial illustration में ज्यादा realistic workflow यह है कि इंसान line art, composition और core idea तय करे, AI color, lighting और background जैसी कम महत्वपूर्ण details भरे, और फिर इंसान दोबारा edit करे — यानी collaborative workflow
Stable Diffusion को समझने के लिए latent space
- colors, words और images सभी को numbers की list के रूप में represent किया जा सकता है, और अच्छा representation वह होता है जिसमें similar चीज़ों के numbers करीब हों
- color space में RGB, Lch, CMYK जैसे कई तरीके हैं, और हर तरीका “similarity” को अलग तरह से define करता है
- numbers रंग को store करने वाली file से ज्यादा उस रंग की ओर इशारा करने वाले label और instruction जैसे होते हैं
- words को भी सैकड़ों numbers से represent किया जा सकता है; “mom” और “dad” करीब हो सकते हैं, जबकि “mom” और “prestidigitation” ज्यादा दूर रखे जा सकते हैं
- images, words और colors से ज्यादा complex होती हैं, लेकिन हजारों numbers से image space बनाया जा सकता है
- अगर हर pixel के RGB values की list बनाई जाए, तो लाखों numbers चाहिए होंगे
- काली बिल्ली और सफेद बिल्ली जैसी अर्थ के लिहाज़ से similar images भी सिर्फ pixel values देखने पर बहुत दूर हो सकती हैं
image latent space captions से उधार लिया जाता है
- कई images के साथ captions, labels और आस-पास का text होता है, इसलिए image और text के रिश्ते के जरिए image space बनाया जा सकता है
- “cat” label वाली photos एक-दूसरे के करीब, और “car” label वाली photos एक-दूसरे के करीब रखी जा सकती हैं
- “Miyizaki cat-bus” जैसा label बिल्ली और car के बीच कहीं रखा जा सकता है
- generative AI research में ऐसे space को image latent space कहा जाता है
- latent space उन लगभग सभी images को, जिन्हें आप देखना चाहते हैं, और random, समझ में न आने वाली images को भी numbers की list के रूप में approximate कर सकता है
- इस space की तुलना pictures के लिए Library of Babel से की जाती है
Stable Diffusion कैसे काम करता है
- Stable Diffusion image generation का इकलौता तरीका नहीं है, लेकिन यह व्यापक रूप से इस्तेमाल होने वाला तरीका है
- training लाखों images में थोड़ा noise जोड़कर, फिर computer को उन्हें साफ़ restore करने के लिए train करने की प्रक्रिया से होती है
- इसके बाद और ज्यादा noise जोड़ा जाता है, और उसे फिर से कम noisy image में लौटाने के लिए train किया जाता है
- इस प्रक्रिया को तब तक दोहराया जाता है जब तक image लगभग गायब न हो जाए; इससे computer चरणबद्ध तरीके से किसी भी image में वापस जाने का तरीका सीखता है
- text और images को जोड़ने वाली training भी साथ में होती है
- किसी बिल्ली की photo के साथ “my cute kitty mister french fry” जैसा caption होने की संभावना ज्यादा है
- “the engine from a 1959 Austin Healey” जैसा caption होने की संभावना कम है
- Cross attention कई AI systems को जोड़ता है, ताकि image का noise कम करते हुए image को किसी खास text caption के करीब धकेला जा सके
- generative AI noise removal प्रक्रिया में दूसरे goals जोड़कर image को खास दिशा में guide करता है
उंगलियाँ और चेहरे बिगड़ते क्यों हैं
- latent space training images को जस-का-तस रखने वाला space नहीं है, बल्कि सभी possible images को represent करने वाला space है
- noise से दूर जाने वाली ताकत image की sharpness को प्राथमिकता देती है, और text label की ओर जाने वाली ताकत उस text से label की जा सकने वाली image को satisfy करने पर focus करती है
- image captions अक्सर इंसानी हाथों या उंगलियों की संख्या की accuracy को cover नहीं करते
- “no deformed hands” जैसा negative label, अगर “deformed hands” label वाली images कम हों, तो सीमित असर रखता है
- “polydactyly” extra fingers से strongly associated label है, इसलिए यह बेहतर हो सकता है
- चेहरों में भी यही समस्या है, और कई generative systems चेहरे ठीक करने के लिए अलग components रखते हैं
- core system के लिए अगर कुछ चेहरा जैसा दिखे तो वह पर्याप्त मान सकता है
- इंसानी आँखें चेहरे की accuracy, जैसे दोनों आँखों की दिशा, को लेकर बहुत संवेदनशील होती हैं
- prompt में James Gurney जैसे artist names डालने से पूरी image की consistency बेहतर हो सकती है
- आम captions मुख्य रूप से nouns और focus subject पर केंद्रित होते हैं
- artist style image के किसी एक हिस्से का नहीं, बल्कि पूरी pixels में फैला gestalt होता है, इसलिए उससे ज्यादा consistent results मिल सकते हैं
वे काम जिन्हें generative AI आसानी से replace कर सकता है
- real painting, sculpture, woodcut, embroidery जैसे physical media के लिए इंसानों की चाहत खत्म होने की संभावना कम है
- physical media के outputs generative AI training में लगातार इस्तेमाल हो सकते हैं
- बिना permission artworks का training में इस्तेमाल होना और रोज़गार की जगह लेने में उपयोग होना intrusive लग सकता है
- लेकिन latent space के भीतर image किसी specific तरीके से मौजूद नहीं होती; किसी खास prompt और किस्मत के साथ similar image retrieve हो जाए, इतना ही कहा जा सकता है
- human artists के fair use को अनुमति देते हुए केवल ML use को कानूनी रूप से सीमित करने का तरीका स्पष्ट नहीं है
- generative AI उन illustrations और writing के कुछ हिस्सों को replace कर सकता है जिनमें content सच में important नहीं होता
- page layout में fit करने के लिए roughly relevant blog header image
- SEO के लिए spammy weekly blog posts
- ऐसे outputs furniture जैसे content के करीब होते हैं, जिनकी final consumer तक कोई खास परवाह नहीं करता
- इस तरह का काम पहले से ही high-paying नहीं था और तेजी से गायब हो रहा है; कड़ी legal regulation होने पर भी बच निकलने का रास्ता दिखता नहीं
खास image पाना मुश्किल क्यों है
- generative AI से impressive images बनाना अपेक्षाकृत आसान है, लेकिन specific image बनाना कभी-कभी लगभग impossible होता है
- लगभग 10 में से 1 image “cool” लग सकती है, लेकिन इसका मतलब यह नहीं कि वह सच में मांगी गई image से match करती है
- civitai जैसे generated image showcases में बहुत लंबे prompts और result images की तुलना की जा सकती है
- यह site NSFW हो सकती है
- prompt के कई elements image में बिल्कुल दिखाई नहीं देते
- “a mystical dragon” जैसी पूरी concept prompt में prominent हो सकती है, लेकिन image में नहीं
- इस तरह का उपयोग image बनाने वाले gacha game या slot machine जैसा है
- बहुत सारे interesting ideas वाला prompt डालिए, और जब तक कुछ satisfying न निकले, दोहराते रहिए
- result attractive हो सकता है, लेकिन वह मांगी गई image खुद न हो
- text को actual prompt से text latent space में, और फिर image latent space के function में बदलना पड़ता है, इसलिए यह image control के साधन के रूप में अजीब और कठिन तरीके से काम करता है
- एक बार में process हो सकने वाला text भी आम तौर पर लगभग 75 शब्दों के आसपास होता है
- अगर text ज्यादा लंबा हो, तो उसे cross attention में अलग guidance systems में बांटना पड़ता है
image input ज्यादा strong control साधन है
- images image latent space में अच्छी तरह translate होती हैं, इसलिए वे text की तुलना में ज्यादा direct constraints बन सकती हैं
- image-based prompts generated result की content और composition को बारीकी से control कर सकते हैं
- किसी दूसरी image जैसी line art में reduce होने वाली image बनाना
- किसी दूसरी image से निकाले गए depth map जैसी image बनाना
- किसी दूसरी image से ली गई pose से match करने वाली image बनाना
- content अलग हो, लेकिन किसी दूसरी image की style से match करने वाली image बनाना
- किसी दूसरी image की perspective lines से match करना
- किसी दूसरी image की color palette से match करना
- समस्या यह है कि ऐसी guide images आएँगी कहाँ से
- desired illustration concept को समझकर उसे line art, pose sketch और style में बदल सकने वाली भूमिका मौजूदा illustrator से overlap करती है
- precise requirements वाले generated image tasks को illustrator के बिना उपयोगी बनाना मुश्किल है
commercial illustration का संभव AI workflow
- commercial illustrators के अपना काम बनाए रखने की संभावना है, लेकिन faster work pace से match करने के लिए उन्हें AI को workflow के हिस्से के रूप में सीखना पड़ सकता है
- इसका मतलब drawing छोड़कर prompt engineer बन जाना नहीं है
- ऐसा करने से भारी training बेकार जाएगी और हासिल भी कम होगा
- एक possible digital painting process यह हो सकता है
- composition और core idea पर focus करते हुए traditional तरीके से line art तैयार करें
- generative AI से color और lighting approaches के लगभग 12 suggestions बनवाएँ
- उनमें से 1–2 चुनें
- AI के बनाए pixels पर लगभग पूरी तरह दोबारा paint करते हुए colors को intention के हिसाब से adjust और correct करें
- जिन artists के लिए color choice में बहुत care और emotion होता है, उनके लिए यह तरीका fit नहीं हो सकता
- सभी artists के लिए कोई एक तरीका सही नहीं है; deadline वाले artists सबसे कम important और सबसे boring steps AI से भरवा सकते हैं
- crowd scenes
- cityscapes
- vegetation
- कई images में page header image जैसी ज़रूरी लेकिन important नहीं furniture भी होती है, और यही क्षेत्र generative AI का domain बनता जा रहा है
products और research direction के बीच gap
- generative AI research image generation को image input से निर्देशित करने के तरीके increasingly अधिक देने की दिशा में बढ़ रही है
- market में आने वाले products illustrator के workflow में आसानी से fit करना मुश्किल हैं
- useful level का control पाने के experiments personal computer पर open data models चलाकर किए गए थे
- commercial illustration का भविष्य शायद ऐसा होगा जिसमें illustrator core चीज़ें तय करे, generative AI कम important हिस्से भरे, और फिर इंसान edit करे
- generative AI products को भी ऐसे workflows support करने की दिशा में evolve होना चाहिए
1 टिप्पणियां
Hacker News राय
यह एक और नज़रिया है जो शायद किसी को पसंद न आए, लेकिन AI का कलाकारों पर असर मुझे Spotify के संगीत उद्योग पर पड़े असर जैसा लगता है। यानी publishers और बड़े artists/players को छोड़कर बाकी सभी की revenue streams खत्म कर देने की संभावना बहुत ज़्यादा है
Spotify ने physical distribution से आने वाला पैसा व्यावहारिक रूप से खत्म कर दिया, और यह उस समय टाली न जा सकने वाली piracy से भी बदतर था। कम-से-कम piracy के दौर में ऐसा तो नहीं था कि पैसे भी न मिलें और labels से दोबारा negotiation करने के लिए वकीलों की फीस भी भरनी पड़े
Adobe, OpenAI जैसी जगहें कलाकारों को छोटे-मोटे पैसे देकर model training के लिए चित्र बनवाती दिखती हैं, फिर उनसे waiver पर sign करवाती हैं कि “इस AI art से पैसे न भी मिलें तो मुझे ठीक है”, और फिर output को Splice जैसी जगहों पर महंगे में फिर से बेचने की कोशिश करती हैं: https://splice.com/features/sounds
आखिरकार model अपने-आप में लगभग मायने नहीं रखेगा; असली differentiator यह होगा कि किसके काम पर training हुई है। लेकिन फिर बात यही होगी: “यह चित्र AI ने बनाया है, इसलिए तुम्हें पैसे देने की ज़रूरत नहीं”
पुरानी machines 1–2 job roles को replace करने तक सीमित थीं, लेकिन अगर इंसान AI training को सच में efficient बना दें, तो यह सैकड़ों roles को एक साथ replace कर देगा। साथ ही AI दूसरे इंसानों की ज़रूरत को कम करके isolation बढ़ाने का असर भी रखता है
इन वजहों से मुझे लगता है कि दुनिया AI के बिना कहीं बेहतर होती, और tech companies अपने monster जैसे products से दुनिया को बिगाड़ रही हैं
Spotify ने piracy की economics उठाई और उसके ऊपर वैधता जैसा दिखने वाला एक पतला खोल चढ़ा दिया
पहली बात, AI-generated images random और लगभग consumable होती हैं। आपको एक बार इस्तेमाल करने लायक शानदार image मिल जाएगी, लेकिन उसके बाद? उस पर campaign बनाना मुश्किल है
दूसरी बात, AI-generated art को copyright protection नहीं मिलता, इसलिए copycat competitors AI से बनी marketing images को खुलकर इस्तेमाल कर सकते हैं
कम-से-कम paid graphic artist के काम को AI में seed के रूप में डाला जा सकता है, और seed-based AI images को copyright protection मिल सकता है। लेकिन वह artist unpaid intern से बेहतर काम करेगा
बचपन में रविवार दोपहर मेरे पिता album लगाते थे और बस सुनते थे। सचमुच सिर्फ सुनते थे। आज ऐसा करने वाले लोग बहुत कम हैं
अब driving, reading, internet surfing, coding, cleaning करते हुए incidental music सुनने की demand बहुत बड़ी है। जब से music portable हुआ, consumption के तरीके में मूलभूत बदलाव आ गया, और Spotify बस उस competition में जीत गया
Digital music के शुरुआती दौर की तुलना में मुझे तो physical media distribution उल्टा बढ़ता हुआ लगता है। यह Spotify से ज़्यादा music के digitalization से जुड़ा है
मेरे आसपास तो कई लोग सच में physical format में music सुनने के बजाय, अपने पसंदीदा artists को support करने के लिए merch या media खरीदते दिखते हैं
इस तरह के लेख आम तौर पर text-to-image generation और prompt engineering को आधार मान लेते हैं, और अक्सर ऐसा इसलिए होता है क्योंकि संबंधित model को सीधे इस्तेमाल करने का अनुभव कम होता है। अगर यह सिर्फ मज़े के लिए नहीं है, तो वह तरीका मूल रूप से सही जवाब नहीं है
जिन कामों में predictability और control चाहिए, वे कुछ इस तरह के होते हैं: “मेरे हाथ से बनाए गए दूसरे उल्लुओं जैसे style में बाकी उल्लू बनाओ”, और इसमें photobashing और manual retouching/compositing जुड़ते हैं। उबाऊ न लगने वाला output बनाने के लिए, 3D CGI की तरह, यह एक hybrid क्षेत्र है जिसमें artistic और technical दोनों क्षमताएँ चाहिए
यह model की natural language understanding की कमी से पैदा हुई समस्या नहीं है, और अगर कुछ ऐसा भी आ जाए जिसे reasonable तौर पर AGI कहा जा सके, तब भी शायद यह बहुत अलग न हो। Text prompt में अर्थ समाने की capacity पर्याप्त नहीं होती
Detailed prompt और desired style के कई examples पर्याप्त लगते हैं। बेशक इसका मतलब यह नहीं कि यह बहुत आसान है, लेकिन इसके लिए कोई fundamental breakthrough ज़रूरी नहीं लगता। ज़रूरी components पहले से मौजूद हैं
यह AI को school ले जाने या Matrix-style data upload के जरिए नई concepts जल्दी सीखाने जैसा है। Experts वह तरीका सीखेंगे, और market भी ऐसे काम चाहने वालों के इर्द-गिर्द बनेगा
हाल में मैंने “एक robot जो इंसान के सामने बैठकर Magic: The Gathering खेल रहा है” try किया, लेकिन image में इंसान को डालना ही मुश्किल था, और model MTG को पर्याप्त नहीं जानता था, इसलिए वह बस “board game” या “card game” तक pattern match करता था
कुछ generated images दूसरों से बहुत बेहतर थीं, इसलिए मैं एक image का table layout और दूसरी image का robot लेना चाहता था, लेकिन अभी यह व्यवहार में लगभग असंभव है। “blend” भी उस use case के लिए काम नहीं आता
इसमें सुधार होगा, इसमें शक नहीं, लेकिन सोचता हूँ कि इसके नीचे कोई अधिक सामान्य limitation है या नहीं। यह सिर्फ data की कमी भी हो सकती है। Google Images पर Magic: The Gathering search करने पर भी नतीजे काफी निराशाजनक हैं
एक और example: जब stone monolith पर उकेरे हुए glowing blue logo की request की, तो कभी-कभी logo उकेरा तो गया, लेकिन बहुत कम, और blue glow तो कभी नहीं आया। आम तौर पर पूरा monolith या उसका कुछ हिस्सा blue हो जाता था
“व्यावसायिक illustrators अपनी नौकरियां बनाए रखेंगे, लेकिन तेज़ काम की गति बनाए रखने के लिए उन्हें आम तौर पर अपने workflow के हिस्से के रूप में AI का उपयोग सीखना होगा” वाला हिस्सा खास तौर पर अच्छा लगा
मैं कभी-कभी illustration बनाता हूं, लेकिन मेरा style generative AI के काम से काफी अलग है। हाल ही में मैंने Midjourney images वाला game manual 1.1 जारी किया है, और अब मैं एक सही मायने में अच्छे illustrator में निवेश कर रहा हूं। वजह यह है कि Midjourney images में व्यक्तित्व की कमी है
हालांकि कुछ महीनों बाद यह बदल भी सकता है। image consistency की वजह से मैं illustrator के साथ काम जारी रखूंगा, लेकिन AI के ज्यादा चमकदार नतीजे देने की संभावना भी है
“2 महीने बाद बदल जाएगा” वाली बात भी वाजिब है, लेकिन यह बात डेढ़ साल से लगातार कही जा रही है और अभी तक गुणात्मक रूप से बदलाव नहीं आया है। generated image quality बेहतर हुई है, लेकिन इसे qualitative leap कहने लायक नहीं
साथ ही, civitai link https://sambleckley.com/writing/civitai.com/images पर जाता है, जो dead link है
link: https://youtu.be/FQ6z90MuURM?t=329
मैं अपने partner के साथ कुछ छोटे internet side businesses चलाता हूं। उनमें से एक content-based D2C business display ad creatives के लिए custom illustrations पर काफी निर्भर था; CTR ठीक-ठाक और average था, लेकिन CPC बहुत high था और ROAS सच में खराब था
कुछ महीने पहले हमने अपने usual illustrator और Stable Diffusion का A/B test किया, और नतीजे काफी dramatic थे। CTR लगभग 20% बढ़ गया और CVR भी लगातार improve हुआ
मैं लेख के इस दावे से सहमत नहीं हूं कि AI-generated images उन businesses में सबसे अच्छा काम करती हैं जहां content असल में important नहीं होता। यह business एक शानदार counterexample था। हमारे case में AI-generated images target customers को ज्यादा अच्छी लगीं, और पहले से कम लागत में कहीं ज्यादा granular personalization संभव हुआ
CPA भी काफी कम हुआ, और creative variations को बारीकी से control कर पाने के कारण audience segments के हिसाब से real-time optimization संभव हो गया। नए campaign का launch time भी आधा हो गया, और design nuances पर चर्चा, deadline delays, creative block भी गायब हो गए
creative process में human touch कम होने पर mixed feelings होती हैं, लेकिन शुद्ध growth hacking के नजरिए से यह game changer था, और इसे साबित करने के लिए हमारे पास numbers भी हैं
कुल मिलाकर मैं इसे net positive मानता हूं। यह human illustrators का अंत होना जरूरी नहीं है, लेकिन उन्हें customer demands के प्रति ज्यादा संवेदनशील होकर adapt करने के लिए मजबूर करेगा। content business तक में creative sourcing में इतनी friction होना समझ में नहीं आता
वैसे भी efficiency भी है और soul भी। robots ने पहला काम आम तौर पर अच्छी तरह कर दिया, और कभी-कभी दूसरे में भी चौंका देते हैं
यह जानना चाहूंगा कि आगे-पीछे की चर्चा घटने की वजह immediate, interactive response—यानी लोगों से कम deal करना—है, या machine पर trust और delegation है
अगर मामला ऐसा है कि “machine ने मेरे description के आधार पर यह icon बनाया है, इसलिए color choice पर शक करने की जरूरत नहीं,” तो आखिरकार यह वही classic problem है जिसमें machine को infallible और इंसान से ज्यादा expert मान लिया जाता है। शायद दोनों चीजों का mix होगा
किसी space में furniture कितना important है, यह थोड़ी देर रुकने वाली waiting area से लेकर architect office तक एक spectrum है, और commercial art भी अलग नहीं। अगर वह image सच में meaningless होती, तो उसे वहां रखने की जरूरत ही नहीं होती
ज्यादातर non-professionally designed PowerPoint decks में आने वाले non-informational graphics की importance और भी कम हो सकती है। इसके उलट, किसी magazine feature article की 2-page spread opening image, अगर वह AI-generated images पर article न हो, तो AI से बनने की संभावना लगभग 0% मानता हूं। उस case में भी experts ने बाकी चीजों की तुलना में form refine करने में ज्यादा समय लगाया होगा
professional graphics workflow में specificity और pixel-level control बेहद important हैं। non-professional designers चाहे जो कहें, current tools इस काम के लिए fundamentally fit नहीं हैं। interface ही गलत है
Adobe या industry का कोई दूसरा player जिसे पता है कि क्या चाहिए, इसे solve कर सकता है, लेकिन वह Midjourney जैसा नहीं दिखेगा
“customer demands के प्रति ज्यादा responsive होना” और customer का mind read करना अलग बातें हैं। अगर आपको लगता है कि इस specific market में human illustrators के लिए यह doom signal नहीं है, तो आप खुद को धोखा दे रहे हैं
मैंने AI से अपना लेख लिखवाकर देखा, और वह भयानक था। उल्टा, grammar checker, summarizer, rewriting tool, speech-to-text app जैसे AI tools को ignore किया तो writing process सुस्त लगने लगा
मेरे लिए बीच का रास्ता सबसे अच्छा काम करता है। generative AI को मैं सिर्फ काम के intermediate stage में इस्तेमाल करता हूं, input यानी ideas या output यानी actual draft में नहीं
मेरा writing तरीका यह है। ideas contemplation या social media conversations से आते हैं। वहां discuss होने वाले topics की relevance कम से कम कुछ हद तक validated होती है
फिर मैं करीब 10 मिनट बैठकर AudioPen जैसे tool में अपने thoughts dictate करता हूं, और यह tool 10 मिनट की content को 5–6 paragraphs में summarize कर देता है। यही AI stage है। tool कुछ paragraph structures suggest करता है, तो मैं अच्छे structure मिलने तक बदलकर देखता हूं
उसके बाद मैं उस outline को follow करते हुए draft खुद लिखता हूं। अंत में grammar check के अलावा फिर AI tools इस्तेमाल नहीं करता। AI एक शानदार writing partner है, लेकिन भयानक writer है
“कमर्शियल illustrator अपनी नौकरियां बचाए रखेंगे, लेकिन तेज़ काम करने की रफ्तार बनाए रखने के लिए उन्हें ज़्यादातर अपने workflow के हिस्से के रूप में AI का इस्तेमाल सीखना होगा” — यह बात बिल्कुल वही है जो मैंने हकीकत में देखा है
AI media generation community के बाहर लोग अब भी इसे बस text डालने और result पाने भर जैसा समझते हैं। असल में, अपनी चाही हुई बिलकुल सही तरह की image पाने के लिए पूरा workflow बनाया जाता है
उदाहरण के लिए: https://old.reddit.com/r/StableDiffusion/comments/14ye2eg/co...
दूसरी image output है, लेकिन पहली ज़्यादा दिलचस्प है। यह node-based interface है, वैसा ही जैसा Unreal Engine जैसे game development tools में आम तौर पर दिखता है: https://docs.unrealengine.com/5.2/en-US/nodes-in-unreal-engi...
यह result image पाने के लिए APIs को जोड़ने जैसा है। आगे चलकर image generation सच में drawing करने से ज़्यादा backend programming जैसी हो जाएगी, ऐसा लगता है। क्योंकि actual drawing वाला हिस्सा automate हो जाएगा, और creativity खुद workflow में होगी
बेशक कभी न कभी workflow वाला हिस्सा भी automate हो जाएगा, लेकिन computer user की मंशा जानने लायक mind-reading नहीं कर सकता, इसलिए अभी यह दूर की बात है
लेख अभी के समय पर बहुत ज़्यादा केंद्रित लगता है। Stable Diffusion जैसे मॉडल एक खास technique से बहुत सफल हुए हैं, लेकिन यह सोचना मूर्खता है कि वही तरीका अनंत तक सुधरता रहेगा
generative “AI” कई रूप लेगा। अंततः यह creation में technique वाले हिस्से का बड़ा भाग हटा देगा और artists व content owners की income और relevance छीन लेने की संभावना ज़्यादा है
यह रातोंरात नहीं होगा, लेकिन आगे लगभग 10 साल तक AI खतरे से ज़्यादा उपयोगी tool जैसा रहेगा
किसी समय generative AI के multi-sensory system बनने की उम्मीद है, जिसमें visuals, sound और touch शामिल होंगे। ऐसे systems objects और environments के physical models के आधार पर, समृद्ध descriptions और culture की गहरी contextual awareness का इस्तेमाल करके नई और सटीक representations बनाएंगे
वे pixels नहीं, objects और relationships के रूप में सोचेंगे, और उन्हें simulate, render और filter करके user की इच्छाओं के अनुरूप बनाएंगे
writers और actors competition से खुद को बचाने की जो कोशिश कर रहे हैं, मैं उसका समर्थन करता हूं, लेकिन अंततः वह बेकार जाएगी, ऐसा लगता है। इस क्षेत्र में legal developments दिलचस्प होंगे
भविष्य के generative systems को यह साबित करने के लिए कि unauthorized training नहीं हुई, शायद audit trail की जरूरत पड़े कि उन्होंने दुनिया की समझ कैसे हासिल की। लेकिन इससे केवल मानक थोड़ा ऊंचा होगा, और clean-room तरीके से high-level descriptions जैसे दूसरे साधनों के जरिए महत्वपूर्ण relationships निकालने से यह नहीं रोक पाएगा
उदाहरण के लिए, Harrison Ford की copyrighted works या public places में ली गई images से AI को train करना अवैध हो सकता है, लेकिन Harrison Ford को attributes की एक श्रृंखला में संक्षेपित करके generative system को दे दें, तो वह असली Harrison Ford से अलग न पहचाने जाने वाली चीज़ बना सकता है। अगर इस process को document किया जा सके, तो legal system के पास इसे रोकने के बहुत तरीके नहीं दिखते। बेशक मैं इस क्षेत्र का expert नहीं हूं
वैसे, मुझे वर्तमान “AI” पसंद नहीं है। LLMs खास तौर पर अविश्वसनीय और ज़्यादातर बेकार लगे। AI-generated art भी अधिकतर boring, inaccurate या कहीं न कहीं कम convincing लगती है। फिर भी trend धीरे-धीरे और साफ होता जा रहा है, ऐसा लगता है
“कमर्शियल illustrator अपनी नौकरियां बचाए रखेंगे, लेकिन तेज़ काम करने की रफ्तार बनाए रखने के लिए उन्हें ज़्यादातर अपने workflow के हिस्से के रूप में AI का इस्तेमाल सीखना होगा” — यह विचार unpopular क्यों माना जाता है, समझ नहीं आता। यह आगे का logical path लगता है
जैसे CoPilot मुझे replace नहीं करता, लेकिन कुछ boilerplate को बहुत कम painful बना देता है और function लिखने की कोशिश करते समय आने वाले blank page या writing block से बचा देता है
खाली शुरुआत करने से बेहतर है कि किसी चीज़ से शुरू किया जाए और उसे ज़रूरत की shape मिलने तक modify किया जाए। आखिर में 80–99% फिर से बदलना पड़े, तब भी यही बात है
artists के लिए भी अपनी line art कैसी दिख सकती है, इसके कुछ examples देखना creativity को stimulate कर सकता है, और फिर वे अपने हिसाब से काम कर सकते हैं, यह अच्छा लगेगा
जिन illustrators के साथ मैं सबसे ज़्यादा काम करना चाहूंगा, वे वे लोग हैं जो उपलब्ध सभी tools का इस्तेमाल करके संभव सर्वोत्तम images बनाते हैं
ज़्यादातर बातों से सहमत हूँ, लेकिन किसी खास image को बनाकर निकालने वाले हिस्से से सहमत नहीं हूँ। यह साफ़ तौर पर विकसित की जा सकने वाली skill है
Image generation AI के लिए prompts को सरल बनाना और सही भाषा चुनना लोगों को काफी सिखाया है। अजीब बात है कि लोग बहुत-सा गैरज़रूरी कबाड़ डाल देते हैं, शायद यह “इस वाक्यांश ने पिछली बार कुछ बार अच्छा काम किया था” जैसी अंधविश्वास के करीब चीज़ है
लेख में जैसा कहा गया है, कई tools की chain के भीतर इसे एक tool की तरह इस्तेमाल करने वाला hybrid approach ही आगे का रास्ता है
कुछ concepts ऐसे भी हैं जिन्हें AI बिल्कुल नहीं समझता। मसलन अभी Midjourney “bulldozer”, “centaur”, “fantasy archer” जैसी चीज़ों में बेहद struggle करता है। ये चीज़ें बेहतर training data वाले नए model versions में अनिवार्य रूप से ठीक होंगी, और अतीत में भी ऐसे ही ठीक हुई हैं
असली मुश्किल छोटी details या semantic information से आती है। उदाहरण के लिए background तक सब कुछ focus में हो, ऐसा realistic/photo जैसी scene मांगना मुश्किल है, और “focus stacking” जैसे keywords इस्तेमाल करने पर भी ठीक से नहीं होता। “selfie” हमारे मिले हुए शब्दों में सबसे बेहतर था, लेकिन दुर्भाग्य से उसके side effects बड़े हैं
हो सकता है training data में उस property को खास तौर पर describe करने वाले examples पर्याप्त न हों, लेकिन सच कहूँ तो ऐसे concept को व्यक्त करने के लिए English word सीखना भी अपने-आप में मुश्किल है
छोटी details के मामले में, मौजूदा approach “लाल triangle लगे हुए छह नीले cubes pyramid shape में arranged हों, और एक पीली ball उनके ऊपर balance कर रही हो” जैसी request handle करने तक scale नहीं होगी। हालांकि लेखक के कहने की तरह, ऐसी चीज़ें संभवतः अलग-अलग बनाए गए assets और न्यूनतम Photoshop skill से संभाली जाएँगी
Prompt की technical problem की बात करते हुए उस हिस्से को पूरी तरह छोड़ दिया गया
Prompt की problem stacked cubes नहीं हैं। 10 software engineers, 10 sales team members और 3 senior managers से advertising के लिए visual ideas देने को कहें, तो काले background पर रखी घटिया images, robots, animation, कहीं देखी और अवचेतन में याद रह गई चीज़ों की खराब copies, और सच में काम करने वाले 0 visual ideas मिलेंगे
Designers और illustrators को अच्छा product बनाने के लिए ऐसी clichés और खराब ideas से लगातार भिड़ना और उन्हें पलटना पड़ता है
GPT और code को लेकर भी मैं लगभग बिल्कुल ऐसा ही देखता हूँ। मैंने smart non-coders को GPT से request कर के कुछ working चीज़ हासिल करते देखा है, लेकिन “timer से key अपने-आप दबाने वाला लिख दो” से “client इस business logic और features को handle करे, इसके लिए repository update कर दो” तक जाना एक बहुत बड़ी छलांग है
मेरे नज़रिए से अब भी developer mindset वाला व्यक्ति काम करे, यह जरूरी है, और AI बस उस प्रक्रिया में जिंदगी थोड़ी आसान बनाता है
Art field भी मुझे वैसी ही लगती है। दिखने में ठीक-ठाक image पाना आसान है, लेकिन specific और meaningful image पाने के लिए आम तौर पर बहुत post-processing चाहिए होती है, जो सामान्य व्यक्ति नहीं कर सकता
हम पहले ही जबरदस्त progress देख चुके हैं। LLM-based coding tools भी बेहतर हो रहे हैं, LLM खुद भी बेहतर हो रहे हैं, और context size भी बढ़ रहा है। LLMs में interest ज्यादा effective नए approaches के development को भी stimulate कर रहा है
कुछ ही सालों में, चाहे Lecun की JEPA जैसी चीज़ हो, DeepMind जो भी hybrid supercoder बना रहा हो, या open source LLMs हों, programming में वे GPT-4 को पछाड़ देंगे