इमेज मॉडल कैटलॉग में ज़्यादातर सिर्फ़ अच्छी बनी चीज़ें इकट्ठी होती हैं। असल में जिसकी ज़रूरत होती है, वह "यह नहीं होता"
नहीं मिलता। इसलिए मैंने 561 इमेज चलाकर 475 रखीं, और हटाई गई 65 इमेज भी इस वजह के साथ
सार्वजनिक कीं कि वे क्यों फेल हुईं। रखी गई और हटाई गई, दोनों में seed जुड़ा है, इसलिए आप उन्हें वैसा ही reproduce कर सकते हैं।
Korean text बन जाता है। लेकिन जो शब्द गलत होते हैं, वे हर बार वही गलती करते हैं
शुरू में मैंने सिर्फ़ एक इमेज देखकर लिखा था, "Korean text लिखवाएँ तो भी गलत आता है", लेकिन छह इमेज चलाकर देखा तो यह
दावा ज़्यादा बढ़ा-चढ़ा था। चार बिल्कुल सही निकलीं। नूडल्स, लाइब्रेरी, "Exit 3"(नंबर+Korean),
"Today's recommended menu"(6 syllable के तीन शब्द)।
लंबाई variable नहीं है। 2 syllable भी बना और 6 syllable भी, लेकिन 4 syllable गलत हुआ।
गलत हुए दो केस दिलचस्प हैं। "Honest Noodles" "Quiet Noodles" जैसा निकल आया, और seed बदलने पर भी
वैसा ही आया(1167746582, 1910572019)। वही typo दो बार। यह seed luck नहीं,
उस शब्द की समस्या है। "Hanbat Restaurant" "Hanbbyot Restaurant" बन गया, जो मौजूद न होने वाला syllable है।
दोनों ही अंतिम consonant पर टूटे, लेकिन guk·neul·cheon में भी अंतिम consonant हैं और वे ठीक निकले, इसलिए सिर्फ़ दो मामलों से
कारण तय नहीं करूँगा।
इसलिए अगर गलती हो, तो seed दोबारा न घुमाएँ; wording बदलें। दोबारा चलाने पर भी वही जगह
गलत होगी।
दिए गए अक्षर यह बना देता है। जो अक्षर खुद गढ़ने पड़ें, वे नहीं बना पाता
तीन batches तक मैं गलत समझ रहा था कि "strings की संख्या limit है"। limit ढूँढने के लिए उसी
nameplate पर strings की संख्या 1→8 तक बढ़ाई, तो आठों बिल्कुल सही निकले।
संख्या variable नहीं थी। पुराने failures को फिर देखा तो टूटने की जगह साफ़ दिखी।
- कैफ़े menu board: prompt में लिखे तीन items सही, बाकी CAPEME, CABIELO
- timeline: सिर्फ़ year range तय की, तो years आ गए और labels फेल
- Kanban mockup: column names नहीं दिए, तो तीनों columns "Kanban"
स्क्रीन पर आने वाले सभी text को prompt में ज्यों का त्यों लिखें। आठ कोई limit नहीं है, बस वही जगह है जहाँ मैंने test रोक दिया।
हालाँकि लिख देना हमेशा काफ़ी नहीं होता। जो तीन originally फेल हुए थे, उन्हें सिर्फ़ strings लिखकर दोबारा
चलाया तो menu board में सभी दस lines, book spines में 12 में से 10 सही आए, लेकिन route map में 9 में से
4 ही। अगर text छोटा हो और कई angles पर rotate हो, तो दूसरी constraint लग जाती है।
मैंने लिखा था "हाथ आम तौर पर बन जाते हैं", और तीन घंटे में वापस ले लिया
Lighting और composition fix करके सिर्फ़ हाथ की difficulty 8 steps तक बढ़ाई, फिर 1.5~2x zoom करके देखा और लिखा, "8 में से
7 anatomically ठीक हैं"। यह आम धारणा के उलट था, इसलिए सबसे ज़्यादा फैलने वाली line भी वही थी।
r/StableDiffusion पर डालने के दो घंटे बाद comment आया। "तीन उँगलियों वाले में
छह उँगलियाँ हैं।" 4x zoom किया तो सही था। 20 मिनट बाद किसी और ने overlapping hands की ओर
इशारा किया। "वह भी गलत है, सिर्फ़ चार हैं।"
8 में से 3 इमेज दो लोगों ने एक ऐसा काम करके ढूँढीं जो मैंने नहीं किया था। उन्होंने गिना।
इसलिए मैंने पूरी category हटा दी। एक-एक इमेज को फिर से score नहीं किया। fail हुआ tool मेरी आँखें थीं;
उन्हीं आँखों से बाकी पाँच इमेज judge करता तो वही गलती तीसरी बार करता। 8 की 8 इमेज seeds के साथ failure items में भेज दीं।
बाकी measurement results
- Objects गिनता है, लेकिन attributes नहीं गिन पाता। "exactly N" eggs 2~8 तक सब सही थे, लेकिन
"exactly two colors" में चार colors निकले। अगर हर चीज़ को अलग से point किया जा सकता है, तो count
माँग सकते हैं; अगर colors, areas, light sources गिन रहे हैं, तो result खुद गिनकर देखें। - Lighting को नाम से पुकारेंगे तो lighting equipment फ्रेम में आ जाएगा। "softbox" लिखे हुए
दोनों prompts में softbox subject के रूप में आ गया। रोशनी क्या कर रही है, वह लिखें। - "seamless" लिखने पर भी tiling नहीं होती। 8 patterns में से सिर्फ़ 1 connect हुआ, और वह भी
vertical stripes थे, इसलिए edges अपने-आप match हो गए। - "straight down" request है, instruction नहीं। 8 aerial images में से पाँच diagonal आईं।
crane या घर जैसी vertical खड़ी चीज़ हो, तो camera उसे दिखाने के लिए नीचे आ जाता है। - Size analogy subject को swap कर देती है। "pony-sized beetle" माँगा तो harness पहने
pony आ गया। beetle नहीं था। - एक ही व्यक्ति को दूसरी photo में डालना नहीं होता। strength 0.45 पर face बचता है, लेकिन
पूरा composition साथ चला आता है; 0.72 पर दूसरा व्यक्ति बन जाता है। बीच में कोई काम करने वाली value नहीं है। - image-to-image objects जोड़ या हटा नहीं सकता। दूसरी ओर media conversion(फोटो→gouache वगैरह)
stable है। strength 0.50~0.60 range।
कुल लागत $4.54 थी(fal.ai, $0.008 per megapixel)।
Korean README: https://github.com/sjh9714/awesome-krea-2/blob/main/README_KO.md
सभी images browse करें: https://sjh9714.github.io/awesome-krea-2/
सिर्फ़ edit recipes को agent skill के रूप में निकाला गया: https://github.com/sjh9714/same-frame
अभी कोई टिप्पणी नहीं है.