2 पॉइंट द्वारा GN⁺ 3 시간 전 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • Qwen-Image सीरीज़ का तीसरी पीढ़ी का बेस इमेज जनरेशन मॉडल, जो सिर्फ़ देखने में अच्छे इमेज से आगे बढ़कर प्रोडक्टिविटी कार्यों में उपयोगी ‘Real(实)’ को मुख्य लक्ष्य बनाता है
  • अधिकतम 4.5k token input प्रोसेस करके अख़बार, स्टोरीबोर्ड, परीक्षा-पत्र जैसे उच्च-जानकारी वाले लेआउट और कई concepts के parallel व nested इमेज एक साथ जनरेट करता है
  • 10px आकार के अक्षर, LaTeX सूत्र, और handwritten annotations को पढ़े जा सकने लायक render करता है, और pores, बाल, skin, brushstroke जैसी सूक्ष्म textures भी पुन:निर्मित करता है
  • 12 भाषाएँ, कई fonts, 100 से अधिक art styles, web·game·livestreaming UI को support करता है, और इंटरनेट से ताज़ा जानकारी खोजकर उसे इमेज में शामिल भी कर सकता है
  • यह मॉडल newspaper PDF, short drama storyboard, complex UI सहित design·content creation·education·e-commerce में इमेज जनरेशन को deployable productivity tool तक विस्तारित करना चाहता है

‘Real’ की ओर तीसरी पीढ़ी का मॉडल

  • Qwen-Image-3.0 Qwen-Image सीरीज़ का तीसरी पीढ़ी का बेस इमेज जनरेशन मॉडल है
  • हर पीढ़ी की मुख्य दिशा इस प्रकार है
    • Qwen-Image-1.0: Precision
    • Qwen-Image-2.0: Precision, Variety, Completeness, Beauty, Authenticity
    • Qwen-Image-3.0: Real(实)
  • ‘Real’ तीन क्षमताओं से बना है
    • समृद्ध कंटेंट: अधिकतम 4.5k token input और complex layout support
    • यथार्थवादी डिटेल: 10px अक्षर और pores, बाल जैसे सूक्ष्म तत्वों का पुन:निर्माण
    • गहरा ज्ञान: 12 भाषाएँ, विविध UI और world knowledge का उपयोग करके generation
  • लक्ष्य इमेज जनरेशन को ‘usable’ से ‘practical’ और ‘देखने में अच्छा’ से वास्तव में उपयोगी बनाना है

समृद्ध कंटेंट और जटिल लेआउट

  • गणित की स्लाइड में spatial relationships, mathematical symbols, theorem explanation और हर तत्व की relative position को साथ में render किया जा सकता है
  • लगभग 3.7k token के निर्देश से कई इमेज जोड़ने के बजाय एक ही 3×3 grid को single pass में जनरेट करता है
    • हर cell एक complex infographic से बना है, जिसमें Chinese·English वाक्य, सूत्र, chart, और comic character जुड़े होते हैं
    • tunnel safety comic, spatial geometry class, 「Chu Shi Biao」 शैली विश्लेषण, parabolic motion, parasitology, दाएँ सीने के दर्द का medical diagram, Sylow theorem, bank internal control, और cell DNA structure comparison को एक ही इमेज में रखता है
  • अधिकतम 4.5k token के निर्देश लेकर उच्च information density वाले visual layout को समझता और render करता है
  • क्षैतिज विस्तार

    • इसका मतलब एक single canvas पर कई parallel elements रखने की क्षमता है
    • semantic juxtaposition और spatial control का उपयोग करके कई concepts को एक-दूसरे में बाधा डाले बिना व्यवस्थित करता है
  • ऊर्ध्व गहराई

    • यह अर्थ को विभाजित करके logically nested interfaces को चरण-दर-चरण व्यक्त करने की क्षमता है
    • एक ही निर्देश से VSCode programming screen, Qwen Chat, WeChat, और hand-drip coffee poster के overlapping multi-screen structure को जनरेट करता है
    • हर layer उस UI की शैली और detailed elements को बनाए रखती है

छोटे अक्षरों से पेंटिंग restoration तक

  • छोटे अक्षर और जटिल typesetting

    • 10px आकार के छोटे अक्षर भी पढ़ने लायक render करता है
    • whale shark knowledge infographic जैसे text और illustration से भरे क्षेत्रों को साथ में जनरेट कर सकता है
    • algebraic geometry paper के एक पेज पर LaTeX सूत्र, superscript·subscript, Greek letters, theorem numbers, braces, fraction bars, और multi-line alignment को पुन:निर्मित करता है
    • छोटे font में भी सूत्र और मुख्य text की readability बनाए रखता है
    • यथार्थवादी paper texture और dense text को जोड़कर newspaper-format image जनरेट करता है
  • editing और handwriting

    • किताब के पेज पर लाल रंग की handwritten annotations जोड़ सकता है
    • इसमें underline, wavy lines, circles, arrows, और छोटे notes शामिल हैं
    • हाई स्कूल छात्र की class notes जैसी natural handwriting style लागू करता है
  • texture expression और restoration

    • portrait में pores, बाल, skin texture जैसे सूक्ष्म तत्वों को दर्शाता है, और अन्य वस्तुओं की delicate texture भी व्यक्त कर सकता है
    • क्षतिग्रस्त या आंशिक रूप से गायब पारंपरिक paintings को मूल art style और brushstroke के अनुसार restore करता है
    • eagle battle painting में ink density, feather texture, और composition balance बनाए रखते हुए fungus stains और damage marks हटाता है और missing parts को पूरा करता है

भाषा, UI और world knowledge का उपयोग

  • 12 भाषाएँ, कई fonts, 100 से अधिक art styles, और विभिन्न UI interfaces को support करता है
  • Japanese, Korean, Spanish को सटीक render करने वाले उदाहरण शामिल हैं
  • web page, game, livestreaming जैसे कई प्रकार के यथार्थवादी UI screens जनरेट कर सकता है
  • knowledge-based infographic

    • वास्तविक insect photo के मुख्य subject को बनाए रखते हुए उसे research infographic में विस्तारित करता है
    • taxonomy information, morphological feature annotations, enlarged detail views, और scale bar शामिल करता है
    • परिणाम को academic publication में सीधे उपयोग योग्य research chart के रूप में व्यवस्थित करता है
  • latest information और IP उपयोग

    • मॉडल अपने पास मौजूद ज्ञान के अलावा इंटरनेट से जुड़कर ताज़ा जानकारी भी खोज सकता है
    • 21 जुलाई के Hangzhou मौसम को खोजकर weather forecast image जनरेट करता है
    • किसी specific IP character को खोजकर उसके आधार पर इमेज बना सकता है
    • Qi Baishi और Van Gogh के livestreaming room में Qwen-Image-3.0 को परिचित कराते हुए दृश्य जनरेट करता है

प्रोडक्टिविटी कार्यों तक विस्तार

  • तीन मुख्य क्षमताओं के आधार पर newspaper PDF, short drama storyboard, complex UI interface जैसे high-value कार्यों को support करता है
  • इसका लक्ष्य इमेज जनरेशन क्षमता को design, content creation, education, e-commerce जैसे और अधिक क्षेत्रों की productivity value से जोड़ना है

1 टिप्पणियां

 
GN⁺ 3 시간 전
Hacker News की राय
  • ऑनलाइन शॉपिंग में ऐसे मॉडल को आगे बढ़ाना अजीब लगता है। क्योंकि यह कपड़ों को शरीर पर अच्छी तरह फिट दिखाने के लिए एडजस्ट करता है और लाइटिंग भी आकर्षक बना देता है, इसलिए असल कपड़े पहनने पर कैसा महसूस होगा और फिट कैसा होगा, यह पहले की तरह ही जानना मुश्किल रहता है

    • अल्पकालिक लक्ष्य प्रोडक्ट बेचना है, लेकिन ज्यादा महत्वाकांक्षी दीर्घकालिक लक्ष्य विज्ञापन और वास्तविकता की सीमा को धुंधला करना है, ताकि खरीदारी के समय आम लोग ऐसे सवाल पूछने तक की सांस्कृतिक आदत न रखें
      50 साल बाद शायद ‘विज्ञापन की सत्यता’ खुद ही एक ऐसे आदर्श अतीत की तरह मानी जाए जिसे वापस नहीं पाया जा सकता
    • कुछ लोग शायद जनरेटिव AI से ज्यादा “इसे किसी सक्षम फोटोग्राफर द्वारा खींची तस्वीर जैसा बना दो” जैसी image-to-image transformation चाहते हों
      लेकिन जिस प्लेटफ़ॉर्म पर हर महीने 1,000 नए प्रोडक्ट चढ़ते हों, वहाँ वास्तविक और थोड़ी अपूर्ण तस्वीरें खरीद में बदलने के लिए भी ज्यादा फायदेमंद लगती हैं। खासकर जब सभी रंगों के वैरिएंट एक जैसे दिखने वाली 3D-स्टाइल इमेज बन जाएँ, तो उल्टा झिझक पैदा होती है
    • Facebook Marketplace पर पुराने फर्नीचर के विज्ञापनों में भी ऐसा ही है। ज्यादातर इमेज AI से Pottery Barn कैटलॉग जैसी सजाई जाती हैं, और आखिर में ही खरोंचों व नुकसान से भरी असली वस्तु की तस्वीर दिखती है, जो किसी बिखरे गैरेज में रखी होती है
    • पारंपरिक तरीके में परफेक्ट लाइटिंग के नीचे प्रोफेशनल फोटोग्राफर मॉडल को शर्ट पहना कर शूट करता है; उससे यह सचमुच कम विकृत होगा या नहीं, इस पर संदेह है
  • HTML के meta keywords में hentai, nudes आदि वयस्क सामग्री से जुड़े 100 से ज्यादा आइटम शामिल हैं, यह दिलचस्प है

    • ये keywords उस https://qwen.ai/usagepolicy जैसे पेज पर भी globally लागू हैं, जहाँ प्रोडक्ट को यौन सामग्री में इस्तेमाल न करने का अनुरोध किया गया है
      Console में document.querySelector('meta[name="keywords"]').content चलाएँ तो पूरा टैग देखा जा सकता है
    • लगता है किसी search engine optimization tool ने meta keywords अपने-आप जोड़ दिए। qwen वाले आम search terms इकट्ठा करते समय वयस्क संदर्भों में आने वाली gwen या ben जैसी typos भी शामिल हो गई होंगी
    • आजकल keywords meta tag की क्या कीमत है, समझ नहीं आता, और यह पेज में सिर्फ 77KB से ज्यादा बेकार डेटा जोड़ रहा है
    • Qwen टीम को भी पता होगा कि adult-content community, Civitai में दिखने की तरह, नए image generation models को तेजी से अपनाती है। यह उन search results में मॉडल को दिखाने की search engine optimization strategy लगती है, जिन्हें वे पहले से देखते हैं
  • लगता है इसे GPT Image 1 outputs पर train किया गया है, और इसकी खास पीली tint साफ दिखती है
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
    https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...

    • GPT Image 1 में भी दूसरे image generation models के outputs पर train किए बिना पीली tint आ गई थी। लोग नरम sunset light वाली तस्वीरें पसंद करते हैं और preference model इसे आसानी से पकड़ लेता है, इसलिए aesthetic appeal optimize करने पर, जब तक जानबूझकर दबाया न जाए, सभी images में हल्की tint आ जाती है
    • पीली और लाल tint training photos के स्रोत से अलग, बहुत आम समस्या है। फोटो से जुड़े startup में original images पर train करने पर भी tint आई, और इसे रोकना लगातार मुश्किल रहा
    • AI-generated images अब वेब का हिस्सा बन चुकी हैं, इसलिए सामान्य web scraping से generated images को training data से बचाना संभव नहीं है
  • प्रतिनिधि image के title में Arabic साफ तौर पर बिगड़ी हुई है, लेकिन असल model इस्तेमाल करते समय ऐसा नहीं है। हो सकता है representative image Qwen Image 3.0 से generate ही न की गई हो

    • यह नए model को परखने के लिए अच्छा benchmark है। Tamil और Arabic Quran verses से GPT Image 2 और Nano Banana Pro को test करने पर उन्होंने सही generate किया, संभवतः विशाल training data की वजह से
  • कहा गया कि “पूरे 3×3 grid को ठीक-ठीक describe करने में 3,700 tokens लगते हैं,” लेकिन prompt सार्वजनिक नहीं किया गया, इसलिए demo कम विश्वसनीय लगता है

  • weights कब और क्या जारी होंगे इस बारे में बिल्कुल कुछ नहीं है; सोच रहा हूँ क्या यह कहीं अलग से लिखा है

    • Qwen-Image-2.0 weights भी जारी नहीं हुए थे, इसलिए इस बार भी संभावना कम लगती है
    • Z-Image और पहले Qwen-Image के बाद लगता है ये पूरी तरह closed model की तरफ मुड़ गए हैं। जारी images देखकर Qwen-Image 3.0, gpt-image-2 या nb-pro जैसे proprietary models का बस एक कमजोर विकल्प लगता है
    • जारी भी कर दें तो Cursor, Azure, Amazon उसे monetize करेंगे, तो ऐसा करने की खास वजह नहीं है। जब तक OpenAI सच में open नहीं करता, संभावना कम है
  • मैंने 2 असली logos, पूरी design language specification और application screen captures की 3 images दीं, लेकिन सिर्फ 3 खराब images मिलीं, और उनमें से कोई भी दिए गए original logo जैसा नहीं था

  • chat.qwen.ai पर test करने पर composition और anatomical accuracy, दोनों Qwen Image 1 level तक भी नहीं पहुँचे। तीन पैरों या चमकती आँखों जैसे results आते हैं, और quality वापस लिए गए Microsoft Lens जैसी है

  • कॉलेज के दिनों में ऐसा model होता तो अच्छा होता। visual learner होने के नाते मैं लंबे text की तुलना में diagrams और explanatory illustrations से कुछ topics कहीं ज्यादा आसानी से समझ पाता

    • लेकिन generated diagrams सिर्फ नकल हैं। अगर परमाणु के components को ठीक से समझाने वाला poster माँगें, तो probability cloud से जुड़ी representation के बजाय लाल, नीली और ग्रे ping-pong balls को circular orbits में घूमते दिखा देगा, और किस्मत अच्छी हो तो electron shell diagram मिल जाएगा
      Nano Banana 2 से “undergraduate students के लिए atom के काम करने का तरीका समझाने वाला infographic poster” माँगकर देखा, तो middle-school science textbook जैसा Bohr model generate हुआ
    • मेरी पत्नी ने सभी recipes को ChatGPT image generation में डालकर magazine-style pages बना दिए, और नतीजा शानदार है। वह family cookbook बना रही है ताकि बच्चे जान सकें कि बचपन में उन्होंने कौन-से dishes खाए थे
  • images में अभी भी जगह-जगह पीला filter बचा हुआ है