- Qwen-Image सीरीज़ का तीसरी पीढ़ी का बेस इमेज जनरेशन मॉडल, जो सिर्फ़ देखने में अच्छे इमेज से आगे बढ़कर प्रोडक्टिविटी कार्यों में उपयोगी ‘Real(实)’ को मुख्य लक्ष्य बनाता है
- अधिकतम 4.5k token input प्रोसेस करके अख़बार, स्टोरीबोर्ड, परीक्षा-पत्र जैसे उच्च-जानकारी वाले लेआउट और कई concepts के parallel व nested इमेज एक साथ जनरेट करता है
- 10px आकार के अक्षर, LaTeX सूत्र, और handwritten annotations को पढ़े जा सकने लायक render करता है, और pores, बाल, skin, brushstroke जैसी सूक्ष्म textures भी पुन:निर्मित करता है
- 12 भाषाएँ, कई fonts, 100 से अधिक art styles, web·game·livestreaming UI को support करता है, और इंटरनेट से ताज़ा जानकारी खोजकर उसे इमेज में शामिल भी कर सकता है
- यह मॉडल newspaper PDF, short drama storyboard, complex UI सहित design·content creation·education·e-commerce में इमेज जनरेशन को deployable productivity tool तक विस्तारित करना चाहता है
‘Real’ की ओर तीसरी पीढ़ी का मॉडल
- Qwen-Image-3.0 Qwen-Image सीरीज़ का तीसरी पीढ़ी का बेस इमेज जनरेशन मॉडल है
- हर पीढ़ी की मुख्य दिशा इस प्रकार है
- Qwen-Image-1.0: Precision
- Qwen-Image-2.0: Precision, Variety, Completeness, Beauty, Authenticity
- Qwen-Image-3.0: Real(实)
- ‘Real’ तीन क्षमताओं से बना है
- समृद्ध कंटेंट: अधिकतम 4.5k token input और complex layout support
- यथार्थवादी डिटेल: 10px अक्षर और pores, बाल जैसे सूक्ष्म तत्वों का पुन:निर्माण
- गहरा ज्ञान: 12 भाषाएँ, विविध UI और world knowledge का उपयोग करके generation
- लक्ष्य इमेज जनरेशन को ‘usable’ से ‘practical’ और ‘देखने में अच्छा’ से वास्तव में उपयोगी बनाना है
समृद्ध कंटेंट और जटिल लेआउट
- गणित की स्लाइड में spatial relationships, mathematical symbols, theorem explanation और हर तत्व की relative position को साथ में render किया जा सकता है
- लगभग 3.7k token के निर्देश से कई इमेज जोड़ने के बजाय एक ही 3×3 grid को single pass में जनरेट करता है
- हर cell एक complex infographic से बना है, जिसमें Chinese·English वाक्य, सूत्र, chart, और comic character जुड़े होते हैं
- tunnel safety comic, spatial geometry class, 「Chu Shi Biao」 शैली विश्लेषण, parabolic motion, parasitology, दाएँ सीने के दर्द का medical diagram, Sylow theorem, bank internal control, और cell DNA structure comparison को एक ही इमेज में रखता है
- अधिकतम 4.5k token के निर्देश लेकर उच्च information density वाले visual layout को समझता और render करता है
-
क्षैतिज विस्तार
- इसका मतलब एक single canvas पर कई parallel elements रखने की क्षमता है
- semantic juxtaposition और spatial control का उपयोग करके कई concepts को एक-दूसरे में बाधा डाले बिना व्यवस्थित करता है
-
ऊर्ध्व गहराई
- यह अर्थ को विभाजित करके logically nested interfaces को चरण-दर-चरण व्यक्त करने की क्षमता है
- एक ही निर्देश से VSCode programming screen, Qwen Chat, WeChat, और hand-drip coffee poster के overlapping multi-screen structure को जनरेट करता है
- हर layer उस UI की शैली और detailed elements को बनाए रखती है
छोटे अक्षरों से पेंटिंग restoration तक
-
छोटे अक्षर और जटिल typesetting
- 10px आकार के छोटे अक्षर भी पढ़ने लायक render करता है
- whale shark knowledge infographic जैसे text और illustration से भरे क्षेत्रों को साथ में जनरेट कर सकता है
- algebraic geometry paper के एक पेज पर LaTeX सूत्र, superscript·subscript, Greek letters, theorem numbers, braces, fraction bars, और multi-line alignment को पुन:निर्मित करता है
- छोटे font में भी सूत्र और मुख्य text की readability बनाए रखता है
- यथार्थवादी paper texture और dense text को जोड़कर newspaper-format image जनरेट करता है
-
editing और handwriting
- किताब के पेज पर लाल रंग की handwritten annotations जोड़ सकता है
- इसमें underline, wavy lines, circles, arrows, और छोटे notes शामिल हैं
- हाई स्कूल छात्र की class notes जैसी natural handwriting style लागू करता है
-
texture expression और restoration
- portrait में pores, बाल, skin texture जैसे सूक्ष्म तत्वों को दर्शाता है, और अन्य वस्तुओं की delicate texture भी व्यक्त कर सकता है
- क्षतिग्रस्त या आंशिक रूप से गायब पारंपरिक paintings को मूल art style और brushstroke के अनुसार restore करता है
- eagle battle painting में ink density, feather texture, और composition balance बनाए रखते हुए fungus stains और damage marks हटाता है और missing parts को पूरा करता है
भाषा, UI और world knowledge का उपयोग
- 12 भाषाएँ, कई fonts, 100 से अधिक art styles, और विभिन्न UI interfaces को support करता है
- Japanese, Korean, Spanish को सटीक render करने वाले उदाहरण शामिल हैं
- web page, game, livestreaming जैसे कई प्रकार के यथार्थवादी UI screens जनरेट कर सकता है
-
knowledge-based infographic
- वास्तविक insect photo के मुख्य subject को बनाए रखते हुए उसे research infographic में विस्तारित करता है
- taxonomy information, morphological feature annotations, enlarged detail views, और scale bar शामिल करता है
- परिणाम को academic publication में सीधे उपयोग योग्य research chart के रूप में व्यवस्थित करता है
-
latest information और IP उपयोग
- मॉडल अपने पास मौजूद ज्ञान के अलावा इंटरनेट से जुड़कर ताज़ा जानकारी भी खोज सकता है
- 21 जुलाई के Hangzhou मौसम को खोजकर weather forecast image जनरेट करता है
- किसी specific IP character को खोजकर उसके आधार पर इमेज बना सकता है
- Qi Baishi और Van Gogh के livestreaming room में Qwen-Image-3.0 को परिचित कराते हुए दृश्य जनरेट करता है
प्रोडक्टिविटी कार्यों तक विस्तार
- तीन मुख्य क्षमताओं के आधार पर newspaper PDF, short drama storyboard, complex UI interface जैसे high-value कार्यों को support करता है
- इसका लक्ष्य इमेज जनरेशन क्षमता को design, content creation, education, e-commerce जैसे और अधिक क्षेत्रों की productivity value से जोड़ना है
1 टिप्पणियां
Hacker News की राय
ऑनलाइन शॉपिंग में ऐसे मॉडल को आगे बढ़ाना अजीब लगता है। क्योंकि यह कपड़ों को शरीर पर अच्छी तरह फिट दिखाने के लिए एडजस्ट करता है और लाइटिंग भी आकर्षक बना देता है, इसलिए असल कपड़े पहनने पर कैसा महसूस होगा और फिट कैसा होगा, यह पहले की तरह ही जानना मुश्किल रहता है
50 साल बाद शायद ‘विज्ञापन की सत्यता’ खुद ही एक ऐसे आदर्श अतीत की तरह मानी जाए जिसे वापस नहीं पाया जा सकता
लेकिन जिस प्लेटफ़ॉर्म पर हर महीने 1,000 नए प्रोडक्ट चढ़ते हों, वहाँ वास्तविक और थोड़ी अपूर्ण तस्वीरें खरीद में बदलने के लिए भी ज्यादा फायदेमंद लगती हैं। खासकर जब सभी रंगों के वैरिएंट एक जैसे दिखने वाली 3D-स्टाइल इमेज बन जाएँ, तो उल्टा झिझक पैदा होती है
HTML के meta keywords में hentai, nudes आदि वयस्क सामग्री से जुड़े 100 से ज्यादा आइटम शामिल हैं, यह दिलचस्प है
Console में
document.querySelector('meta[name="keywords"]').contentचलाएँ तो पूरा टैग देखा जा सकता हैqwenवाले आम search terms इकट्ठा करते समय वयस्क संदर्भों में आने वालीgwenयाbenजैसी typos भी शामिल हो गई होंगीkeywordsmeta tag की क्या कीमत है, समझ नहीं आता, और यह पेज में सिर्फ 77KB से ज्यादा बेकार डेटा जोड़ रहा हैलगता है इसे GPT Image 1 outputs पर train किया गया है, और इसकी खास पीली tint साफ दिखती है
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
https://qianwen-res.oss-accelerate.aliyuncs.com/Qwen-Image/i...
प्रतिनिधि image के title में Arabic साफ तौर पर बिगड़ी हुई है, लेकिन असल model इस्तेमाल करते समय ऐसा नहीं है। हो सकता है representative image Qwen Image 3.0 से generate ही न की गई हो
कहा गया कि “पूरे 3×3 grid को ठीक-ठीक describe करने में 3,700 tokens लगते हैं,” लेकिन prompt सार्वजनिक नहीं किया गया, इसलिए demo कम विश्वसनीय लगता है
weights कब और क्या जारी होंगे इस बारे में बिल्कुल कुछ नहीं है; सोच रहा हूँ क्या यह कहीं अलग से लिखा है
मैंने 2 असली logos, पूरी design language specification और application screen captures की 3 images दीं, लेकिन सिर्फ 3 खराब images मिलीं, और उनमें से कोई भी दिए गए original logo जैसा नहीं था
chat.qwen.ai पर test करने पर composition और anatomical accuracy, दोनों Qwen Image 1 level तक भी नहीं पहुँचे। तीन पैरों या चमकती आँखों जैसे results आते हैं, और quality वापस लिए गए Microsoft Lens जैसी है
कॉलेज के दिनों में ऐसा model होता तो अच्छा होता। visual learner होने के नाते मैं लंबे text की तुलना में diagrams और explanatory illustrations से कुछ topics कहीं ज्यादा आसानी से समझ पाता
Nano Banana 2 से “undergraduate students के लिए atom के काम करने का तरीका समझाने वाला infographic poster” माँगकर देखा, तो middle-school science textbook जैसा Bohr model generate हुआ
images में अभी भी जगह-जगह पीला filter बचा हुआ है