1 पॉइंट द्वारा GN⁺ 3 시간 전 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • यह multimodal foundation model है, जो image, video और audio को एक ही architecture में साथ train करके generation, understanding और action prediction को एकीकृत करने की कोशिश करता है; FLUX 3 Video से Early Access के रूप में उपलब्ध है
  • यह image की spatial structure, video की temporal और physical dynamics, तथा audio की events और sounds से जुड़ी relationships को mutual constraints के रूप में सीखता है, और Self-Flow के आधार पर data व compute resources को scale करता है
  • यह native audio के साथ एक बार में अधिकतम 20 सेकंड तक के video generate करता है, और शुरुआती evaluation में Grok Imagine Video की तुलना में अधिकतम 69%, Runway Gen-4.5 से 77%, और Luma Ray 3.2 से 93% comparisons में prefer किया गया
  • image synthesis/editing और multilingual text rendering को support करता है, और pre-trained video backbone को सीमित task-specific data पर fine-tune करके robot action model के रूप में इस्तेमाल किया जा सकता है
  • Video, Image, Action और open weights आधारित FLUX 3 Dev को क्रमिक रूप से release किया जाएगा; long-term लक्ष्य perception, action और language prediction को एक ही model में integrate करना है

वास्तविकता को साथ सीखने वाला multimodal model

  • FLUX 3 image, video और audio को अलग-अलग elements नहीं, बल्कि एक ही reality को अलग-अलग sensors से observe करने के परिणाम के रूप में treat करता है
    • image किसी खास moment की spatial structure और relationships capture करती है
    • video time dimension को restore करके motion, temporal dynamics और physical laws दिखाता है
    • audio mechanical phenomena और sound की causal relationships दिखाता है, जिन्हें सिर्फ visuals से detect करना मुश्किल होता है
    • language इन perceptions को goals, abstraction और instructions से जोड़ती है
  • कई modalities को साथ train करने पर mutual constraints का उपयोग किया जा सकता है: sound को collision से match होना चाहिए, motion को mass follow करना चाहिए, और future को past से continue होना चाहिए
  • FLUX 3 केवल इन्हीं principles पर बनाया गया पहला model है, जिसका लक्ष्य physical और digital environments में perceive, predict और act करने वाली real-world visual intelligence है
  • content creation और physical AI से मिले शुरुआती results इस approach की संभावना दिखाते हैं

Self-Flow आधारित integrated architecture

  • Self-Flow एक ऐसा approach है जो एक ही foundation architecture में multimodal generation और understanding को efficiently align करता है
  • FLUX 3, Self-Flow के आधार पर compute और data resources को काफी scale करके video, image और audio को simultaneously train करता है
  • public comparison में modality-specific generation errors को Flow Matching baseline 100 पर normalize किए गए Fréchet distance, और fine-tuning के बाद 4 task groups में manipulation success rate का उपयोग किया गया

video और native audio generation

  • FLUX 3 एक generation में अधिकतम 20 सेकंड लंबे तरह-तरह के video और audio बना सकता है
  • supported scope इस प्रकार है
    • text-to-video generation
    • starting frame को continue करना या image को visual reference के रूप में उपयोग करने वाला image-to-video generation
    • original character जैसे key elements को नए scene या context में ले जाने वाला video-to-video generation
    • input video और audio को आगे बढ़ाकर बनाने वाला generative video/audio continuation
    • specified scenes के बीच transition control करने वाला keyframe-to-video generation
    • multilingual conversation
    • traditional film formats से आगे जाने वाली diverse visual styles और aspect ratios
    • individual clips को लंबे multi-shot sequences में जोड़ने वाली agentic chaining
    • camcorder footage से लेकर animation और cinematic footage तक wide range styles
    • typography generation और animation design
  • सभी video outputs में native audio generation शामिल है

शुरुआती video evaluation

  • preliminary evaluation audio वाले 720p 10-second text-to-video clips पर किया गया
  • comparison evaluation में FLUX 3 को prefer किए जाने की दर इस प्रकार रही
    • Grok Imagine Video की तुलना में अधिकतम 69%
    • Kling v3 Pro की तुलना में 60%
    • Happy Horse v1 की तुलना में 59%, Happy Horse 1.1 की तुलना में 57%
    • Seedance 2.0 और Gemini Omni Flash की तुलना में क्रमशः 52%
    • Runway Gen-4.5 की तुलना में 77%
    • Luma Ray 3.2 की तुलना में 93%
  • model और आसपास का harness अभी development में है, इसलिए results preliminary हैं और Early Access period में और improve होने की उम्मीद है
  • फिलहाल जिन areas में यह खास तौर पर मजबूत है वे हैं human facial expressions capture करना, physical events और sounds को जोड़ना, तथा multilingual processing
  • visual reference के साथ पूरे scene में character consistency maintain रखते हुए कई clips को combine करके कई मिनट लंबा sequence बनाया जा सकता है
  • FLUX 3 Video Early Access के रूप में उपलब्ध है

image synthesis और editing

  • FLUX 3 अलग-अलग styles, aspect ratios और resolutions में images को synthesize और edit कर सकता है
  • mid-training stage की preliminary evaluation में पिछले FLUX versions की तुलना में complex prompts handle करने और text generation की capability में काफी improvement दिखा
  • यह diverse output styles generate कर सकता है और कई languages के text को high accuracy के साथ render कर सकता है
  • evaluation results अभी preliminary हैं, और official release से पहले additional improvements किए जाएंगे
  • FLUX 3 Image Early Access अगले कुछ हफ्तों में शुरू करने की योजना है

action prediction और robot learning

  • reality understanding को action prediction तक extend करने के लिए दो paths use किए जाते हैं
    • Self-Flow के शुरुआती work को extend करके FLUX 3 में native action prediction integrate करना
    • pre-trained video backbone को dynamics समझने का foundation बनाकर, सीमित task-specific data पर specialized action models को fine-tune करना
  • early access partner mimic robotics के साथ FLUX-mimic develop किया गया

capability-wise sequential rollout

  • हर capability को smooth release, feedback collection और strict safety testing के लिए Early Access से गुजरते हुए अगले कुछ हफ्तों से महीनों में उपलब्ध कराया जाएगा
  • सभी same multimodal Flow Matching आधारित model से derived हैं
    • FLUX 3 Video: API और closed-weight access के जरिए video/audio generation और editing
    • FLUX-mimic·FLUX 3 Action: mimic robotics से शुरू करके selected research और commercial partners को action prediction उपलब्ध कराना
    • FLUX 3 Image: API और closed-weight access के जरिए image synthesis और editing
    • FLUX 3 Dev: video, audio और image content generation तथा action prediction के लिए multimodal backbone के open weights उपलब्ध कराना
  • foundation approach की additional technical details भी जारी की जाएंगी, और Early Access के लिए apply किया जा सकता है

perception, action और language का integration

  • future application targets में interactive image/video editing, simulation, computer use और physical AI को रखा गया है
  • मौजूदा capabilities को gradually release करने के साथ-साथ next-generation models का development भी चल रहा है
  • ultimate goal perception, action और language prediction को एक unified model में combine करना है

1 टिप्पणियां

 
GN⁺ 3 시간 전
Hacker News की राय
  • उम्मीद है कि open weights वर्ज़न सर्वश्रेष्ठ प्रदर्शन (SOTA) वाला होगा
    कहा गया है कि आने वाले कुछ हफ्तों से कुछ महीनों के भीतर कंटेंट निर्माण और व्यवहार पूर्वानुमान के लिए multimodal foundation model FLUX 3 Dev को open weights के साथ उपलब्ध कराया जाएगा, और foundation approach के तकनीकी विवरण भी साझा किए जाएंगे

    • open weights का वादा स्वागतयोग्य है, लेकिन ऐसी बातें पहले भी कही गई थीं जो पूरी नहीं हुईं
      अगर foundation model Dev वर्ज़न के रूप में आता है, तो उसमें क्या हटाया गया है यह सिर्फ पोस्ट देखकर समझना मुश्किल है
  • इंसानों को दिखाने वाले उदाहरण लगभग नहीं हैं, world model शब्द का बहुत हल्के में इस्तेमाल किया गया है, और 20 सेकंड के वीडियो का दावा करके असल में सिर्फ jump cuts दिखाए गए हैं
    कुल मिलाकर मुख्य बात बस यही लगती है कि सब कुछ “जल्द आएगा”

    • /r/stablediffusion पर वीडियो उदाहरण काफी डाले गए हैं
    • model-based reinforcement learning में इस्तेमाल होने वाला world model शब्द अब शायद linear regression जैसी साधारण चीज़ों के लिए भी इस्तेमाल किया जा सकता है
      हो सकता है reinforcement learning क्षेत्र ने भी यह शब्द behavior science से उधार लिया हो, इसलिए शायद इसे बस स्वीकार कर लेना बेहतर हो। यह कुछ वैसा ही है जैसे दार्शनिकों और visual artists ने object-oriented का अलग-अलग तरह से दुरुपयोग किया हो
    • रिलीज़ का तरीका इतना अजीब था कि समझ नहीं आया वीडियो आखिर कहाँ देखना चाहिए
  • यहाँ की प्रतिक्रिया हैरान कर देने वाली तरह से नकारात्मक और व्यंग्यपूर्ण है, लेकिन मुझे इस मॉडल का प्रदर्शन काफी प्रभावशाली लग रहा है
    यह भी कहा जाता है कि सबसे नकारात्मक लोग हमेशा सबसे पहले बुरा बोलते हैं, इसलिए मैं थोड़ा और देखना चाहूँगा

    • HN की भावना का time series analysis करना दिलचस्प होगा
      मुझे लगता है कि आजकल HN पर नकारात्मक माहौल बढ़ गया है, हालांकि उम्मीद है कि यह सिर्फ मेरा भ्रम हो
    • यह सच में अच्छा मॉडल हो सकता है, लेकिन Qwen-Image-3 ने LaTeX में render की हुई लगने वाली इमेजें और कई तत्वों को साथ-साथ या depth के साथ व्यवस्थित करने की क्षमता दिखाई है, इसलिए यह साफ नहीं कि सिर्फ visual quality पर ध्यान देना पूरी तरह सही दिशा है या नहीं
    • मैं नवीनतम high-performance LLMs का coding और automation tools बनाने में सक्रिय रूप से उपयोग कर रहा हूँ, और अलग-अलग open source चीज़ों को जोड़कर नए प्रोजेक्ट बनवाने जैसे कठिन काम उन्हें दे रहा हूँ
      अगर सही execution environment मौजूद हो और आप इस क्षेत्र को इतना समझते हों कि मॉडल गलत reasoning में फँस गया है या हल्के से गलत नतीजे दे रहा है, यह पहचान सकें, तो मैं काफी आशावादी हूँ। दूसरी ओर, जब social media भयानक AI-generated images और videos से भरा दिखता है, तो पूरी तरह synthetic image/video generators के वास्तविक दुनिया में उपयोगी होने की संभावना को लेकर मैं कहीं अधिक निराशावादी हूँ। लगता है कि जब यह लाखों लोगों के हाथ में पहुँचता है, तो इसका उपयोग समाज के हित से ज़्यादा नुकसान के लिए होता है
    • Star Trek के holodeck से तुलना करें तो यह इतना भी दिलचस्प नहीं है
    • अब Martin Scorsese सलाहकार के रूप में जुड़े हैं, इसलिए लगता है BFL खुद को फिल्म निर्माताओं के लिए एक research lab के रूप में स्थापित करता रहेगा
      अगर यह वीडियो मॉडल Seedance 2.0 के समान स्तर का है, तो इसकी लागत इतनी अधिक होगी कि यह low-quality content generation के लिए उपयुक्त नहीं होगा, और अधिक संभावना है कि यह किसी प्रोजेक्ट की VFX pipeline में जाए
  • सोच रहा हूँ कि क्या कहीं मॉडल को tactile data भी सिखाया जा रहा है
    रोबोट से मैं सबसे ज़्यादा यही चाहता हूँ कि वह वस्तुओं को छुए, लेकिन उन्हें सिर्फ audio, video और images दिए जा रहे हैं, इसलिए मॉडल को बिना कभी छुए यह सीखना पड़ता है कि संपर्क कैसे किया जाए। शायद यही वजह है कि रोबोट वस्तुओं को छूते समय हिचकिचाते हुए लगते हैं

    • असली tactile data देने से ज़्यादा तेज़ contact को simulate करना है, और ऐसा करने पर सीखना भी कहीं तेज़ होता है
  • Flux 2 Dev Klein वास्तव में सामान्य commercial hardware पर चल सकने वाले मॉडलों में लगभग सर्वश्रेष्ठ था
    उम्मीद है Flux 3 में भी इसके बराबर का नया open weights मॉडल शामिल होगा, नहीं तो कई hobby users के लिए यह बड़ा नुकसान होगा

  • यूरोप से निकले AI प्रोजेक्ट्स में यह पहला है जिससे मुझे बहुत उम्मीद बंधी है

  • कहा जा रहा है कि Freiburg im Breisgau में hiring हो रही है, तो जिज्ञासा है कि क्या वहाँ स्थानीय स्तर पर अच्छा talent मिल जाता है

    • Freiburg बहुत खूबसूरत जगह है
      वहाँ रहने वाला मेरा एक दोस्त आसपास के पहाड़ों में road cycling करता है, और दूसरा दोस्त सर्दियों में lunch break के दौरान cross-country skiing करता है
    • मैं पास में रहता हूँ, और यह जर्मनी के सबसे धूपदार इलाकों में से एक है, नज़ारे भी शानदार हैं
      talent pool के बारे में पक्का नहीं कह सकता, लेकिन वहाँ एक विश्वविद्यालय है
    • University of Freiburg काफी प्रसिद्ध है
      SF के बाहर startups का university town में hiring करना एक आम तरीका है
    • लोग उसे Flyburg im Nicegau यूँ ही नहीं कहते
    • आजकल अमेरिका में न होना कई संभावित applicants के लिए उल्टा फायदा हो सकता है
  • पानी में डूबे कमरे में नाचने वाला दृश्य आने तक मुझे लगा यह live-action video है

  • 2.3 version शानदार था, और जिन लोगों को early access मिला था उनके साझा किए गए वीडियो और reviews देखकर मैं बहुत उत्साहित हूँ कि यह मॉडल घरेलू उपयोग के लिए नया सर्वोच्च प्रदर्शन बन सकता है

  • अगर मॉडल को दुनिया और घटनाओं की आवाज़ें व्यक्त करना सीखना है, तो मज़े के लिए training process में बेहिसाब Wilhelm scream भी डाल देना चाहिए

    • अगर rubber seal को बहुत ज़्यादा रगड़कर लगाया जाए तो वह भी चीख सकती है, इसलिए उसे सावधानी से संभालना होगा