1 पॉइंट द्वारा GN⁺ 3 시간 전 | 1 टिप्पणियां | WhatsApp पर शेयर करें

1 टिप्पणियां

 
GN⁺ 3 시간 전
Hacker News की राय
  • अगर कोई बड़ी कंपनी inference पर हर महीने लाखों डॉलर खर्च करती है, तो करीब 6 मिलियन डॉलर का GB300 rack सीधे खरीदना समझ में आ सकता है
    20.7TB memory में पूरा MXFP4 model लोड करने के लिए 10% से भी कम चाहिए, और कुल HBM bandwidth 576TB/s है, इसलिए औसतन 100k-token context वाले agent jobs के 6,000 से ज्यादा instance करीब 30 tokens/s पर parallel चला सकते हैं
    सालाना depreciation और बिजली खर्च 1.5 मिलियन डॉलर, और औसत utilization 50% मानें, तो output के 1 मिलियन tokens पर लागत 0.6 डॉलर से कम बैठती है; data भी कंपनी के भीतर रहता है और hosting services से 10 गुना से ज्यादा सस्ता पड़ता है
    open-weight models आगे भी बेहतर होते रहेंगे और AI टिकेगा—ऐसा मानने वाली कंपनियों के लिए rack सीधे खरीदने का ठोस आधार पहली बार बना है

    • 107k डॉलर के server पर Kimi 2.8 चलाकर ज्यादातर कामों में लगभग 50k tokens/sec से ज्यादा process कर रहे हैं
      पिछले साल Claude और Gemini पर token खर्च में जितना दिया था, उससे ज्यादा बचत पहले ही हो चुकी है
    • operations संभालने के लिए 2–3 DevOps लोगों को hire करें तो 400k–700k डॉलर और जुड़ेंगे, और outages व maintenance की पूरी जिम्मेदारी भी कंपनी पर होगी
      फिर भी, जो data private रहना चाहिए, उसके लिए hosted LLMs पर भरोसा नहीं है
    • liquid cooling और ultra-high-density power infrastructure वाली जगह भी चाहिए, इसलिए सामान्य colocation facility या in-house server room से इसे संभालना मुश्किल है
    • जो कंपनी 6 मिलियन डॉलर का rack और infrastructure खरीद सकती है, उसे लागू होने वाली commercial license terms भी ध्यान में रखनी होंगी, इसलिए calculation सीधी नहीं है
  • model के साथ कई open source infrastructure भी जारी किए गए हैं
    https://github.com/MoonshotAI/MoonEP
    https://github.com/kvcache-ai/AgentEnv
    https://github.com/MoonshotAI/FlashKDA
    open source और weight models को AI की प्रगति धीमी करने वाली चीज मानना समझना मुश्किल है

    • उल्टा, मैंने इसे प्रगति धीमी करने वाली चीज माना था
      वजह यह है कि दूसरे labs frontier lab के model को distill करके catch up कर सकते हैं, और उस lab की अगली generation में reinvest होने वाली कमाई का कुछ हिस्सा छीन लेते हैं
      अगर पूरी acceleration चाहिए, तो मुझे लगता था कि दो बड़े labs का nationalization करके recursive self-improvement (RSI) तक पहुंचने तक Manhattan Project की तरह बंद रखना चाहिए, लेकिन reply में आए counterarguments देखकर मेरा नजरिया काफी बदल गया
  • Kimi-K3 license https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE पर देखा जा सकता है
    लगातार 12 महीनों में affiliates के combined revenue 20 मिलियन डॉलर से ज्यादा वाले Model as a Service providers को commercial use से पहले Moonshot AI के साथ अलग agreement करना होगा
    मौजूदा terms में यह clause भी है कि अगर monthly active users 100 मिलियन से ज्यादा हों या commercial product revenue 20 मिलियन डॉलर से ज्यादा हो, तो Kimi नाम दिखाना होगा

    • Kimi 2.6 ने भी इसी तरह का license इस्तेमाल किया था और https://huggingface.co/moonshotai/Kimi-K2.6/blob/main/LICENS... यह K2 तक पीछे जाता दिखता है
      2025 में जारी models साफ MIT license वाले थे, लेकिन जनवरी 2026 में moonshotai/Kimi-K2-Thinking से modified MIT license इस्तेमाल शुरू हुआ
    • शुरुआत में ही सवाल है कि यह license आखिर किस पर लागू होता है
      model weights पर copyright बनता भी है या नहीं, यह साफ नहीं है
    • अमेरिका में यह व्याख्या संभव है कि machine learning models के weights stochastic gradient descent, expectation maximization, genetic algorithms जैसी automatic optimization processes के products हैं, इसलिए copyrightable नहीं हैं
      अदालत में यह अभी पूरी तरह test नहीं हुआ है और litigation cost भी बड़ी है, इसलिए employers आमतौर पर safe side पर रहते हुए license comply करना चाहेंगे
      Thaler v. Perlmutter ने पुष्टि की कि copyright के लिए human author जरूरी है, और US Copyright Office की guidance भी साफ कहती है कि human creative intervention के बिना machine द्वारा automatically generated works register नहीं किए जा सकते
      आगे की provisions mathematical principles, formulas, algorithms और equations को भी copyright से बाहर रखती हैं, इसलिए अगर model को algorithm माना जाए तो conclusion अपेक्षाकृत साफ है
      [1] https://media.cadc.uscourts.gov/opinions/docs/2025/03/23-523...
      [2] https://www.copyright.gov/comp3/chap300/ch300-copyrightable-...
    • download कर पाना बेहतर है, लेकिन इन terms के साथ इसे सच में open weights या open source कहना मुश्किल है, यह अफसोसजनक है
    • license violators को कैसे ढूंढकर lawsuit target बनाया जाएगा, यह भी सवाल है
  • agents द्वारा knowledge-intensive fields और coding domains को web scale पर explore करते हुए लगातार expand होने वाले self-evolving hierarchical knowledge graph वाला approach दिलचस्प है

  • activation function का फिर से tanh पर लौटना देखकर लगता है कि technology trends cyclic होते हैं

    • paper के page 6 के मुताबिक वे tanh को सीधे इस्तेमाल नहीं करते, बल्कि f_gate(b,x) = b * tanh(x / b) * sigmoid(x) और f_up(b,x) = b * tanh(x / b) इस्तेमाल करते हैं
      graph में यह design ऐसा लगता है जैसे x लगभग 5 से बड़ा होने पर बेहतर expressiveness देने वाले GLU के फायदे और 0 से ठीक पहले value उछलने वाले SwiGLU के फायदे दोनों पाने की कोशिश हो
  • knowledge graph-based task synthesis लंबे समय से चले आ रहे इस सवाल के लिए अच्छा fit है कि अलग-अलग tasks को बिना छूटे कैसे cover किया जाए
    यह नई knowledge बनने की speed और human व machine generation methods पर theoretical research की ओर भी ले जा सकता है

  • अपने एजेंट कार्यों के हिसाब से fine-tune करने के लिए फिलहाल LoRA+DPO, GRPO में से कौन बेहतर है, यह जानना चाहता/चाहती हूँ

    • पहले LoRA+SFT उपयुक्त है, लेकिन मॉडल बड़ा है इसलिए लागत का बोझ काफी होगा
      बेहतर होगा कि provider की fine-tuning API का इंतज़ार किया जाए; शुरुआत से ही reinforcement learning या DPO जैसी off-policy-जैसी reinforcement learning की ओर जाने की ज़रूरत नहीं लगती
  • multi-teacher on-policy distillation में teacher model क्या है, यह जानना चाहता/चाहती हूँ
    गणित और coding जैसे verify किए जा सकने वाले क्षेत्रों को समझा जा सकता है, लेकिन biology तक शामिल है, यह देखकर सवाल है कि क्या यह किसी और बड़े model से distillation वाली संरचना है

    • https://thinkingmachines.ai/blog/on-policy-distillation/ का हवाला दिया गया है
      मेरी समझ में यह ऐसी distillation पद्धति है जिसमें teacher model, समस्या हल कर रहे student model के हर token को प्रत्येक step की generation probability से score करता है, और इसे reward या loss के रूप में लागू कर reinforcement learning कराता है
      multi-teacher का मतलब कई models से distillation लगता है, और इसमें state-of-the-art closed models भी शामिल हो सकते हैं
      हालांकि log probability चाहिए होती है; OpenAI API इसकी अनुमति देता है जबकि Anthropic इसे उपलब्ध नहीं कराता, इसलिए संभव है कि बाहर से estimate करने का कोई तरीका हो
      यह तरीका biology सहित teacher को ज्ञात किसी भी क्षेत्र पर लागू किया जा सकता है
    • teacher से आशय दूसरे models से है
  • कई providers की inference pricing सभी समान क्यों है, क्या यह Moonshot के साथ licensing agreement के कारण है, यह जानना चाहता/चाहती हूँ

  • Kimi से मुकाबला करने वाला अमेरिकी open model बनाने के लिए क्या चाहिए, यह जानना चाहता/चाहती हूँ

    • अमेरिकी बड़े labs का हाल का बड़े पैमाने वाला public model शायद करीब एक साल पहले, 2025 की गर्मियों का GPT-OSS-120b ही आखिरी था
      स्वेच्छा से ऐसा होना मुश्किल लगता है, इसलिए किसी न किसी रूप में public release के लिए दबाव बनाना पड़ेगा
      हाल में उम्मीद थी कि Gemma कम से कम 100B-class में आएगा, लेकिन लगता है Google उस scale के models को केवल internal रूप से रखता है
    • MSL या SpaceXAI के अगले बड़े models में से किसी एक को open source के रूप में जारी करने की संभावना अधिक लगती है
      दोनों open source के प्रति अनुकूल हैं और अमेरिका के Kimi जैसी जगह के लिए प्रतिस्पर्धा करेंगे
    • अगर यह आम धारणा सच है कि चीन केवल model को distill करके 2 हफ्तों में clone बना लेता है, तो अमेरिका को भी 2 हफ्तों के भीतर clone model जारी कर देना चाहिए
    • Inkling भी मोटे तौर पर प्रतिस्पर्धी दायरे में है