1 टिप्पणियां

 
GN⁺ 2024-12-02
Hacker News की रायें
  • AlphaChip पर लिखे लेख(https://vighneshiyer.com/misc/ml-for-placement/) के बिल्कुल अंत में Google के जवाब और पूरे AlphaChip algorithm को कवर करने वाला एक appendix जोड़ा गया है
    संक्षेप में, मुझे लगता है कि Nature लेखकों ने ISPD लेखकों की training methodology पर कुछ वैध आलोचनाएं की हैं। लेकिन AlphaChip अब भी commercial automatic floorplanner और AutoDMP की तुलना में computational cost और runtime के लिहाज से बहुत भारी है, इसलिए उसकी competitiveness कम है। फिर भी ISPD लेखकों को Nature लेखकों की सभी आलोचनाओं को address करने वाली ज्यादा rigorous study प्रकाशित करनी चाहिए, और Google द्वारा जारी pre-trained checkpoint का केवल evaluation भी इस बहस के लिए उपयोगी material होगा

    • लेख के निष्कर्ष में कहा गया था, “हम मानते हैं कि ISPD लेखक कुछ चीजें बेहतर कर सकते थे, लेकिन निष्कर्ष अब भी valid है। Nature लेखक इस तथ्य को address नहीं करते कि CMP और AutoDMP, CT की तुलना में काफी कम runtime और compute requirements के साथ बेहतर performance देते हैं।” लेकिन rebuttal के मुख्य बिंदुओं में से एक यह है कि comparison में इस्तेमाल किए गए resources बहुत छोटे थे
      सिर्फ यही एक वजह ISPD study के निष्कर्ष की validity पर संदेह करने के लिए काफी लगती है—आप इसे कैसे देखते हैं? साथ ही यह comment neutral है, जबकि लेख में AlphaChip लेखकों के लिए “arrogance”, “disdain”, “hyperbole”, “belittling”, “hostile” जैसे शब्द इस्तेमाल किए गए थे और Synopsys के vice president के लिए “excellent” कहा गया था—tone में यह अंतर कहां से आया, यह भी जानना चाहूंगा
    • inference के लिए करीब 6 घंटे तक 16 GPUs और pre-training के लिए 48 घंटे इस्तेमाल करना excessive compute नहीं है
      cloud में GPUs करीब 1–2 डॉलर प्रति घंटे मिलते हैं, इसलिए inference लगभग 100–200 डॉलर और pre-training लगभग 800–1600 डॉलर पड़ेगा, और pre-training cost कई chips पर amortize हो जाती है। cloud pricing upper bound के करीब है, और अधिकांश computer science labs के पास इससे काफी ज्यादा on-premises resources होते हैं। industry में ये costs chip design process की बाकी लागतों की तुलना में पूरी तरह छोटी हैं, और commercial EDA software licenses की cost ही कई million dollars के स्तर की होती है
  • इस समय Jeff Dean को कम-से-कम initial trust न देने की कोई वजह है क्या, ऐसा लगता है। उनका track record किसी से compare करना मुश्किल है और वे अब भी सक्रिय हैं। क्या ऐसा कुछ हुआ है जिससे उन पर shadow पड़े? कभी-कभी messenger खुद ही weight लेकर आता है

    • यहां वे गलत लोगों के साथ खड़े दिखते हैं। वे मूल रूप से systems builder हैं, chip design या EDA expert नहीं, और strictly speaking machine learning researcher भी नहीं
      कुछ लोग मानेंगे कि वे किसी charismatic young fraudster के चक्कर में फंस गए और अब इतनी गहराई तक आ चुके हैं कि पीछे हटना मुश्किल है। इस project पर focus करना Google के भीतर उनकी standing के लिए भी मददगार नहीं रहा; पिछले साल अहम चीजें सब Demis के पास चली गईं और उनके पास लगभग honorary title ही रह गया। उनकी उपलब्धियों को देखते हुए यह काफी दुखद है
    • जब Jeff Dean 2020, 2021, 2022 में talks दे रहे थे, तब ऐसा trust समझ में आता था। लेकिन अब वे EDA community की skepticism का जवाब non-academic personal attacks और “many companies” द्वारा इस्तेमाल किए जाने के vague mentions से दे रहे हैं
      अब मामला good faith मानकर चलने के चरण से आगे निकलकर काफी suspicion justified होने वाले zone में आ गया है, ऐसा लगता है
  • मुझे हैरानी है कि इस विवाद में इतनी भावना और नाराजगी क्यों है। benchmarks या significance जैसे boring academic dispute कैसे personal attack fight में बदल गया?

    • AI के बजाय implementation तरीके से काम करने वाले लोग बहुत हैं
    • reproduce करने का कोई तरीका दिए बिना बड़े दावे करो, और media के पास भागो तो media कुछ भी उठा लेती है
      “AI, AI को design कर रही है… नहीं, chip design कर रही है” जैसी बात humanities background वाले लोगों को futuristic लगती है, और शायद उन programmers को भी ऐसी ही लगती है जिन्हें हर “AI” पर शक करना चाहिए। Nature में publish करने से शुरू होकर पूरा publication process dishonest दिखता है। ISCCC जैसी जगह क्यों नहीं थी?
    • वजह पैसा है
    • अगर यह स्तर आपको offensive लगता है, तो Twitter पर Jeff Dean पर हमला करने की कोशिश कर रहे environmental activists को देखना चाहिए
    • समस्या यह है कि AI के इर्द-गिर्द Big Tech के commercial incentives ने “boring academia” के पानी को दूषित कर दिया है, जिससे journal papers या arXiv preprints के रूप में disguised dishonest information advertising बन गई है[1]
      नतीजतन modern AI research social sciences से भी कहीं ज्यादा गंभीर reproducibility crisis से गुजर रही है, जबकि उसके पास legitimate excuses काफी कम हैं। अगर Google झूठ नहीं बोल रहा, तो independent लोगों के देखने के लिए benchmark data publish भर कर दे, तो controversy काफी कम हो जाएगी, लेकिन वह अब भी इनकार कर रहा है: https://cacm.acm.org/news/updates-spark-uproar/ Google शायद मानता है कि उसके conclusions को बस authority के आधार पर accept कर लिया जाए। साथ ही, Google ने 2022 में जिस whistleblower Satrajit Chatterjee को fired किया था, उनके leaked paper में कहा गया था कि RePlAce की “30–35%” बढ़त, Google द्वारा उस समय chip design AI approach के बारे में किए गए “superhuman” दावों को refute करने वाले results से consistent थी। Jeff Dean पर “personal attacks” पूरी तरह उचित हैं, क्योंकि criticism का core यही है कि उनका character dishonest और authoritarian है। वे questionable research publish करते हैं और असहमति रखने वाले लोगों को fire करते हैं
      [1] Jeff Dean द्वारा critical paper को conference paper होने के कारण ridicule करना खास तौर पर disgusting है। यकीन न हो इतना खराब attitude है
  • Jeff Dean के ट्वीट के मुताबिक, Cheng आदि ने Google शोधकर्ताओं के काम को reproduce करने के लिए ज़रूरी प्रक्रिया का पालन नहीं किया
    खास तौर पर, उनका कहना था कि “लेखकों ने pre-training बिल्कुल नहीं की, जबकि Nature पेपर में pre-training का 37 बार ज़िक्र है; इसलिए learning-based method से दूसरे chip designs से सीखने की क्षमता छिन गई।” लेकिन Google के Circuit Training repository[1] में साफ लिखा है कि “scratch से train किए गए नतीजे, pre-trained model को fine-tune करने वाले paper के नतीजों जैसे या उनसे बेहतर हैं।” हो सकता है मैं कुछ गलत समझ रहा हूं, लेकिन सही क्या है? क्या pre-training न करने की वजह से काम बिगड़ा, या उन्होंने original repository में लिखी “procedure” का पालन करके fair reproduction की कोशिश की? यह देखते हुए कि UCSD group को कई steps reverse-engineer करने पड़े, लगता है कि सिर्फ paper के results से यह reproducible नहीं था
    [1]: https://github.com/google-research/circuit_training/blob/mai...

    • Markov के paper में भी Google के अलग author group के paper का link है, और वहां भी pre-training का फायदा बहुत छोटा दिखता है
      इसके अलावा, benchmarks की संख्या कम होने पर unknown source वाले Google के pre-trained model का इस्तेमाल उल्टा असर डाल सकता है। Google ने शायद उपलब्ध सभी benchmarks पर train किया होगा, जिससे वह commercial tools के optimal solutions ही वापस उगलने लगे
    • “scratch से training” का मतलब नए design attempts और पुराने designs को मिलाकर डालना भी हो सकता है
      तब कोई विरोधाभास नहीं रहता। यह पुराने designs पर pre-train करके नए design पर fine-tune करने के तरीके और शुरुआत से ही पूरे समय सभी data को मिलाकर train करने के तरीके का अंतर है। Fine-tuning catastrophic forgetting पैदा कर सकती है, और दोनों तरीके पुराने designs को बिल्कुल शामिल न करने की तुलना में बेहतर perform कर सकते हैं
    • Circuit Training repository शायद बस एक simple example दिखाने जैसा है। Open source repositories में setup testing या validation के लिए simple examples explain करना आम है, और इसका मतलब यह नहीं होता कि आम तौर पर best results पाने का यही तरीका है
      confusion शायद इस बात से पैदा हुआ कि उस example में paper के pre-training results जैसे नतीजे आने की बात कही गई थी। लेकिन यह साफ तौर पर pre-training को कुल मिलाकर खारिज नहीं करता। अगर Cheng आदि को सचमुच ambiguity लगी थी, तो उन्हें corresponding author से पूछना चाहिए था। अगर उन्हें repository के किसी हिस्से को “reverse-engineer” करना पड़ा लगा, तो वह भी पूछना चाहिए था
  • संबंधित posts. कोई और भी हैं?
    AI Alone Isn't Ready for Chip Design - https://news.ycombinator.com/item?id=42207373 - नवंबर 2024, 2 comments
    That Chip Has Sailed: Critique of Unfounded Skepticism Around AI for Chip Design - https://news.ycombinator.com/item?id=42172967 - नवंबर 2024, 9 comments
    Reevaluating Google's Reinforcement Learning for IC Macro Placement (AlphaChip) - https://news.ycombinator.com/item?id=42042046 - नवंबर 2024, 1 comment
    How AlphaChip transformed computer chip design - https://news.ycombinator.com/item?id=41672110 - सितंबर 2024, 194 comments
    Tension Inside Google over a Fired AI Researcher’s Conduct - https://news.ycombinator.com/item?id=31576301 - मई 2022, 23 comments
    Google is using AI to design chips that will accelerate AI - https://news.ycombinator.com/item?id=22717983 - मार्च 2020, 1 comment

  • Jeff Dean के जवाब का context यहां है
    https://news.ycombinator.com/item?id=41673769
    https://news.ycombinator.com/item?id=41673808

  • गलत hiring कितनी महंगी पड़ सकती है, यह लगभग हास्यास्पद है: https://www.wired.com/story/google-brain-ai-researcher-fired...

    • लिंक किए गए लेख में villain की तरह दिखाए गए Chatterjee अब शायद Google पर मुकदमा कर रहे हैं। लगता है उनका मानना है कि उन्हें इसलिए निकाला गया क्योंकि उन्होंने बताया था कि उनके बॉस Jeff Dean झूठे दावे जानते हुए भी पेश कर रहे थे
      कहा जाता है कि “स्पष्ट रूप से कहें तो, इस बात का कोई सबूत नहीं है कि RL अकादमिक state-of-the-art या सबसे मजबूत commercial macro placer से बेहतर है। बाद वाले से तुलना इतनी खराब थी कि कई मामलों में commercial tool installation समस्याओं की वजह से चल भी नहीं पाया” वाली पंक्ति Jeff Dean की internal presentation के स्क्रीन कैप्चर से है। https://regmedia.co.uk/2023/03/26/satrajit_vs_google.pdf बाहरी व्यक्ति के लिए यह तय करना बहुत मुश्किल है कि Chatterjee वह खराब और महंगी hiring थे जिन्होंने सहकर्मियों के अच्छे नतीजों को दबाया, या फिर बहुत मूल्यवान कर्मचारी थे जो झूठी presentation रोकने की कोशिश कर रहे थे
    • वाकई बहुत समय बर्बाद हुआ
      उन्होंने Markov के साथ internal research तक की, लेकिन AlphaChip के authors इसे इस तरह समझाते हैं। 2022 में Google की स्वतंत्र समिति ने समीक्षा की और माना कि “draft के दावे और निष्कर्ष experiments से वैज्ञानिक रूप से समर्थित नहीं हैं”, और “[AlphaChip] के original dataset results स्वतंत्र रूप से reproduce होने पर [Markov et al.] के RL results पर सवाल उठे।” authors का कहना है कि उन्होंने समिति को एक one-line script दी जो Markov आदि की report से कहीं बेहतर RL results बनाती थी, और ये results उनके “stronger” simulated annealing baseline से भी बेहतर थे। कहा जाता है कि अब भी यह पता नहीं है कि Markov और coauthors ने paper के numbers कैसे बनाए
      (https://arxiv.org/pdf/2411.10053)
    • academia, finance और दूसरे क्षेत्रों में fraud या manipulation करने वाले लोगों को hire करना सच में बड़ी समस्या है
      इसे घटाने का सबसे अच्छा, शायद इकलौता तरीका internal incentives, controls और culture हैं। अगर हर cycle में कुछ percent की endless improvement की कड़ी मांग की जाए, और जो व्यक्ति लगातार ऐसी performance लाता है उसे promote किया जाए, बिना यह जांचे कि वह performance मूल रूप से मौजूद भी थी या नहीं, तो आखिरकार scale चाहे जो हो, वही चीज होगी। छोटी team, department, company, ऐसी कई companies रखने वाला hedge fund, उन funds का fund, federal government—कहीं भी हो सकता है। देर-सवेर leadership में बेईमान लोग काफी घुसपैठ कर लेते हैं। academia के लगातार publication scandals और finance sector की अनगिनत घटनाएं इसके उदाहरण हैं। Holmes और SBF जेल में हैं, लेकिन जिन लोगों को उन्होंने fund किया और उनके जैसे समूह अब भी प्रभाव के शीर्ष पर हैं, अपनी ideology लेकर घूम रहे हैं और उनके पास बेहतर lawyers भी हैं। एक पुरानी कहावत है, “मछली सिर से सड़ती है।” STEM industry के प्रतीकात्मक leaders की हर तरह की संदिग्ध हरकतें और लगातार scandals देखकर अगर कहा जाए “अच्छा किया, system को हरा दिया,” तो ईमानदार और fair existing order पर चौतरफा हमले के अलावा और क्या उम्मीद की जा सकती है। आखिर हम भी “might makes right” जैसे quasi-religious ideal के पक्ष में अपने पैरों से vote करते आए हैं, और घृणा से छोड़ने तक मैं भी उसका हिस्सा था। इसे Objectivism, Effective Altruism, Capitalism जैसे अलग-अलग नाम दिए जाते हैं, लेकिन यह असली capitalism भी नहीं है। यह हैरानी की बात नहीं कि सब कुछ चिपचिपे ढंग से गंदा हो गया है। आज का जवाब क्या है, ठीक से नहीं पता। शायद कम खराब companies में काम करना, कम से कम anonymous रूप से ही सही abuses expose करना, और leaders के interview statements को सुनकर ध्यान से scrutinize करना। दूसरे सुझाव भी सुनना चाहूंगा
  • यह समझ आता है कि Jeff पर यहां जवाब देने का दबाव है। आखिर “Google Brain” research output के लगभग हर हिस्से पर उनका नाम है
    लेकिन “वे बेवकूफ थे इसलिए reproduce नहीं कर पाए, इसलिए यह reproducible है” वाला रवैया rebuttal नहीं, harassment है। लगता है critics ने कोई संवेदनशील nerve छू दी है, और उनकी research से जो reproducibility problems सामने आती हैं उनका अच्छा जवाब उनके पास नहीं है

    • linked tweet में ऐसा दावा नहीं है। उनका दावा है कि “वे procedure follow नहीं कर पाए, इसलिए reproduce नहीं कर पाए,” और उस दावे की motivation चाहे जो हो, यह काफी reasonable claim लगता है
    • अगर reproduction procedure, जैसे pretraining या पर्याप्त compute, follow नहीं किया और फिर fail हुए, तो उस “reproduction” attempt की कमी बताने में क्या दिक्कत है, समझ नहीं आता
    • यह कहां लिखा है? Dean ने tweet में वे specific steps बताए हैं जिन्हें authors ने miss किया
    • अच्छी बात है कि उन्होंने ऐसा नहीं कहा
      tweet सिर्फ इतना कहता है कि reproduction attempt ने असली methodology को वास्तव में follow नहीं किया। reproduction attempt के authors को “बेवकूफ” या ऐसा कुछ नहीं कहा गया, वह बस गढ़ी हुई बात है। “reproduce नहीं कर पाए, इसलिए reproducible है” जैसी साफ तौर पर गलत logic भी पूरी तरह fabricated है
    • critic के employer की वजह से bias होने का दावा करना काफी मजेदार है। जैसे Google में काम करना कोई conflict of interest ही नहीं है
      क्या Google वह company नहीं है जो stock price ऊपर रखने के लिए हर तरह के “मैं भी करता हूं” type AI development को desperately बढ़ा-चढ़ाकर दिखाती है? लगता है Jeff ने Kool-Aid इतना पी लिया है कि पानी क्या होता है, भूल गए हैं
  • Google का ultimate proof competitors से बेहतर chips बनाना है। फिलहाल तो वे ऐसा नहीं कर पा रहे हैं

  • “हमारे method को reproduce करते समय आपने पर्याप्त compute resources नहीं लगाए” वाली आलोचना आजकल थोड़ी हास्यास्पद लगती है। हां, जाहिर है, क्योंकि आप Google हैं
    यह ऐसा लगता है जैसे कहा जा रहा हो कि अगर आप cloud के मालिक नहीं हैं तो हमारी methodology की जांच नहीं कर सकते। ज्यादा compute और ज्यादा pretraining उपयोगी है, यह सच हो तो आश्चर्य नहीं होगा, लेकिन फिर verification मुश्किल हो जाती है। इसका एक दिलचस्प उल्टा पहलू भी है। Google के पास compute resources बहुत ज्यादा हैं, लेकिन Synopsys के पास training के लिए data बहुत ज्यादा है। बेशक, customer intellectual property पर train करने की अनुमति है या नहीं, यह बहुत बड़ी शर्त है

    • chip designers EDA tools on-premises चलाते हैं। EDA company customer data तक कैसे पहुंचेगी? NDA के तहत debugging purpose के लिए कुछ access संभव हो सकता है, लेकिन इसका मतलब यह नहीं कि वे customer intellectual property पर train कर सकते हैं