“product X vs Y” वाले search results अब लगभग पूरे AI बकवास बन गए हैं
dead internet को बढ़ते देखकर Kagi की subscription लेने का मन करता है। लगता है किसी दिन मानव-निर्मित content certification की जरूरत पड़ेगी
Kagi भी अफसोस कि कोई रामबाण नहीं है। Google के alternative को support करने के लिए पैसे देकर रोज़ इस्तेमाल करता हूं, लेकिन image search और text search दोनों में results का AI कचरे से भर जाना अब भी गंभीर समस्या है
product comparison इसका classic example है, लेकिन ज्यादा चिंता medical-related searches को लेकर है। इस हफ्ते मैं जो दवा ले रहा हूं उस पर research ढूंढने की कोशिश कर रहा था; 5 साल पहले भी results search engine optimization से polluted थे, और अब वे clicks खींचने के लिए बने GPT-generated spam के सैकड़ों pages की वजह से कहीं ज्यादा खराब हो गए हैं
आखिर में search पूरी तरह छोड़नी पड़ी, nih.gov पर कोई थोड़े-बहुत relevant papers ढूंढे, फिर citations की list को manually follow करके information निकालनी पड़ी
बचपन और अपनी 20s में इस्तेमाल किए internet को याद करते हुए, यह जानना कि वह internet अब कभी वापस नहीं आएगा, वाकई अजीब एहसास है
dead internet को बढ़ते देखना काफी surreal है
मुझे लगता है ads के कारण internet का commercialize होना, और user-hostile platforms में centralize होना, निश्चित रूप से आग लगाने जैसा रहा। पुराना internet आज भी कहीं बेहतर लगता है, लेकिन पिछले 15 सालों में उसने अपने ज्यादातर users खो दिए हैं
हर search query के आखिर में “Reddit” जोड़ना मदद करता है, लेकिन Reddit content का बड़ा हिस्सा भी AI-generated हो जाना बस समय की बात लगता है
Kagi पर “baby peacock” search करने पर भी Google जैसे ही results आते हैं, और उनमें से ज्यादातर AI images हैं
पागल कर देने वाली हालत है। internet मर चुका है
हाल ही में मैंने घर खरीदा, और molding को paint करने से पहले उसे कैसे prepare करना चाहिए जैसी home repair tasks search कीं। लगभग हर result AI-generated content farm था, हर paragraph के बीच ads घुसे हुए, content से असंबंधित autoplay video page के साथ-साथ चिपका घूम रहा था, cookie consent modal pop up हो रहा था, और तुरंत “हमारे दोस्त बनें” वाला newsletter signup modal भी आ जाता था
अच्छा लगे या बुरा, अब असली information ढूंढने की जगह बस Reddit ही बची लगती है
ऐसे searches के लिए YouTube और TikTok सबसे अच्छे हैं। videos अभी AI से पूरी तरह flooded नहीं हुए हैं, और हाथ से किए जाने वाले कामों के बारे में लगभग कुछ भी मिल जाता है
मैं text content को video से बहुत ज्यादा पसंद करता हूं, लेकिन इंसानों द्वारा खुद लिखा असली text content लगभग मर चुका है। Reddit फिलहाल rare exception हो सकता है। कुछ पुराने forums भी क्षेत्र-दर-क्षेत्र अभी जिंदा हैं, लेकिन उन्हें ढूंढना बेहद मुश्किल होता जा रहा है
एक general-purpose home maintenance book खरीदना बेहतर है
उदाहरण के लिए https://archive.org/details/stanleyhomerepai0000fine/page/14... 2014 की किताब Stanley Home Repairs के “Painting Trim the Right Way” chapter पर ले जाता है
used bookstores भी देखने लायक हैं। home repair बहुत ज्यादा नहीं बदली है
Wine चलाकर Broderbund की CD-ROM “Black & Decker Everyday Home Repairs” भी try कर सकते हैं: https://archive.org/details/BlackDeckerEverydayHomeRepairsBr.... https://www.goodreads.com/book/show/3424503-everyday-home-re... के मुताबिक, यह leaking faucet repair से लेकर hardwood floor repair तक 100 से ज्यादा common household problems के लिए step-by-step guidance देती है, animations और narration भी देती है, और estimated time, cost, required materials व tools की list भी शामिल करती है
सच में काफी ठीक-ठाक लगती है
1939 में बने घर का मालिक होने और खुद repair करने के नजरिए से, मैंने repair work में कुछ हद तक आगे बढ़ने के बाद ही home reference book library बनाई, जबकि यह screwdriver उठाने से पहले करना चाहिए था
Taunton Press की Renovations(https://www.bookfinder.com/search_s/?title=Renovation%205th%...) किसी home repair project की शुरुआत में मेरी पहली reference होती है। chapter 18 पूरा paint work पर है। Taunton की दूसरी books भी शानदार हैं, लेकिन Renovations का scope बेमिसाल है
आजकल मिलने वाली flat white MDF molding पहले से primed होती है, इसलिए सीधे paint के लिए ready होती है
मेरे पास एक पुरानी car और एक नई car है; पुरानी car उस पुराने internet के दौर में मौजूद थी, इसलिए किसी भी repair का तरीका मिल जाता है। उस समय लोग हर तरह के work logs छोड़ते थे
नई car के बारे में work information लगभग नहीं है, और ज्यादातर बस YouTube videos हैं जिनमें कुछ न जानने वाला व्यक्ति खराब DIY repair film कर रहा होता है
home repair के लिए YouTube सबसे अच्छा resource लगता है। हां, अगर आप text और photos चाहते थे तो समझ आता है
“कंटेंट” उत्पादन और monetization के इर्द-गिर्द चलने वाली इंटरनेट economy में शायद शुरुआत से ही ऐसा होने की संभावना काफी थी
इसकी शुरुआत मौजूदा content पर ads लगाने से हुई, और फिर social networks व social media की ओर बढ़ी, जो आखिरकार ज्यादा content production को crowdsource करके उसके बगल में ads दिखाने वाला engine था। जब पैसा लगा हो, तो content production एक अहम business बन गया, और technology उस demand को इस तरह पूरा कर रही है कि कमाए जाने वाले पैसे से सस्ता content बनाया जा सके
पहले से ही इंसानों द्वारा बनाए गए अवांछनीय content को manage करने की समस्या इस business model को घिसने लगी थी, और अब generative tools management की रफ्तार से भी तेज unwanted content बना रहे हैं। एक हद तक saturation के बाद लोग रुचि खो देंगे, और पहले अच्छे और खराब content को algorithmic heuristics से अलग करने वाले tools भी बेकार हो जाएंगे। दिखने वाला इकलौता escape route है इंसानों द्वारा बनाए content की इंसानों द्वारा curation, लेकिन industry जिस scale की मांग करती है, उस पर ऐसा business model होगा या नहीं, पता नहीं
बहुत लोग blogs को nostalgia के साथ देखते हैं, लेकिन blogs इंटरनेट के लंबे समय तक टिकने वाले content से content farm-स्टाइल articles की mass production में बदलने के शुरुआती उदाहरण थे
शुरुआती इंटरनेट किसी library में घूमने जैसा ज्यादा लगता था। ज्यादातर sites से रोज, यहां तक कि हर महीने update होने की उम्मीद नहीं होती थी, और posts लगभग हमेशा latest order में नहीं बल्कि विषय के हिसाब से organized होती थीं
Blogs ने नएपन पर जरूरत से ज्यादा focus करके बहुत कुछ बदल दिया, और कई sites लंबे समय तक बची रहने वाली resource libraries बढ़ाने के बजाय नई page views निकालने की ओर मुड़ गईं, जिससे वे साफ तौर पर खराब हुईं। Online discussions ने भी forums से Reddit/HN-style recommendation structure में बदलते हुए कुछ ऐसा ही अनुभव किया। पुराने forums में 10 साल से ज्यादा चली discussions भी अभी बची हुई हैं, जबकि Reddit या HN पर कुछ घंटे बीतते ही post page से नीचे धकेल दी जाती है और discussion मर जाती है
इंसानी भरोसा 100 लोगों से आगे जाना भी मुश्किल होता है, और पूरे इंटरनेट के scale पर तो और भी असंभव है, इसलिए मुझे नहीं लगता कि ऐसा कोई business model है। इंसान शायद उसी tribal scale पर लौटेंगे, जिसके लिए वे समझने और belong करने के लिए मूल रूप से बने हैं
Private group chats हमारी मान्यता से कहीं ज्यादा popular और common हैं, और ऐसे माहौल में यह trend और तेज होगा
Open systems में human curation संभव है, लेकिन अगर कुछ विशाल silos हों तो algorithmic efficiency उनके भीतर काम करती है और अभी जैसे नतीजे सामने आते हैं
उम्मीद है कि लोग रुचि खो देंगे और कचरा content consume करना बंद कर देंगे, लेकिन दूसरी तरफ दांव यह है कि लोग लगातार घटती quality के algorithmically supplied content के आदी होते जाएंगे और industry किसी भी तरीके से अंतहीन profit निचोड़ती रहेगी। Cable TV के इतिहास को देखें तो लगता है कि कोई breaking point होता है
इंसानों द्वारा बनाए content को इंसानों द्वारा curate करना असल में retweet ही है
ऊब चुके थोड़े-से college students जैसे छोटे monoculture groups हमेशा algorithm को समझकर platform को porn और spam से कब्जा लेंगे और resources को खा जाएंगे। कमजोर groups की मदद के लिए बनाए गए बेहतर tools और financial incentives का जुड़ाव उल्टा gap बढ़ाता है। यह इसलिए समस्या बनता है क्योंकि financial influencers कुछ content market influencers के हाथों अपमानित होने के लिए पैसे नहीं देते, बल्कि जनता से recognition पाने के लिए पैसे देते हैं
लेकिन यह समस्या क्यों है? “अवांछनीय content” producers बस उसी चीज के लिए optimize करते हैं जिसे market सबसे valuable मानता है। अगर यही समस्या है, तो market का अस्तित्व ही समस्या है। तो क्या किया जाए? उसे बस तोड़ देना भी समझ में आ सकता है
Gutenberg के बाद से publishing लगातार content monetization की ओर नहीं बढ़ती रही क्या? Catholic Church के इतिहास को देखें तो उससे पहले भी शायद ऐसा ही था
बात सिर्फ images की नहीं है। Google पर कोई आम-सा सवाल search करने पर top 3–5 results में अक्सर generative AI का word salad दिख जाता है
जब आप पढ़ना शुरू करते हैं, तो तुरंत पता नहीं चलता। फिर आप उन चीजों पर भी शक करने लगते हैं जो साफ तौर पर generative AI नहीं हैं। इंसान को यह समझ होती है कि कोई किस तरह गलत हो सकता है, गलत होने पर किस तरीके से गलत होता है, गलत होने पर उसका tone कैसा होता है, उसके गलत होने की संभावना कितनी है, किन formats और platforms में errors मौजूद होते हैं, वे कितनी बार गलत होते हैं, और दूसरे लोग कैसे react करते हैं। AI बिल्कुल अलग चीज है। कोई plausible-sounding AI कब गलत है, यह किसी intuition या experience से पता नहीं चलता
दी गई जानकारी की quality को अनजाने में assess करने वाली heuristics का पूरा set अगर रातोंरात बेअसर हो जाए, तो यह पागलपन और दुर्भाग्य का नुस्खा हो सकता है। पूरी जिंदगी में technology की वजह से इतना सचमुच दुखी मैं शायद ही कभी हुआ हूं
सच कहूं तो मुझे लगता है यह public internet का अंत है। असफल Google नहीं हुआ, बल्कि public internet की असलियत असफल हुई है
अगर मुझे किसी चीज में मदद चाहिए या कोई सवाल है, तो मैं न Google इस्तेमाल करता हूं, न public forum पर post करता हूं। मैं private group chat में पूछता हूं, जहां सब असली लोग हैं, कोई पैसा नहीं कमा रहा, और कोई बाद में account बेचने के लिए internet points जमा करने हेतु ChatGPT copy-paste नहीं कर रहा
बदलाव का सिर्फ एक ही रास्ता है, लेकिन लोगों को पसंद नहीं आएगा। इंटरनेट का हर content legal ID से जुड़ना होगा। Facebook की हर post और हर comment को किसी वास्तविक व्यक्ति से जोड़ा जा सकना चाहिए
मुझे नहीं लगता कि heuristics इतनी अलग हैं। Search engine optimization spam और बकवास content पहले भी मौजूद थे, और Google व YouTube दोनों ही click optimization करने वाले और YouTube recommendation system manipulate करने वाले human “content creators” से भरे थे
AI content भी बहुत अलग नहीं है। बस अब ऐसा content बनाना 100 गुना आसान हो गया है, इसलिए यह कहीं ज्यादा दिखाई देता है। मूल रूप से यह AI की समस्या नहीं, बल्कि incentives और ad-based business model की समस्या है। AI ने service degradation की समस्या को कहीं ज्यादा नजर आने लायक बना दिया है, लेकिन वह समस्या पहले से थी
समाधान नहीं पता। अंदाजा है कि low-quality content की बाढ़ के साथ public internet समय के साथ कम महत्वपूर्ण होता जाएगा, और बहुत-सा communication छोटी communities में चला जाएगा जो इंसानी identity और credential verification पर काफी निर्भर होंगी
मैं माहौल खराब नहीं करना चाहता, लेकिन फिर भी privacy का loss कहीं ज्यादा दुखद है
क्यों, यह समझाना मुश्किल है, लेकिन शायद इसलिए कि मुझे पता नहीं था कि baby peacock कैसा दिखता है, इस example ने AI के dark side का एहसास वाकई बहुत जोर से कराया
मैं search results पर कुछ हद तक भरोसा करने का आदी था। अजीब results या लगभग बेकार results भी होते थे, लेकिन relevant images के समंदर में इक्का-दुक्का। अब मैं जिन चीजों के बारे में नहीं जानता, उनके लिए पूरी तरह अंधा हो सकता हूं। Google को “बस मौजूद चीज” के रूप में देखते हुए बड़े हुए व्यक्ति के तौर पर यह सच में डरावना है
अगर Google को लगातार relevant बने रहना है, तो क्या उसे किसी तरह यह समस्या हल नहीं करनी चाहिए? अगर images खोजना और images generate करना एक ही नतीजे देने लगें, तो फिर image search का मतलब ही क्या रह जाता है?
सामान्य search के बारे में भी बिल्कुल यही कहा जा सकता है। आप कुछ भी search करें, पहले ads का एक पेज आता है, फिर content farms के कुछ पेज, और उसके बाद ऐसे पेज आते हैं जो “expert जैसे सुनाई देते हैं, लेकिन अंत में content farm ही हैं”
इंटरनेट को ads से fund करने की वजह से अच्छी quality का content ढूँढना सच में बहुत मुश्किल हो गया है। अगर आप content creator या Google नहीं हैं, तो incentives पूरी तरह बिगड़े हुए हैं
लक्ष्य शायद watermarking है, लेकिन शायद ही कोई कह पाए कि web managed decline के अलावा किसी और हालत में है। AI का AI को feed करने वाला ढाँचा अंततः सब कुछ खत्म कर देगा। Platformer ने इसे सबसे अच्छे से समझाया है: https://www.platformer.news/google-io-ai-search-sundar-picha...
सवाल यह है कि आगे क्या आएगा, और लगता है किसी के पास इसका जवाब नहीं है
“हल” से आपका मतलब क्या है, मुझे समझ नहीं आता। यह तो पहले से ही समस्या हल कर रहा है। लोग जिसे पर्याप्त अच्छा मान लें, बात वहीं खत्म हो जाती है
इसका आधार धरती पर मौजूद बाकी हर news और social media है
Google के इस तरह “हल” करने की संभावना ज़्यादा है कि लोग यह नोटिस ही न करें कि baby peacock AI-generated है
मुझे लगता है कि बड़ी tech कंपनियाँ ज़्यादा सख्त AI regulation के लिए lobbying क्यों करती हैं, इसकी एक वजह यही है। वे AI के प्रभुत्व से नहीं डरतीं, बल्कि AI से अपने business के बर्बाद होने से डरती हैं
सबसे बुरा मामला Snopes के “Video Genuinely Shows White ‘Baby Peacock’?” शीर्षक को question mark हटाकर copy करने वाला result है। उस page में बताया गया है कि वह photo असली baby peacock नहीं है
ज़्यादा सही term peachick से search करने पर लगता है 100% असली images आती हैं। हालांकि आधे pages अब भी उन्हें “baby peacocks” कहते हैं
पहला result Adobe Stock है। कोई सोच सकता है कि इसका standard Pinterest या TikTok से ऊँचा होगा, लेकिन हकीकत यह है
निकट भविष्य में YouTube वीडियो और पॉडकास्ट का बड़ा हिस्सा AI से generated होने की संभावना काफ़ी है। उदाहरण के लिए Notebook LM जैसे tools के जरिए
हालांकि मुझे यकीन नहीं कि audience सच में ऐसे AI generated content का आनंद लेगी। निजी तौर पर मैं इंसानों द्वारा बनाए गए content को ज़्यादा पसंद करता हूँ। वह ज़्यादा असली और immersive लगता है
AI tools में भरोसेमंद watermark जैसी मज़बूत detection व्यवस्था ज़रूर होनी चाहिए, ताकि दूसरे platforms AI generated content की पहचान कर सकें। दुर्भाग्य से, मौजूदा AI generated audio detection tools अभी पर्याप्त नहीं हैं: https://www.npr.org/2024/04/05/1241446778/deepfake-audio-det...
अभी Notebook LM द्वारा generated “podcast” की सूची भी整理 की है: https://github.com/ListenNotes/notebooklm-generated-fake-pod...
यह सोचने की ज़रूरत है कि क्या आप AI द्वारा बनाए गए podcast सुनना चाहेंगे। लोग अपने द्वारा बनाए गए program को शायद ठीक-ठाक स्वीकार कर लें, लेकिन किसी और के AI से generated “podcast” उन्हें कम पसंद आएंगे, ऐसा मुझे लगता है
मैं मानना चाहता हूँ कि इंसानों द्वारा बनाया content ज़्यादा असली और immersive होता है, लेकिन संदेह है कि यह बात कितने समय तक सच रहेगी
मैं human-made content को ज़्यादा पसंद करना “चाहता” हूँ, लेकिन लगता है AI इंसानी engagement को बेहतर optimize कर सकता है। खासकर TikTok वीडियो जैसे सरल dopamine-triggering content में यह और भी सच हो सकता है। हम अपने बारे में जितना सोचते हैं, उससे कम जटिल हैं
AI tools की detection व्यवस्था दुर्भाग्य से कभी ठीक से काम नहीं करेगी। malicious actors को बाहर रखने का कोई तरीका नहीं है, और AI के इंसान होने का दिखावा करने में बहुत पैसा लगा है। बल्कि शायद इंसानों द्वारा बनाए गए content पर watermark या signature लगाना पड़े
यहाँ इसे binary में बाँटना ज़्यादा मददगार नहीं है
उदाहरण के लिए, 10 साल पहले भी मैंने ऐसे YouTube वीडियो देखे थे जिनका narration पूरी तरह TTS था। creator अपनी आवाज़ इस्तेमाल नहीं करना चाहता था, इसलिए उसने script लिखी और उसे TTS system में डाल दिया। उस समय की तकनीक के हिसाब से आवाज़ बहुत खराब थी, लेकिन लोगों ने वीडियो enjoy किए और views भी अच्छे थे। क्या इसे AI generated कहेंगे?
अब generated AI के बिना भी कहीं बेहतर TTS मौजूद है। ऐसे वीडियो अब देखने में बेहतर हो गए होंगे। tone variation कम होने से पता चल सकता है कि यह इंसान नहीं है, लेकिन शायद 1 मिनट से ज़्यादा सुनने पर ही फर्क समझ आएगा। क्या यह AI generated है?
अब generated AI से ऐसी आवाज़ संभव है जिसे AI है या नहीं, पहचाना न जा सके। फिर भी अगर script इंसान ने लिखी है तो क्या यह ठीक है? क्या यह AI generated है?
आखिर में, उसी वीडियो में मान लें creator script खुद लिखता है, लेकिन उसे लगता है कि वह अच्छा नहीं लिखता, या English उसकी native language नहीं है इसलिए grammar errors बहुत हैं। इसलिए वह script GPT को देता है और सिर्फ grammar ठीक कराने के बजाय “popular video की script बनने” जैसा goal देकर उसे improve कराता है। इसके बाद वह review करता है कि जो core बात वह पहुँचाना चाहता था, वह पहुँची या नहीं, और voice generation करता है। क्या यह AI generated है?
मेरे लिए ये सभी मामले ठीक हैं, और पूरी तरह human workflow से बनाए गए काम से inferior नहीं हैं। अगर creator इंसान है और उसे लगता है कि वह जो कहना चाहता था, वह पहुँचा रहा है, तो इतना काफी है
मैं blog post का draft GPT को भेजकर अपने बदले लिखवाना चाहता हूँ। अभी ऐसा न करने की वजह यह है कि output में मेरी “voice” नहीं होती। उसमें वह बात आ सकती है जो मैं कहना चाहता था, लेकिन writing style पूरी तरह अलग होता है। अगर GPT/Claude मेरी style की बेहतर नकल कर सके, तो मैं तुरंत इस्तेमाल करूँगा। अंतहीन editing पसंद करने वाले लोग बहुत कम हैं, और writers भी इसमें अपवाद नहीं हैं
सवाल यह है कि फर्क करना असंभव होने में कितना समय लगेगा
Listen Notes ने पिछले weekend में ही Notebook LM से generated fake podcasts 500 से ज़्यादा delete किए
scammers और black-hat search engine optimization करने वालों को पहले से Notebook LM का इस्तेमाल करके fake podcasts बड़े पैमाने पर बनाते और कई platforms पर distribute करते देखना निराशाजनक है
निजी तौर पर मैं unlimited low-quality content machine के खिलाफ हूँ
Google ने image search से actual image तक जाना या उसे download करना लगातार और मुश्किल बनाना शुरू किया, तो मैंने एक image search tool बनाया जिससे operating system shortcuts के जरिए Google image repository search करके जल्दी clipboard में copy किया जा सके। यह custom Google Search Engine ID इस्तेमाल करता है
करीब 1 साल पहले से पता चला कि results के 90% AI generated हैं, इसलिए “No AI” flag जोड़ा। यह मूल रूप से 2022 से पहले के results तक सीमित करने वाला तेज़ और rough filter है। perfect नहीं है, लेकिन अस्थायी उपाय के तौर पर काम करता है https://github.com/scpedicini/truman-show
1 टिप्पणियां
Hacker News की राय
“product X vs Y” वाले search results अब लगभग पूरे AI बकवास बन गए हैं
dead internet को बढ़ते देखकर Kagi की subscription लेने का मन करता है। लगता है किसी दिन मानव-निर्मित content certification की जरूरत पड़ेगी
product comparison इसका classic example है, लेकिन ज्यादा चिंता medical-related searches को लेकर है। इस हफ्ते मैं जो दवा ले रहा हूं उस पर research ढूंढने की कोशिश कर रहा था; 5 साल पहले भी results search engine optimization से polluted थे, और अब वे clicks खींचने के लिए बने GPT-generated spam के सैकड़ों pages की वजह से कहीं ज्यादा खराब हो गए हैं
आखिर में search पूरी तरह छोड़नी पड़ी, nih.gov पर कोई थोड़े-बहुत relevant papers ढूंढे, फिर citations की list को manually follow करके information निकालनी पड़ी
मुझे लगता है ads के कारण internet का commercialize होना, और user-hostile platforms में centralize होना, निश्चित रूप से आग लगाने जैसा रहा। पुराना internet आज भी कहीं बेहतर लगता है, लेकिन पिछले 15 सालों में उसने अपने ज्यादातर users खो दिए हैं
पागल कर देने वाली हालत है। internet मर चुका है
हाल ही में मैंने घर खरीदा, और molding को paint करने से पहले उसे कैसे prepare करना चाहिए जैसी home repair tasks search कीं। लगभग हर result AI-generated content farm था, हर paragraph के बीच ads घुसे हुए, content से असंबंधित autoplay video page के साथ-साथ चिपका घूम रहा था, cookie consent modal pop up हो रहा था, और तुरंत “हमारे दोस्त बनें” वाला newsletter signup modal भी आ जाता था
अच्छा लगे या बुरा, अब असली information ढूंढने की जगह बस Reddit ही बची लगती है
मैं text content को video से बहुत ज्यादा पसंद करता हूं, लेकिन इंसानों द्वारा खुद लिखा असली text content लगभग मर चुका है। Reddit फिलहाल rare exception हो सकता है। कुछ पुराने forums भी क्षेत्र-दर-क्षेत्र अभी जिंदा हैं, लेकिन उन्हें ढूंढना बेहद मुश्किल होता जा रहा है
उदाहरण के लिए https://archive.org/details/stanleyhomerepai0000fine/page/14... 2014 की किताब Stanley Home Repairs के “Painting Trim the Right Way” chapter पर ले जाता है
used bookstores भी देखने लायक हैं। home repair बहुत ज्यादा नहीं बदली है
Wine चलाकर Broderbund की CD-ROM “Black & Decker Everyday Home Repairs” भी try कर सकते हैं: https://archive.org/details/BlackDeckerEverydayHomeRepairsBr.... https://www.goodreads.com/book/show/3424503-everyday-home-re... के मुताबिक, यह leaking faucet repair से लेकर hardwood floor repair तक 100 से ज्यादा common household problems के लिए step-by-step guidance देती है, animations और narration भी देती है, और estimated time, cost, required materials व tools की list भी शामिल करती है
सच में काफी ठीक-ठाक लगती है
Taunton Press की Renovations(https://www.bookfinder.com/search_s/?title=Renovation%205th%...) किसी home repair project की शुरुआत में मेरी पहली reference होती है। chapter 18 पूरा paint work पर है। Taunton की दूसरी books भी शानदार हैं, लेकिन Renovations का scope बेमिसाल है
आजकल मिलने वाली flat white MDF molding पहले से primed होती है, इसलिए सीधे paint के लिए ready होती है
नई car के बारे में work information लगभग नहीं है, और ज्यादातर बस YouTube videos हैं जिनमें कुछ न जानने वाला व्यक्ति खराब DIY repair film कर रहा होता है
“कंटेंट” उत्पादन और monetization के इर्द-गिर्द चलने वाली इंटरनेट economy में शायद शुरुआत से ही ऐसा होने की संभावना काफी थी
इसकी शुरुआत मौजूदा content पर ads लगाने से हुई, और फिर social networks व social media की ओर बढ़ी, जो आखिरकार ज्यादा content production को crowdsource करके उसके बगल में ads दिखाने वाला engine था। जब पैसा लगा हो, तो content production एक अहम business बन गया, और technology उस demand को इस तरह पूरा कर रही है कि कमाए जाने वाले पैसे से सस्ता content बनाया जा सके
पहले से ही इंसानों द्वारा बनाए गए अवांछनीय content को manage करने की समस्या इस business model को घिसने लगी थी, और अब generative tools management की रफ्तार से भी तेज unwanted content बना रहे हैं। एक हद तक saturation के बाद लोग रुचि खो देंगे, और पहले अच्छे और खराब content को algorithmic heuristics से अलग करने वाले tools भी बेकार हो जाएंगे। दिखने वाला इकलौता escape route है इंसानों द्वारा बनाए content की इंसानों द्वारा curation, लेकिन industry जिस scale की मांग करती है, उस पर ऐसा business model होगा या नहीं, पता नहीं
शुरुआती इंटरनेट किसी library में घूमने जैसा ज्यादा लगता था। ज्यादातर sites से रोज, यहां तक कि हर महीने update होने की उम्मीद नहीं होती थी, और posts लगभग हमेशा latest order में नहीं बल्कि विषय के हिसाब से organized होती थीं
Blogs ने नएपन पर जरूरत से ज्यादा focus करके बहुत कुछ बदल दिया, और कई sites लंबे समय तक बची रहने वाली resource libraries बढ़ाने के बजाय नई page views निकालने की ओर मुड़ गईं, जिससे वे साफ तौर पर खराब हुईं। Online discussions ने भी forums से Reddit/HN-style recommendation structure में बदलते हुए कुछ ऐसा ही अनुभव किया। पुराने forums में 10 साल से ज्यादा चली discussions भी अभी बची हुई हैं, जबकि Reddit या HN पर कुछ घंटे बीतते ही post page से नीचे धकेल दी जाती है और discussion मर जाती है
Private group chats हमारी मान्यता से कहीं ज्यादा popular और common हैं, और ऐसे माहौल में यह trend और तेज होगा
उम्मीद है कि लोग रुचि खो देंगे और कचरा content consume करना बंद कर देंगे, लेकिन दूसरी तरफ दांव यह है कि लोग लगातार घटती quality के algorithmically supplied content के आदी होते जाएंगे और industry किसी भी तरीके से अंतहीन profit निचोड़ती रहेगी। Cable TV के इतिहास को देखें तो लगता है कि कोई breaking point होता है
ऊब चुके थोड़े-से college students जैसे छोटे monoculture groups हमेशा algorithm को समझकर platform को porn और spam से कब्जा लेंगे और resources को खा जाएंगे। कमजोर groups की मदद के लिए बनाए गए बेहतर tools और financial incentives का जुड़ाव उल्टा gap बढ़ाता है। यह इसलिए समस्या बनता है क्योंकि financial influencers कुछ content market influencers के हाथों अपमानित होने के लिए पैसे नहीं देते, बल्कि जनता से recognition पाने के लिए पैसे देते हैं
लेकिन यह समस्या क्यों है? “अवांछनीय content” producers बस उसी चीज के लिए optimize करते हैं जिसे market सबसे valuable मानता है। अगर यही समस्या है, तो market का अस्तित्व ही समस्या है। तो क्या किया जाए? उसे बस तोड़ देना भी समझ में आ सकता है
बात सिर्फ images की नहीं है। Google पर कोई आम-सा सवाल search करने पर top 3–5 results में अक्सर generative AI का word salad दिख जाता है
जब आप पढ़ना शुरू करते हैं, तो तुरंत पता नहीं चलता। फिर आप उन चीजों पर भी शक करने लगते हैं जो साफ तौर पर generative AI नहीं हैं। इंसान को यह समझ होती है कि कोई किस तरह गलत हो सकता है, गलत होने पर किस तरीके से गलत होता है, गलत होने पर उसका tone कैसा होता है, उसके गलत होने की संभावना कितनी है, किन formats और platforms में errors मौजूद होते हैं, वे कितनी बार गलत होते हैं, और दूसरे लोग कैसे react करते हैं। AI बिल्कुल अलग चीज है। कोई plausible-sounding AI कब गलत है, यह किसी intuition या experience से पता नहीं चलता
दी गई जानकारी की quality को अनजाने में assess करने वाली heuristics का पूरा set अगर रातोंरात बेअसर हो जाए, तो यह पागलपन और दुर्भाग्य का नुस्खा हो सकता है। पूरी जिंदगी में technology की वजह से इतना सचमुच दुखी मैं शायद ही कभी हुआ हूं
अगर मुझे किसी चीज में मदद चाहिए या कोई सवाल है, तो मैं न Google इस्तेमाल करता हूं, न public forum पर post करता हूं। मैं private group chat में पूछता हूं, जहां सब असली लोग हैं, कोई पैसा नहीं कमा रहा, और कोई बाद में account बेचने के लिए internet points जमा करने हेतु ChatGPT copy-paste नहीं कर रहा
बदलाव का सिर्फ एक ही रास्ता है, लेकिन लोगों को पसंद नहीं आएगा। इंटरनेट का हर content legal ID से जुड़ना होगा। Facebook की हर post और हर comment को किसी वास्तविक व्यक्ति से जोड़ा जा सकना चाहिए
AI content भी बहुत अलग नहीं है। बस अब ऐसा content बनाना 100 गुना आसान हो गया है, इसलिए यह कहीं ज्यादा दिखाई देता है। मूल रूप से यह AI की समस्या नहीं, बल्कि incentives और ad-based business model की समस्या है। AI ने service degradation की समस्या को कहीं ज्यादा नजर आने लायक बना दिया है, लेकिन वह समस्या पहले से थी
समाधान नहीं पता। अंदाजा है कि low-quality content की बाढ़ के साथ public internet समय के साथ कम महत्वपूर्ण होता जाएगा, और बहुत-सा communication छोटी communities में चला जाएगा जो इंसानी identity और credential verification पर काफी निर्भर होंगी
क्यों, यह समझाना मुश्किल है, लेकिन शायद इसलिए कि मुझे पता नहीं था कि baby peacock कैसा दिखता है, इस example ने AI के dark side का एहसास वाकई बहुत जोर से कराया
मैं search results पर कुछ हद तक भरोसा करने का आदी था। अजीब results या लगभग बेकार results भी होते थे, लेकिन relevant images के समंदर में इक्का-दुक्का। अब मैं जिन चीजों के बारे में नहीं जानता, उनके लिए पूरी तरह अंधा हो सकता हूं। Google को “बस मौजूद चीज” के रूप में देखते हुए बड़े हुए व्यक्ति के तौर पर यह सच में डरावना है
अगर आपके पास Twitter अकाउंट नहीं है और आप सिर्फ़ एक पोस्ट से ज़्यादा देखना चाहते हैं, तो यहाँ देख सकते हैं: https://xcancel.com/notengoprisa/status/1842550658102079556
अगर Google को लगातार relevant बने रहना है, तो क्या उसे किसी तरह यह समस्या हल नहीं करनी चाहिए? अगर images खोजना और images generate करना एक ही नतीजे देने लगें, तो फिर image search का मतलब ही क्या रह जाता है?
इंटरनेट को ads से fund करने की वजह से अच्छी quality का content ढूँढना सच में बहुत मुश्किल हो गया है। अगर आप content creator या Google नहीं हैं, तो incentives पूरी तरह बिगड़े हुए हैं
सवाल यह है कि आगे क्या आएगा, और लगता है किसी के पास इसका जवाब नहीं है
इसका आधार धरती पर मौजूद बाकी हर news और social media है
सबसे बुरा मामला Snopes के “Video Genuinely Shows White ‘Baby Peacock’?” शीर्षक को question mark हटाकर copy करने वाला result है। उस page में बताया गया है कि वह photo असली baby peacock नहीं है
ज़्यादा सही term peachick से search करने पर लगता है 100% असली images आती हैं। हालांकि आधे pages अब भी उन्हें “baby peacocks” कहते हैं
निकट भविष्य में YouTube वीडियो और पॉडकास्ट का बड़ा हिस्सा AI से generated होने की संभावना काफ़ी है। उदाहरण के लिए Notebook LM जैसे tools के जरिए
हालांकि मुझे यकीन नहीं कि audience सच में ऐसे AI generated content का आनंद लेगी। निजी तौर पर मैं इंसानों द्वारा बनाए गए content को ज़्यादा पसंद करता हूँ। वह ज़्यादा असली और immersive लगता है
AI tools में भरोसेमंद watermark जैसी मज़बूत detection व्यवस्था ज़रूर होनी चाहिए, ताकि दूसरे platforms AI generated content की पहचान कर सकें। दुर्भाग्य से, मौजूदा AI generated audio detection tools अभी पर्याप्त नहीं हैं: https://www.npr.org/2024/04/05/1241446778/deepfake-audio-det...
अभी Notebook LM द्वारा generated “podcast” की सूची भी整理 की है: https://github.com/ListenNotes/notebooklm-generated-fake-pod...
यह सोचने की ज़रूरत है कि क्या आप AI द्वारा बनाए गए podcast सुनना चाहेंगे। लोग अपने द्वारा बनाए गए program को शायद ठीक-ठाक स्वीकार कर लें, लेकिन किसी और के AI से generated “podcast” उन्हें कम पसंद आएंगे, ऐसा मुझे लगता है
मैं human-made content को ज़्यादा पसंद करना “चाहता” हूँ, लेकिन लगता है AI इंसानी engagement को बेहतर optimize कर सकता है। खासकर TikTok वीडियो जैसे सरल dopamine-triggering content में यह और भी सच हो सकता है। हम अपने बारे में जितना सोचते हैं, उससे कम जटिल हैं
AI tools की detection व्यवस्था दुर्भाग्य से कभी ठीक से काम नहीं करेगी। malicious actors को बाहर रखने का कोई तरीका नहीं है, और AI के इंसान होने का दिखावा करने में बहुत पैसा लगा है। बल्कि शायद इंसानों द्वारा बनाए गए content पर watermark या signature लगाना पड़े
उदाहरण के लिए, 10 साल पहले भी मैंने ऐसे YouTube वीडियो देखे थे जिनका narration पूरी तरह TTS था। creator अपनी आवाज़ इस्तेमाल नहीं करना चाहता था, इसलिए उसने script लिखी और उसे TTS system में डाल दिया। उस समय की तकनीक के हिसाब से आवाज़ बहुत खराब थी, लेकिन लोगों ने वीडियो enjoy किए और views भी अच्छे थे। क्या इसे AI generated कहेंगे?
अब generated AI के बिना भी कहीं बेहतर TTS मौजूद है। ऐसे वीडियो अब देखने में बेहतर हो गए होंगे। tone variation कम होने से पता चल सकता है कि यह इंसान नहीं है, लेकिन शायद 1 मिनट से ज़्यादा सुनने पर ही फर्क समझ आएगा। क्या यह AI generated है?
अब generated AI से ऐसी आवाज़ संभव है जिसे AI है या नहीं, पहचाना न जा सके। फिर भी अगर script इंसान ने लिखी है तो क्या यह ठीक है? क्या यह AI generated है?
आखिर में, उसी वीडियो में मान लें creator script खुद लिखता है, लेकिन उसे लगता है कि वह अच्छा नहीं लिखता, या English उसकी native language नहीं है इसलिए grammar errors बहुत हैं। इसलिए वह script GPT को देता है और सिर्फ grammar ठीक कराने के बजाय “popular video की script बनने” जैसा goal देकर उसे improve कराता है। इसके बाद वह review करता है कि जो core बात वह पहुँचाना चाहता था, वह पहुँची या नहीं, और voice generation करता है। क्या यह AI generated है?
मेरे लिए ये सभी मामले ठीक हैं, और पूरी तरह human workflow से बनाए गए काम से inferior नहीं हैं। अगर creator इंसान है और उसे लगता है कि वह जो कहना चाहता था, वह पहुँचा रहा है, तो इतना काफी है
मैं blog post का draft GPT को भेजकर अपने बदले लिखवाना चाहता हूँ। अभी ऐसा न करने की वजह यह है कि output में मेरी “voice” नहीं होती। उसमें वह बात आ सकती है जो मैं कहना चाहता था, लेकिन writing style पूरी तरह अलग होता है। अगर GPT/Claude मेरी style की बेहतर नकल कर सके, तो मैं तुरंत इस्तेमाल करूँगा। अंतहीन editing पसंद करने वाले लोग बहुत कम हैं, और writers भी इसमें अपवाद नहीं हैं
scammers और black-hat search engine optimization करने वालों को पहले से Notebook LM का इस्तेमाल करके fake podcasts बड़े पैमाने पर बनाते और कई platforms पर distribute करते देखना निराशाजनक है
Google ने image search से actual image तक जाना या उसे download करना लगातार और मुश्किल बनाना शुरू किया, तो मैंने एक image search tool बनाया जिससे operating system shortcuts के जरिए Google image repository search करके जल्दी clipboard में copy किया जा सके। यह custom Google Search Engine ID इस्तेमाल करता है
करीब 1 साल पहले से पता चला कि results के 90% AI generated हैं, इसलिए “No AI” flag जोड़ा। यह मूल रूप से 2022 से पहले के results तक सीमित करने वाला तेज़ और rough filter है। perfect नहीं है, लेकिन अस्थायी उपाय के तौर पर काम करता है
https://github.com/scpedicini/truman-show