4 पॉइंट द्वारा GN⁺ 2023-07-23 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • World of Warcraft कम्युनिटी ने जानबूझकर एक ऐसी Glorbo अपडेट कहानी गढ़ी जो वास्तव में मौजूद ही नहीं थी, और Reddit पोस्ट को ऑटोमैटिक रीप्रोसेस करने वाली zleague.gg ने उसे असली खबर की तरह प्रकाशित कर दिया
  • zleague.gg Reddit थ्रेड्स को AI से summarize करके “key takeaways” और तयशुदा पैराग्राफ़ों के साथ लंबे लेख बनाता था, ताकि Google search exposure हासिल किया जा सके
  • r/WoW यूज़र्स ने 1994 से Hearthstone के संकेत, Klikclac, Halfhill Market, और Klaxxi को playable race बताने जैसी काल्पनिक और विकृत बातें मिलाकर बॉट को फँसा दिया
  • ऑटो-जनरेटेड लेख “World of Warcraft Players Excited For Glorbo’s Introduction” शीर्षक से पोस्ट हुआ, बाद में हटा दिया गया, और अब उसका archive mirror बचा हुआ है
  • यह सामने आया कि Reddit source देने के बावजूद, कम्युनिटी पोस्ट्स को AI में डालकर सीधे content बना देने वाली इस व्यवस्था में निगरानी और रोकथाम के उपाय लगभग नहीं हैं

Glorbo के नकली अपडेट के झाँसे में आई AI scraping साइट

  • World of Warcraft subreddit r/WoW के यूज़र्स ने समझ लिया कि zleague.gg Reddit पोस्ट्स scrape करके उन्हें AI से summarize कर ब्लॉग पोस्ट के रूप में प्रकाशित कर रही है
  • zleague.gg का मुख्य कारोबार gaming app था, और उसका सहायक ब्लॉग Reddit थ्रेड्स के आधार पर लेख बना रहा था
  • बॉट को धोखा देने के लिए यूज़र्स ने Glorbo के गेम में आने वाला एक लंबा थ्रेड लिखा
    • Glorbo वास्तव में World of Warcraft का कोई असली फीचर नहीं है
    • पोस्ट में “Hearthstone में 1994 से इसका संकेत दिया गया था” जैसी नकली पृष्ठभूमि जोड़ी गई
    • Dragonflight, Chen Stormstout, Karazhan जैसे असली गेम-संबंधित नाम मिलाए गए ताकि यह विश्वसनीय लगे

ऑटोमेटेड लेख में शामिल कल्पना और संचालन संबंधी समस्या

  • zleague.gg ने इस नकली थ्रेड के आधार पर “World of Warcraft Players Excited For Glorbo’s Introduction” शीर्षक वाला लेख अपने आप प्रकाशित कर दिया
  • प्रकाशित लेख के summary में कई ऐसी बातें थीं जो वास्तविकता से मेल नहीं खाती थीं
    • खिलाड़ी Glorbo की एंट्री और उसके गेम पर असर को लेकर उत्साहित हैं
    • ज़रूरी item Klikclac casual players को प्रभावित कर सकता है
    • Stormsong Valley के Halfhill Market और farming simulation minigame के नए स्थान बनने की अफ़वाह
    • Klaxxi को playable race के रूप में जोड़ने जैसे कथित पुराने बदलावों पर सकारात्मक प्रतिक्रिया
  • यह लेख कुछ समय तक ऑनलाइन रहा, फिर हटा दिया गया, और इसे archive mirror में देखा जा सकता है
  • साइट पर दिखने वाले author names सभी नकली लगते हैं, और पूरी व्यवस्था में लगभग कोई निगरानी नहीं दिखती
  • Reddit पोस्ट्स को quote करके और लेखक का नाम दिखाकर भी, कम्युनिटी पोस्ट्स को AI में ऑटोमैटिक डालकर उसका आउटपुट ज्यों-का-त्यों प्रकाशित करना एक अलग समस्या पैदा करता है
  • ऐसी साइटें Google search traffic को निशाना बनाती हैं, और जब तक Google AI-आधारित साइटों को नीचे रैंक नहीं करता या प्रतिबंधित नहीं करता, इन्हें रोकना मुश्किल है

1 टिप्पणियां

 
GN⁺ 2023-07-23
Hacker News की राय
  • मैं लगभग गेम खेलता ही नहीं और मेरे पास सिर्फ Nintendo Switch है, लेकिन नई Zelda खेलते समय जब कहीं अटक जाता हूँ तो सर्च करना पड़ता है
    सर्च रिज़ल्ट के टॉप 10 के आसपास आने वाली साइटों पर लगभग एक ही फ़ॉर्मैट के लेख दिखते हैं, और जवाबों की गलतियाँ तक एक जैसी साझा होती दिखती हैं
    ज़्यादातर Zelda टिप्स या FAQ साइटें मौलिक सामग्री नहीं लगतीं, बल्कि एक-दूसरे को AI से बार-बार उगलने वाली कचरा webring जैसी दिखती हैं
    कम से कम मैं ad blocker और JavaScript block का इस्तेमाल करता हूँ, इसलिए उन्हें ad revenue नहीं मिलता

    • गेम wiki और guide साइटें काफी समय से search engine optimization कूड़ाघर बनी हुई थीं
      शायद ad revenue की वजह से
      यह मानना मुश्किल है कि Google के पास यह तय करने के लिए डेटा नहीं है कि किस साइट को domain authority देनी चाहिए, लेकिन यह search engine optimization spam और search engines के बीच एक शत्रुतापूर्ण और लगातार चलने वाली लड़ाई है, यह बात समझ आती है
    • जब ChatGPT गेम से जुड़े सवालों के जवाब देता है, तब भी वह अजीब तरह से बहुत लंबा खींचता है, और किसी आसान सवाल का जवाब देने से पहले हैरान कर देने वाला लंबा introductory paragraph जोड़ देता है, जो मज़ेदार है
      यह उन ad sites से बहुत मिलता-जुलता है जो असली जवाब तक पहुँचने में बहुत देर लगाने वाला अजीब-सा शुरुआती टेक्स्ट ठूँस देती हैं
    • यह थोड़ा off-topic है, लेकिन जुड़ा हुआ है। ToTK accessibility, खासकर cognitive और sensory मामलों में, सच में बहुत खराब है
      इसलिए मुझे मजबूरी में ZD TotK map बार-बार इस्तेमाल करना पड़ता है: https://www.zeldadungeon.net/tears-of-the-kingdom-interactiv...
      किसी खास दुश्मन का स्थान याद रखना बिल्कुल भी मज़ेदार नहीं है। क्या किसी को सच में यह अच्छा लगता है? compendium यह रिकॉर्ड नहीं करता कि आपने किन दुश्मनों से कहाँ लड़ाई की थी, जबकि blood moon के हर चक्र में दुश्मन फिर से spawn हो जाते हैं
      मुझे एक और Savage Lynel Bow चाहिए, लेकिन याद नहीं कि Silver Lynel कहाँ देखा था। मैं सिर्फ Purah Pad sensor के उस धुँधले signal पर भरोसा करके, जो तब बजता है जब आप लगभग उसके ऊपर पहुँच चुके होते हैं, पूरा map नहीं खंगालना चाहता। क्या इसके लिए अलग से notes भी रखने चाहिए?
      logging feature का idea अच्छा है, लेकिन इसमें बहुत कुछ छूट जाता है। quest descriptions अक्सर अपर्याप्त होती हैं, और markers कई बार बस quest देने वाले व्यक्ति की location दिखाते हैं, इसलिए ज़्यादा मदद नहीं मिलती
      subtitles के लिए शुक्रिया, लेकिन समझ नहीं आता कि इतनी बड़ी मात्रा में हिस्से बिना voice के क्यों चलते हैं
      मैं PC पर खेल रहा हूँ, इसलिए व्यक्तिगत रूप से मुझे फर्क नहीं पड़ता, लेकिन फिर भी यह सवाल है कि button mapping क्यों नहीं है
      internal FSR और AA बंद करके कभी-कभी धुँधली आलू-जैसी image quality पर गिरने से बचा भी लें, तब भी अगर साफ़ न हो कि कहाँ देखना है, तो अच्छी नज़र होने पर भी चीज़ें ढूँढना मुश्किल होता है। Ultrahand की चमक कुछ मदद करती है, लेकिन यह बहुत खराब समाधान है
      color blindness settings भी नहीं हैं। आखिर कर क्या रहे हैं?
      इस शानदार गेम को कहीं ज़्यादा accessible बनाने के इतने मौके बेकार गँवा दिए गए। Nintendo ने साफ़ दिखा दिया कि उसे accessibility की परवाह नहीं है, और यह सच में अफ़सोस की बात है क्योंकि accessibility सबके लिए बेहतर अनुभव बनाती है
    • Kagi में ऐसी कचरा साइटें काफ़ी साफ़ पहचान में आ जाती हैं, इसलिए मैं बस उन्हें block कर देता हूँ
      इस क्षेत्र में जो जगहें कुछ हद तक भरोसेमंद थीं, वे GameFAQs, IGN, और गेम मैगज़ीन जैसी साइटें थीं
    • यह सच में दुखद है। बचपन में GameFAQs लगभग अकेला ही स्रोत था, इसलिए मैं वहाँ अक्सर जाता था, और Google पर भी उसके guides अच्छी तरह दिख जाते थे
      साइट अब भी मौजूद है, लेकिन अब Google पहले 20 ad से लदी हुई साइटें दिखाता है, जहाँ 5 मिनट के walkthrough का एक हिस्सा देखने के लिए भी listicle जैसी पोस्टों में नई pages पर बार-बार क्लिक करना पड़ता है
  • Haha, मैंने https://meat-gpt.sonnet.io बनाया। यह घटिया AI startups का मज़ाक उड़ाने के लिए बनाई गई साइट है, लेकिन यह कैसे करती है, उसका spoiler नहीं दूँगा
    आजकल मेरे traffic का एक बड़ा source, कभी-कभी 70~80% तक, ऐसे घटिया AI app catalogs हैं। वे सिर्फ मेरे MeatGPT को include ही नहीं करते, बल्कि यह सेवा क्या करती है, उसका खूबसूरती से बेवकूफ़ाना hallucinated description भी गढ़ लेते हैं
    सच कहूँ तो यह इससे बेहतर काम कर ही नहीं सकता था। वे मेरी साइट से रस टपकाते मांस के टुकड़े उठा ले जाते हैं और फिर खुद के चेहरे पर मारते हुए चिल्लाते हैं, “और दीजिए”
    मुझे generative art पसंद है और मैंने self-published medieval content farm भी बनाया है[1], लेकिन इसमें तो बस कई साइटों में अपने-आप लेख लिखे जा रहे हैं
    [1] https://tidings.potato.horse

    • अब मुझे पूरी तरह यक़ीन हो गया है कि alignment problem जैसी कोई चीज़ है
  • मुख्य बात यह वाक्य है:

    But again, there’s nothing to stop this. These subreddits can’t only fill themselves with joke articles to screw up a site like this, even if this one specific example is good for a laugh.
    ज़्यादातर थ्रेड्स सामान्य बातचीत ही होंगे, और reddit जैसी discussion sites ख़बरों को “मुफ़्त” में summarize और generate करने के लिए एक आसान source बन सकती हैं।
    मुझे लगता है HN को भी tech news के source की तरह इस्तेमाल किया जा सकता है। बस target post को summarize करो, और thread के top comments का सारांश और overall mood जोड़ दो।
    मैं यह करने वाला हूँ, ऐसा नहीं कह रहा, लेकिन अगर यह बात मेरे दिमाग में आई है तो संभव है कि कोई न कोई इसे काफ़ी आगे तक पहले ही आज़मा चुका हो।

    • HN और real world, दोनों जगह मैं यह बात बार-बार सुनता हूँ, लेकिन पत्रकार के नज़रिए से देखें तो इसमें रिपोर्टिंग की वैल्यू छूट जाती है, इसलिए बात कुछ हद तक चूक जाती है।
      कुछ news तो केवल Reddit thread जैसी चीज़ों को scrape करके बनाई जा सकती हैं, लेकिन ज़्यादातर अच्छी journalism में भरोसेमंद sources से नई जानकारी निकालने वाली reporting शामिल होती है।
      रिपोर्टिंग न भी हो, तब भी अगर कोई लेख लिखकर दुनिया के knowledge store में कुछ जोड़ा नहीं जा रहा, तो वह consumers या advertisers, किसी के लिए भी वैल्यू नहीं रखता। SEO spam की दुनिया में भी यही सच है। ऊपर आने के लिए competitors से अलग दिखने की कोशिश करनी ही पड़ती है।
      Reddit threads अक्सर इस तरह पहले से बनी खबरों पर भावनात्मक प्रतिक्रियाओं से भरे होते हैं। किसी बिंदु पर इंसान बाहर जाकर दूसरे इंसानों से बात करते हैं, नया angle या thesis बनाते हैं, सवालों का पीछा करते हैं, और उन बिंदुओं को जोड़ते हैं जिन्हें अभी तक किसी ने नहीं जोड़ा। वही news है, पहले से मौजूद रुखों का summary नहीं।
    • मैंने एक website बनाई थी जो इस तरह काम करती थी: 400 से अधिक votes वाले HN posts चुने जाते थे, titles की list जुटाई जाती थी, फिर AI से कहा जाता था कि tech से असंबंधित items (Bay Area topics, politics वगैरह) छाँट दे, और चुनी गई posts को scrape करके summary लिखकर एक static website पर publish किया जाता था।
      दूसरे sources के रूप में reddit subreddits, RSS feeds, official language blogs, और GitHub release pages का इस्तेमाल होता था।
      AI को काफ़ी आसानी से बेवकूफ़ बनाया जा सकता है। अगर उसे ज़्यादा context दिया जाए और एक review step जोड़ा जाए जो देखे कि editorial rules माने जा रहे हैं या नहीं, तो इससे बचा जा सकता है।
      एक और बात जिस पर सोच रहा हूँ, वह यह है कि सस्ते model (gpt-turbo-3.5) से लेख लिखवाए जाएँ और ज़्यादा परिष्कृत model (gpt4) से उनकी review कराई जाए।
    • भले आप comments को सिर्फ summarize नहीं करना चाहते हों, फिर भी ज़्यादातर article comment sections को विषय पर crowdsourced research की तरह देखा जा सकता है।
      यहाँ दिलचस्प चर्चाएँ पढ़ने के बाद, संबंधित articles, books वगैरह की छोटी list, और अक्सर सीधे संबंधित लोगों से आई जीवंत व्याख्याएँ भी आसानी से मिल जाती हैं।
    • यह मैं anonymous होकर लिख रहा हूँ। ऐसी चीज़ें करने वाले startups सच में मौजूद हैं, और मैं ज़्यादा detail में नहीं जा सकता।
      जानकारी आज़ाद होना चाहती है। अभी यह एक browser plugin है जो DOM को पढ़कर tags लगाने देता है, और वही human work training system में feed होता है।
      शुरुआत का idea Twitter Community Notes को एक independent browser plugin की तरह बनाने से आया था, और बाद में यह user के web browse करते समय DOM पढ़ते हुए दिखने वाले model training तक फैल गया।
      API hit नहीं किया जा रहा, तो शायद कोई fee भी नहीं लगती? interaction चुनने वाला तो user ही है।
      doom scrolling जैसा दिखने के लिए train किए गए AI को रोकने की defense शायद सिर्फ rate limiting ही होगी।
    • शायद सिर्फ ऐसे posts ही नहीं डाले जा सकते, लेकिन AI writers को इंसानों जैसा पेश करने वालों को शर्मिंदा ज़रूर किया जा सकता है।
      कम से कम यह किसी न किसी तरह mark होना चाहिए कि वह लेख AI ने लिखा है। नहीं तो इस trick का इस्तेमाल ऐसे लोगों को embarrass करने में किया जा सकता है जिन्हें लोग human author मानते रहे हों।
  • यह मामला सिर्फ इस एक site से आगे बढ़कर कई game news sites में हो रहा है।
    मैं Google News feed में नियमित रूप से Reddit threads का summary बनाने वाले लेख देखता हूँ; उनकी reporting accuracy संदिग्ध होती है और वे साफ़ तौर पर AI-generated लगते हैं।
    फिर भी, जब वे ठीक से काम करते हैं, तो काफ़ी उपयोगी और timely होते हैं।
    ठीक-ठाक generative text AI आए हुए लगभग एक साल हो गया है, तो अब मैं उस दिन की कल्पना करने लगा हूँ जब मैं किसी device से internet access किए बिना किसी AI voice को फ़ोन करके सिर्फ यह सुनूँ कि कोई urgent email है या नहीं, या फिर सिर्फ उन खबरों का सारांश जो मुझे सच में मायने रखती हैं।
    web उस चीज़ से बदल गया है जिसे मैं सच में प्यार करता था, और अब वह एक abusive relationship जैसा बन गया है जो रोज़मर्रा की ज़िंदगी में इतना गहरा धँस चुका है कि उससे अलग होना मुश्किल है।
    मैं ऐसे AI intermediary का स्वागत करता हूँ जो SEO spam, clickbait headlines, और बेकार comments को मेरी जगह पढ़कर छाँटे, और फिर सिर्फ वही चीज़ें काम की तरह synthesize करके दे जो मेरे लिए महत्वपूर्ण हैं।

    • AI agent के बिना online जाना COVID के समय mask के बिना घूमने जैसा हो जाएगा।
  • दिलचस्प है। यह मुझे 80s के hacker के रूप में मिले counterculture अनुभव से काफ़ी मिलता-जुलता लगता है।
    “The Man” के ख़िलाफ़ लड़ने वाली भावना अब “The AI” के ख़िलाफ़ भी जारी रह सकती है। game nerds ने अच्छा काम किया।

    • मुझे लगता है कि आख़िरकार यह दिखाता है कि उस चीज़ के निर्माता, इस बार AI creators, ने इस संभावना का कितना कम सम्मान किया कि आम लोग इसका दुरुपयोग करेंगे।
      आम जनता को इससे फ़र्क नहीं पड़ता कि developers चाहते क्या हैं कि इसे कैसे इस्तेमाल किया जाए। जनता की दिलचस्पी इस बात में होती है कि वे इससे क्या-क्या करवा सकते हैं।
      hot-rodding, overclocking, और ऐसे अनगिनत उदाहरण देख लीजिए।
    • लगता है हर बार जब कोई नया और पर्याप्त रूप से शक्तिशाली tool आता है, तो यही सब दोहराया जाता है।
      जो लोग hierarchy से कम बँधे होते हैं, वे तेज़ी से move कर सकते हैं, और वे सच में ऐसा करते भी हैं। जब कोई बड़ा बदलाव आता है, तो वे उस gap में घुसकर काफ़ी नुकसान पहुँचा सकते हैं, और बड़े संगठनों को बाद में catch up करना पड़ता है, जिसके बाद वे उन चीज़ों को मज़बूत करने में resources झोंकते हैं जिन्हें वे flaws मानते हैं—आम तौर पर ऐसी हर चीज़ जो किसी system या connecting parts पर उनका control कम करती हो।
      उम्मीद है आगे चीज़ें और तेज़ और और ज़्यादा chaotic होंगी। सबसे अच्छे नतीजे तब आते हैं जब empowered लोग पैसे के लिए नहीं बल्कि लगाव के कारण पूरे जोश से कूद पड़ते हैं।
  • traffic के लिए बेताब spam site का अब viral हुए post को delete करना कुछ अजीब चाल लगती है।

    • सही है। लेकिन दूसरी ओर, यह made-for-advertising content (MFA) है।
      इसमें सबसे बुरा असर बदनामी नहीं, बल्कि Google या programmatic ad market की blacklist में जाना है। पहला traffic मार देता है, दूसरा monetization की क्षमता ख़त्म कर देता है।
      विडंबना यह है कि घटिया AI content के ख़िलाफ़ जंग शायद ad tech कंपनियाँ लड़ेंगी, क्योंकि उन्हें यह भरोसेमंद दावा करना होगा कि उनके ग्राहक बेकार ad inventory पर पैसा बर्बाद नहीं कर रहे।
    • वे चाहे जैसे भी पैसे कमा रहे हों, इस संदर्भ में आने वाले visitors के convert होने की संभावना कम है।
      कम से कम post हटाने से reputation damage भी थोड़ा कम होता है।
  • कल Linux पर वीडियो स्थिरीकरण ऑप्शन ढूंढते समय, एक लेख देखकर हैरानी हुई जो बहुत आत्मविश्वास से एक ऐसे टूल का वर्णन कर रहा था जिसे ffmpeg के “लेखक” मेंटेन करते हैं
    इसलिए मैंने खोजा, लेकिन वह मिला नहीं; नाम को उद्धरण चिह्नों में डालकर सर्च किया तो पता चला कि उसका ज़िक्र सिर्फ उसी कंपनी के लिखे 3 लेखों में था

    • यह सचमुच शुरू हो चुका है। मतिभ्रम से भरा LLM-जनित कंटेंट वेब पर छाता जा रहा है
      सिग्नल-टू-नॉइज़ अनुपात इतना गिर जाए कि बेकार और काम की चीज़ में फर्क करना लगभग असंभव हो जाए, तो इंटरनेट जल्द ही पूरी तरह बेकार हो जाएगा
      वह AI transformer पेपर सच में Pandora's box था
  • उम्मीद है Warcraft डेवलपर्स अब भविष्य में आने वाले असली additions में से किसी एक का नाम Glorbo रखेंगे

    • अगर Blizzard अभी भी April Fools' jokes करता है, तो अगले साल का मटेरियल तो पहले से तैयार है
  • अभी भविष्यवाणी करता हूँ। Glorbo अगले patch में होगा

  • यह पोस्ट भी शिकायत करने वाली AI पोस्टों जैसी ही, लगभग हूबहू वैसी ही बेकार चीज़ है
    यह बस reddit थ्रेड को आधार बनाकर लिखा गया एक अख़बारी लेख है