2 पॉइंट द्वारा GN⁺ 2024-07-16 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • Kevin Bankston ने दावा किया कि जब उन्होंने Google Drive/Docs में निजी दस्तावेज़ खोले, तो Gemini ने बिना अनुरोध किए उनका सारांश बना दिया, जिससे Workspace AI सुविधाओं के default व्यवहार और उपयोगकर्ता सहमति की सीमा पर विवाद खड़ा हो गया
  • मामला Bankston के tax return PDF उदाहरण से शुरू हुआ, और बाद में मुद्दे का फोकस Google Docs की बजाय Google Drive में खोली गई files के व्यवहार तक सीमित हो गया
  • संबंधित settings जांचने पर भी Gmail, Drive और Docs में Gemini summaries toggle पहले से बंद था, और Gemini ने जिस settings location का निर्देश दिया था वह भी असल location से अलग था, जिससे उपयोगकर्ताओं के लिए यह समझना मुश्किल हो गया कि नियंत्रण की स्थिति क्या है
  • Bankston ने देखा कि Drive में किसी दस्तावेज़ पर Gemini button दबाने के बाद जब उसी file format के दस्तावेज़ खोले जाते हैं, तो Gemini अपने-आप चलने लगता है
  • Google ने जवाब दिया कि Workspace data training में इस्तेमाल नहीं होता और stored नहीं किया जाता, लेकिन Drive के Gemini side panel की स्थिति और summary settings के संबंध को लेकर उपयोगकर्ताओं को खुद जांच करनी पड़ती है, यह मुद्दा बना हुआ है

निजी दस्तावेज़ से शुरू हुआ Gemini auto-summary विवाद

  • Kevin Bankston ने X पर पोस्ट किया कि Google Docs में अपना tax return खोलने पर Gemini ने बिना अनुरोध किए उसका सारांश बना दिया
  • उन्होंने सवाल उठाया कि क्या Gemini Google Docs में खोले गए निजी दस्तावेज़ों को automatic रूप से process कर रहा है, और चिंता जताई कि users को कोई ऐसी setting ढूंढकर बंद करनी पड़ सकती है जिसके बारे में उन्हें पता ही नहीं था
  • बाद में संदर्भ Google Docs की बजाय Google Drive के अंदर खोले गए दस्तावेज़ों के अधिक करीब माना गया
    • दस्तावेज़ का प्रकार PDF था
    • यह संभावना बनी हुई है कि यह Docs पर भी लागू हो सकता है

बंद summary toggle और उलझाने वाली settings guidance

  • Bankston ने कहा कि उन्होंने Gemini द्वारा बताए गए privacy settings को खोजने की कोशिश की, लेकिन वास्तविक location पर वह setting नहीं मिली
  • बाद में संबंधित toggle देखने पर Gemini summaries in Gmail, Drive, and Docs पहले से disabled था
  • Settings location भी उन दो webpages से अलग था जिनका Gemini bot ने शुरुआत में निर्देश दिया था
  • इस अनुभव से संवेदनशील निजी जानकारी पर user control की कमी को लेकर चिंताएं बढ़ीं

Drive में file format के आधार पर दिखा auto-run pattern

  • Bankston को दिखी समस्या Google Drive तक सीमित लगती है
  • कम से कम एक दस्तावेज़ में Gemini button दबाने के बाद, उसी file format के दस्तावेज़ खोलने पर Gemini अपने-आप चलने जैसा pattern देखा गया
    • मामले में file format PDF था
    • इसके बाद Google Drive में खोली जाने वाली उसी format की files auto-trigger के दायरे में आ गईं
  • Bankston ने यह संभावना भी जताई कि 2023 में enable किया गया Google Workspace Labs intended Gemini AI settings को override कर गया हो

Google का जवाब और data protection पर स्पष्टीकरण

  • Google spokesperson ने बताया कि generative AI features को user choice और data control देने के लिए design किया गया है
  • Google का रुख है कि Gemini in Google Workspace इस्तेमाल करने के लिए user का पहले से activation जरूरी है
  • यदि user ने इसे activate किया है, तो content prompts के लिए उपयोगी responses generate करने में privacy-protecting तरीके से इस्तेमाल होता है, और अनुमति के बिना अलग से store नहीं किया जाता
  • Google ने Workspace data protection से जुड़े blog post के जरिए बताया कि Workspace data collect नहीं किया जाता और training में इस्तेमाल नहीं होता
  • कंपनी ने जोड़ा कि feature on होने पर खुले हुए document की contents को summarize किया जा सकता है, लेकिन वह content retain नहीं किया जाता

Side panel solution और user पर बची verification की जिम्मेदारी

  • Google ने सुझाव दिया कि Bankston ने Drive का Gemini side panel इस्तेमाल किया हो सकता है, और panel बंद करने से समस्या हल हो सकती है
  • Bankston के अनुभव में संबंधित summary settings पहले से बंद थीं, इसलिए user की अपेक्षित disabled स्थिति और actual behavior के बीच अंतर बना रहा
  • Google Drive में stored sensitive documents खोलते समय users को Gemini feature की activation state, side panel state और file format के हिसाब से behavior खुद verify करना पड़ रहा है

1 टिप्पणियां

 
GN⁺ 2024-07-16
Hacker News की राय
  • यह फिर दिखाता है कि cloud provider पर अपलोड किया गया डेटा आखिरकार मेरे अपने डेटा जैसा नियंत्रित नहीं रहता
    इस बार साफ संकेत था, लेकिन मेरा मानना है कि Google सिस्टम बहुत पहले से निजी दस्तावेज़ों के अंदर का डेटा पढ़कर aggregate करते रहे होंगे
    यह चिंता 20 साल पहले Gmail शुरू होने के समय से ही उठी थी; तब लोग इस विचार से चौंक गए थे कि “Google विज्ञापन दिखाने के लिए email पढ़ता है”, लेकिन 1GB inbox और नया UI काफी असरदार दलील थे
    बाद में Google Drive वगैरह में उन्होंने इसे कम डरावना या कम खुला दिखाना सीख लिया, और शायद enterprise customers का पैसा चाहना भी इसकी वजह रहा होगा

    • Google का निजी दस्तावेज़ों का डेटा पढ़ना और aggregate करना स्वाभाविक है
      वरना वे document search कैसे देंगे, यही सवाल है
    • cloud provider के पास मौजूद डेटा के मामले में मैं ProtonDrive पर ज़्यादा भरोसा करता हूं
      क्योंकि वह transit में और storage में, दोनों जगह encrypted होता है
      Apple भी अब ज़्यादातर डेटा को transit और storage में encrypt करता है, और कौन-सा डेटा protected है, यह भी document करता है
      हालांकि मुझे यकीन नहीं कि भविष्य की Apple मेरे डेटा को public model training के लिए इस्तेमाल करना चाहेगी या नहीं
      Apple के pretrained core large language model में local training आधारित replaceable fine-tuning layer जोड़ने वाला design privacy के लिहाज़ से ठीक लगता है, लेकिन असल में पक्का नहीं कह सकता
      Google Drive पर मेरा भरोसा कम है, क्योंकि मैंने Colab Pro और कुछ third parties को Drive access दिया है; और अगर यह पोस्ट सही है तो भरोसा और घटेगा
      शुरुआती Gmail वाली तुलना सही है
      Gmail public होने से 3 साल पहले Peter Norvig से private invite पाकर मैंने इसे इस्तेमाल किया था, और उस समय Gmail के बगल में दिखने वाले highly relevant ads मुझे पसंद आए थे
      साथ ही, Workplace जैसे माहौल में integrated large language model की उपयोगिता आज़माने के लिए मैंने Google AI Plus या जो भी नाम था, उस 20 डॉलर महीने वाली service को भी अपनी पूरी Google assets access दे दी थी
      आखिरकार Google services में privacy मैंने खुद ही स्वेच्छा से छोड़ दी
    • “Google सिस्टम बहुत पहले से निजी दस्तावेज़ों के अंदर का डेटा पढ़कर aggregate करते रहे हैं” वाली बात सही है, क्योंकि search इसी तरह काम करता है
      लेकिन अगर इशारा यह है कि सभी का private data scrape करके large language model में डाल दिया गया, तो यह साफ तौर पर conspiracy theory है
      यह मानना हैरान करने वाला है कि Google ने हजारों engineers को मना लिया कि वे सभी के private data के दुरुपयोग वाली एक विशाल साज़िश को चुपचाप छिपाए रखें
    • Expedia पर booking करते ही itinerary email Gmail में आई, और कुछ मिनट बाद Android home screen पर Google के travel product को setup करने के लिए native call button आ गया
      बाद में मैंने Android छोड़ दिया, लेकिन Gmail छोड़ना ज़्यादा मुश्किल है
  • सभी AI के लिए training और scanning, दोनों में explicit consent होना चाहिए
    user को खुद “मैं AI features इस्तेमाल करना चाहता/चाहती हूं” वाला checkbox चुनना चाहिए, और उसके अर्थ को समझाने वाला text भी बहुत स्पष्ट होना चाहिए
    इसे अनिवार्य और enforce किया जाना चाहिए, और न मानने वाली companies पर सख्त जुर्माना लगना चाहिए

    • training की बात समझ में आती है, लेकिन scanning तक में समस्या क्यों है, यह समझ नहीं आता
      यह सचमुच सिर्फ मेरे data पर algorithm चलाकर result मुझे दिखाना है
      मूल रूप से यह spell check या heading styles से table of contents auto-generate करने से अलग नहीं है
      अगर result सिर्फ मेरे लिए private रहता है, जैसा कि इस मामले में भी है, तो चिंता किस बात की है समझ नहीं आता
      algorithm का large language model based होना privacy या security से संबंधित नहीं है
    • AI नया social media बनता जा रहा है
      users customer नहीं, product हैं
      social media company के लिए ads बेचने वाला data बनाने के बजाय अब AI training के लिए data बनाया जा रहा है, और बदले में service मुफ्त इस्तेमाल करने को मिलती है
    • “scan” से ठीक-ठीक क्या मतलब है, यह जानना चाहता हूं
      लगता है बात training के लिए नहीं, बल्कि document को अस्थायी रूप से पढ़कर summary देने की है; यह regulation के दायरे में क्यों होना चाहिए, समझ नहीं आता
    • publicly accessible files को AI training dataset से बाहर रखने के लिए robots.txt extension भी चाहिए
      याद है कि ai.txt नाम की एक शुरुआती कोशिश थी, लेकिन अभी कौन इसे मानता है, ठीक से नहीं पता
    • AI training का privacy impact असल में क्या है, यह जानना चाहता हूं
  • यह पोस्ट साफ तौर पर गलतफहमी पैदा करने वाली लिखी गई है, इसे अलग रखते हुए, पोस्ट में बताए गए tweet thread में share किए गए links को संक्षेप में रख रहा हूं
    Gemini activity management: https://myactivity.google.com/product/gemini
    Google Workspace और कई Google apps के opt-out से जुड़े ज़्यादातर जवाबों वाला page: https://support.google.com/docs/answer/13447104#:~:text=Turn...

  • title इस मामले को थोड़ा अस्पष्ट बना देता है
    Gemini से document summarize करने को कहें तो उसका summarize करना हैरानी की बात नहीं है
    यहां “scan” शब्द ज़रूरत से ज़्यादा बड़ा role निभा रहा है, और title से ऐसा लगता है जैसे Google private documents से Gemini को train कर रहा हो
    असली मुद्दा यह है कि user को लगा था कि उसने इसे स्पष्ट रूप से बंद कर रखा है, फिर भी private document को input के रूप में लेकर Gemini चला और उसने summary बनाई
    फिर भी settings का पालन न होना Google infrastructure का एक महत्वपूर्ण bug है, और जो लोग नई पीढ़ी के AI इस्तेमाल के पूरी तरह खिलाफ हैं, उन्हें अपनी exit strategy पर फिर से नज़र डालने लायक है

    • जब Gemini से किसी एक PDF को summarize करने को कहा जाए, तो उस PDF का summarize होना हैरान करने वाला नहीं है
      लेकिन अगर एक बार किसी एक PDF को summarize करने को कहने पर Drive में मौजूद सभी PDF Gemini summarize करने लगे, तो वह हैरान करने वाली बात होगी
  • लगता है title misleading है
    मुझे लगा था कि training या testing के लिए scan किया गया होगा, लेकिन यह तो user जो लेख देख रहा है उसे summarize करने वाला feature था
    इसलिए “caught” शब्द dishonest है
    कोई व्यक्ति वही काम कर रहा हो जिसके बारे में उसने बता रखा है, तो उसे “पकड़ा गया” नहीं कहते

    • permission बंद थी, इसलिए document के साथ जो भी किया गया, वह बिना अनुमति किया गया
      title सही है
  • कोई Google model से कोई मूल्यवान चीज़ निकाल ले, यह बस समय की बात है
    यह bank password या cryptocurrency keys जैसी चीज़ हो सकती है
    glue pizza incident दिखाता है कि ये लोग बस आधे-अधूरे ढंग से आगे बढ़ा रहे हैं

  • यह कोविड के दौरान स्वास्थ्य डेटा को लेकर हुई छीना-झपटी जैसा ही है
    कई समूहों ने संकट का फायदा उठाकर डेटा को एक बार ट्यूब से बाहर निचोड़ लेने की कोशिश की, और कुछ सफल भी हुए
    क्योंकि फटकार झेलने की लागत कम है और डेटा हासिल करने की वैल्यू बड़ी है
    मूल रूप से यह ब्यूरोक्रेटिक झपटमारी है
    privacy क्षेत्र में काम कर चुके लोगों के लिए यह निराशाजनक है, लेकिन अनुमानित भी; ज़्यादातर लोग हैरान होने का दिखावा करके आगे बढ़ जाएंगे
    क्योंकि उनके करियर इस बात पर निर्भर करते हैं कि वे बेतुकी “अच्छी नीयत” वाली कहानी को बनाए रख सकें
    AT&T से hack हुए SMS messages अगला मामला हो सकते हैं, और अगर मोबाइल फोन की key presses लीक हो जाएं या commercial platforms के OS updates में model training के लिए collection agent जोड़ दिया जाए, तो भी सब इसी तरह हैरान होंगे
    बेशक, इसे user satisfaction के लिए privacy enhancement जैसी पैकेजिंग भी दी जाएगी
    अगर इस काम को बनाने वाले product managers और engineers को उदाहरण बनाकर जवाबदेह नहीं ठहराया गया, तो अगली बार यह और खराब और बड़े पैमाने पर दोहराया जाएगा

  • मूल tweet और यह लेख जानबूझकर terms को उलझाकर गलत समझ पैदा कर रहे हैं
    वे ऐसा दिखाना चाहते हैं मानो large language model का किसी तरह document तक पहुंचना और उस document का model के training dataset में शामिल होना एक ही बात हो
    यही लेख और मूल tweet का bait point है, लेकिन tweet thread अंत में फर्क मानने के बाद AI feature के अस्तित्व पर ही गुस्सा करने की दिशा में मुड़ जाता है
    इस कहानी में, AI popup से नाराज एक Twitter user द्वारा rage-bait thread लिखकर इसे कहीं ज्यादा भयावह दिखाने के अलावा कोई ठोस बात नहीं है

  • खासकर HN पर भी, असल में क्या हो रहा है इसे लेकर इतने लोगों का सफलतापूर्वक गुमराह हो जाना हैरान करने वाला है
    क्या अब भी ऐसे लोग बचे हैं जो पोस्ट करने से पहले लेख पढ़ते हैं?

  • क्या यह हैरानी की बात है कि Google privacy और data access के मामले में पर्याप्त दूर तक नहीं गया?
    वह बातें तो करता है, लेकिन कभी उस हद तक नहीं जाता जहां उसकी अपनी services data तक पहुंच ही न सकें
    दूर से store किया गया हर data ऐसा होना चाहिए जिसे server decrypt न कर सके और जो सिर्फ हमारे devices पर ही decrypt हो
    वरना हम कंपनी को अपनी इच्छा के मुताबिक data mine करने की छूट दे रहे हैं, और हमें यह जानने का कोई तरीका नहीं कि वे क्या कर रहे हैं
    बेशक, यह मानने की समस्या बचती है कि वे सच में decrypt नहीं कर सकते, और इसका कोई अच्छा समाधान नहीं है
    personal data पर AI access device के अंदर ही process होना चाहिए; और अगर server processing जरूरी हो, तो उम्मीद करनी चाहिए कि यह short-term issue हो, साथ ही साफ बताया जाना चाहिए कि data device से बाहर भेजा जा रहा है
    भले ही अभी इसका इस्तेमाल model training में न हो रहा हो, यह सोचना अव्यावहारिक नहीं है कि Gemini या किसी remote server से गुजरा data log होकर बाद में additional training में इस्तेमाल हो सकता है, या plaintext logs में पड़ा रह सकता है, या testers उसे देख सकते हैं

    • आखिर इसी बिंदु पर सब कुछ ढह जाता है
      अंत में ढांचा यही बनता है कि कंपनी कहती है “हम पर भरोसा करें”, और यह बहुत स्पष्ट है कि कंपनियां इस तरह की चीजें सौंपने के लिए भरोसेमंद नहीं हैं