1 पॉइंट द्वारा GN⁺ 2023-12-16 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • Dropbox के नए AI फीचर पर विवाद इस चिंता से बढ़ा कि सौंपकर रखी गई निजी फाइलें OpenAI की training में इस्तेमाल हो सकती हैं, और Dropbox ने इसका कड़ा खंडन किया
  • फीचर on-demand summaries और Retrieval-Augmented Generation (RAG) आधारित “अपने data से chat” है, लेकिन AI privacy में सिर्फ मोटे तौर पर दी गई व्याख्या से भरोसा जीतना मुश्किल है
  • AI toggle, जो default रूप से on दिख रहा था, और “बिना consent के training में इस्तेमाल नहीं करते” वाले सिद्धांत-वाक्य के मेल से users के लिए consent की सीमा को लेकर भ्रम पैदा हो सकता है
  • OpenAI भले कहे कि “API के जरिए submit किया गया data training में इस्तेमाल नहीं होता,” फिर भी कई users इस पर भरोसा नहीं करते; यह Facebook के microphone eavesdropping ads वाले विश्वास जैसी अविश्वास की संरचना बनाता है
  • AI कंपनियों को training data और processing तरीकों पर पारदर्शी व्याख्या देकर भरोसा फिर से बनाना होगा, और privacy चिंताओं के बीच local models एक ज्यादा आकर्षक विकल्प बन रहे हैं

Dropbox AI फीचर विवाद का मूल मुद्दा

  • Dropbox द्वारा नया AI फीचर जोड़ने के बाद यह आलोचना बढ़ी कि निजी फाइलें OpenAI को भेजी जा सकती हैं और model training में इस्तेमाल हो सकती हैं
  • मुख्य चिंता यह थी कि Dropbox में stored private files OpenAI के training data के रूप में इस्तेमाल होती हैं या नहीं, और Dropbox ने इसका कड़ा खंडन किया
  • यह फीचर on-demand summaries और “अपने data से chat” जैसे Retrieval-Augmented Generation (RAG) तरीके से बना है
  • बहुत सारा personal data संभालने वाली services में AI privacy की व्याख्या जरा भी अस्पष्ट हो तो भरोसा आसानी से खो सकता है

consent और settings की wording से पैदा हुआ भ्रम

  • Dropbox के AI principles में लिखा है कि वह customer trust और data privacy को आधार बनाता है, और consent के बिना customer data को AI model training में इस्तेमाल नहीं करता
  • account settings में AI से जुड़ा toggle था, और उन accounts में भी on state में दिख रहा था जिन्होंने इसे खुद कभी on नहीं किया था
    • लेख प्रकाशित होने के करीब 4 घंटे के भीतर वह settings link काम करना बंद कर गया
  • यह स्पष्ट नहीं है कि इस toggle को model training consent के रूप में समझा जाना चाहिए या नहीं
  • “consent” शब्द तब बहुत अस्पष्ट हो जाता है जब उसे terms पढ़े बिना accept कर देने की वास्तविकता के साथ देखा जाए
  • कई users ने इसे ऐसे समझा कि Dropbox को सुरक्षा के लिए सौंपा गया personal data OpenAI की training process में जा रहा है

OpenAI पर भरोसा न करने वाले users

  • Dropbox settings की wording third-party partner OpenAI के बारे में बताती है कि “data का इस्तेमाल internal model training के लिए कभी नहीं किया जाता, और third-party servers से 30 दिनों के भीतर delete कर दिया जाता है”
  • लेकिन कई users OpenAI के इस दावे पर भरोसा नहीं करते कि वह data को training में इस्तेमाल नहीं करता
  • विवाद Dropbox settings की समस्या से आगे बढ़कर पूरे AI जगत के trust crisis तक पहुंचता है
  • “OpenAI जो भी data देखता है, उसे training में इस्तेमाल करता है” वाली धारणा उसी तरह की जगह पर है जैसे “Facebook phone microphone से बातचीत सुनकर ads दिखाता है” वाला विश्वास

Facebook microphone eavesdropping conspiracy theory से तुलना

  • Facebook phone microphone से users की बातचीत सुनकर ads दिखाता है, यह theory लंबे समय से मौजूद है
  • technical रूप से इसका खंडन करने के कई आधार हैं
    • mobile operating systems apps को चुपके से microphone access करने की अनुमति नहीं देते
    • privacy researchers device और Facebook के बीच communication audit करके असल behavior की पुष्टि कर सकते हैं
    • बड़े पैमाने पर high-quality speech recognition को लगातार चलाना बहुत महंगा है
  • non-technical खंडन भी हैं
    • Facebook इसे नकारता है, और झूठ पकड़े जाने पर reputational risk बहुत बड़ा होगा
    • इसमें बहुत ज्यादा लोगों को शामिल होना पड़ेगा, इसलिए whistleblowing के बिना इसका जारी रहना मुश्किल है
    • Facebook के पास microphone eavesdropping के बिना भी ad targeting के कहीं सस्ते और प्रभावी तरीके पहले से हैं
    • हजारों ads देखते समय ऐसा संयोग हो सकता है कि कोई ad अभी-अभी कही बात से मेल खा जाए
  • अगर user को लगे कि उसने कुछ कहा और तुरंत बाद related ad देखी, तो ये खंडन अपना प्रभाव खो देते हैं
  • Reply All के November 2017 episode “109 Is Facebook Spying on You?” ने निष्कर्ष निकाला कि Facebook microphone से eavesdrop नहीं करता, लेकिन जो लोग पहले से विश्वास करते हैं उन्हें मनाना कठिन है

AI में black box अविश्वास बढ़ाता है

  • Facebook वाले मामले में users अपने personal experience के आधार पर मानते हैं कि उन्हें पता है कि क्या हो रहा है
  • AI में स्थिति लगभग उलटी है
    • models काफी हद तक black box जैसे हैं और गोपनीय रूप से बनाए जाते हैं
    • कौन सा training data इस्तेमाल हुआ, यह जानना मुश्किल है
    • training data ने model पर कैसे असर डाला, यह समझना भी कठिन है
  • users सबूतों से ज्यादा माहौल और intuition पर निर्भर होने लगते हैं, और अभी AI के आसपास का माहौल अच्छा नहीं है

trust crisis क्यों महत्वपूर्ण है

  • यह संदेह कि कंपनियां privacy handling के तरीकों के बारे में झूठ बोलती हैं, बहुत गंभीर है
  • ऐसा समाज स्वस्थ नहीं है जहां बड़ी कंपनियां data processing methods के बारे में खुलेआम झूठ बोलकर भी बिना किसी नतीजे के निकल जाएं
  • सरकार की महत्वपूर्ण भूमिकाओं में से एक है कि ऐसी चीजें न होने दे
    • अगर OpenAI ने उस data से training की जिसे उसने training में इस्तेमाल न करने को कहा था, तो उसे regulators के सामने खड़ा होना चाहिए या lawsuits का सामना करना चाहिए
    • अगर Facebook ने phone microphone से surveillance किया, तो उसे भी regulation और lawsuits का सामना करना चाहिए
  • बेबुनियाद conspiracy theories को सच मानने से असल corporate illegal conduct के प्रति समाज की intolerance भी कमजोर हो सकती है
  • privacy महत्वपूर्ण है, लेकिन आसानी से गलत समझी जाती है
    • लोग कंपनियों के काम और capabilities को कभी overestimate करते हैं और कभी underestimate
    • AI technology संभव सीमाओं को तेजी से बदल रही है, इसलिए इस क्षेत्र को अच्छी तरह जानने वालों के लिए भी इसे समझना कठिन है

OpenAI और AI research labs क्या कर सकते हैं

  • बड़े AI research labs अपने training methods को ज्यादा स्पष्ट रूप से सार्वजनिक कर सकते हैं
  • मुख्य सवाल यह है कि OpenAI किसे training data के रूप में इस्तेमाल करता है
  • फिलहाल जवाब पता नहीं है, और पूरी process बहुत opaque है
  • ऐसी स्थिति में OpenAI अगर कहे कि “API के जरिए submit किया गया data training में इस्तेमाल नहीं होता,” तब भी लोगों के लिए भरोसा करना मुश्किल है
  • ChatGPT खुद और जटिल है
    • OpenAI ChatGPT interactions का इस्तेमाल model improvement के लिए करता है
    • paid customers भी exception नहीं हैं; exception “inquiry-based pricing” वाला ChatGPT Enterprise है
  • जब कोई user private document को ChatGPT में paste करके summary मांगता है, तो अगले model update के बाद उस document का कोई हिस्सा दूसरे user के सामने आएगा या नहीं—यह तय करने के लिए ChatGPT data model improvement में कैसे इस्तेमाल होता है, इस पर ज्यादा explanation चाहिए
  • जिस तरह बड़े platform companies outage के बाद public postmortem जारी करती हैं, AI कंपनियां भी पारदर्शी explanations से भरोसा फिर से बना सकती हैं

local models का अवसर

  • इस विवाद में बार-बार दिखने वाला trend यह है कि users cloud-hosted models की तुलना में अपने device पर चलने वाले local models को data सौंपने में ज्यादा सहज महसूस करते हैं
  • local models की quality लगातार बेहतर हो रही है और उनका size भी कम हो रहा है
  • Mixtral-8x7b-Instruct laptop पर चल सकता था, और उसे पहली बार ऐसा local model माना गया जिसकी quality ChatGPT 3.5 जैसी लगती थी
  • Microsoft का Phi-2 2.7 billion parameter model है
    • कई useful local models 7 billion parameters से शुरू होते हैं
    • Phi-2 कुछ बड़े models की तुलना में state-of-the-art performance का दावा करता है
    • training cost लगभग 35,000 dollars लगती है
  • local models की potential बड़ी है, लेकिन गलत privacy चिंताओं के कारण बड़े और सुविधाजनक hosted models के फायदे खो देने वाली स्थिति से बचना चाहिए

AI और privacy चर्चा की शर्तें

  • AI और privacy का intersection एक महत्वपूर्ण मुद्दा है
  • high-quality discussion के लिए वास्तव में क्या हो रहा है, इस पर जितनी संभव हो उतनी transparency और समझ जरूरी है
  • जब कंपनियों की बातों पर सीधे भरोसा नहीं किया जाता, तो यह चर्चा और कठिन हो जाती है
  • कंपनियों को users का भरोसा जीतना होगा और users को यह समझने लायक बनाना होगा कि भरोसा क्यों किया जाए

1 टिप्पणियां

 
GN⁺ 2023-12-16
Hacker News की राय
  • वेबसाइट privacy protection में consent क्या है, इसकी लागू की जा सकने वाली और कानूनी रूप से स्पष्ट परिभाषा चाहिए
    ऐसा नहीं दिखना चाहिए कि user ने data collection, processing और third-party transfer के लिए सक्रिय रूप से सहमति दी है, जबकि असल में data पहले ही चुपके से process कर लिया गया हो और बाद में consent का दिखावा किया जा रहा हो

    • ऐसा concept पहले से है, और हमेशा से रहा है। उसका नाम fraud है
      अगर आपने किसी को धोखा देकर contract पर sign करवाया, तो वह contract fraud है; और अगर आप कहते हैं कि कोई काम करने से पहले permission लेंगे, लेकिन चुपचाप दावा करते हैं कि permission पिछले contract में पहले ही मिल चुकी थी, तो वह भी fraud है
      judicial system कब इतना कमजोर हो गया, पता नहीं, लेकिन इसका दोष उन नागरिकों पर नहीं डाला जा सकता जिन्हें protection नहीं मिल रही
    • अदालत जो भी निकालेगी, वह आम नागरिकों और companies के बीच की power asymmetry का फायदा उठाने वाला एक और lever बन जाएगा
      जरूरत यह है कि कानून को antitrust breakup और New Deal era वाली दिशा में वापस ले जाया जाए, खराब influence को कुचलकर फिर से बनाया जाए
    • Dropbox में login किया तो देखकर झटका लगा कि मेरा data किसी third-party “verified” AI company के साथ share करने की setting default on थी
      support team को WTF email भेजा है, लेकिन शायद account बंद ही कर दूंगा। ऐसा कौन-सा जवाब हो सकता है जिससे यह ठीक लगे, कल्पना नहीं कर पा रहा
    • GDPR में यह पहले से है। लेकिन companies भी परवाह नहीं करतीं और regulators भी नहीं
      बड़ी companies के पास बहुत ज्यादा power और influence है
  • लेख कुल मिलाकर अच्छा है, लेकिन “मेरा phone मेरी बातें सुनता है” और “OpenAI मेरे data का इस्तेमाल कैसे करता है, इस बारे में झूठ बोल सकता है” वाली तुलना थोड़ी flawed लगती है
    iPhone के microphone तक third-party apps की access के लिए मजबूत checks हैं, लेकिन जब मेरा data plaintext में किसी third party को जाता है, तो उसके बराबर कोई व्यवस्था नहीं है। आम लोगों को दोनों एक जैसे लग सकते हैं, फिर भी पहले मामले में protection मौजूद है
    इस फर्क पर जोर देना मामूली बात लग सकती है, लेकिन users की data privacy और sovereignty की लड़ाई पहले ही हार चुके हैं, ऐसा behave करना बहुत counterproductive है। अक्सर देखता हूं कि कुछ technical knowledge वाले cynical लोग companies के हर नए abuse पर “यह तो पहले से पता है” जैसा react करते हैं, मानो अगर आपने 10 साल से ज्यादा Tails Linux इस्तेमाल नहीं किया, तो अपनी home directory zip करके किसी संदिग्ध tech company और data brokers को भेज देना भी वही बात हो
    यह learned helplessness न सिर्फ trust को नुकसान पहुंचाती है, बल्कि यह impression भी देती है कि बेहतर दुनिया संभव नहीं है। Dropbox वाला मामला इसी सोच की वापसी जैसा लगता है। यह पागलपन है कि users को अगर यह संकेत भी मिले कि उनकी private files बिना पूछे third parties को भेजी जा रही हैं, तो भी वे परवाह नहीं करेंगे
    संदर्भ के लिए, मैंने अपना ज्यादातर data पहले ही Dropbox से निकालकर self-hosting की तरफ move कर दिया था, लेकिन कल की घटना account पूरी तरह बंद करने का अंतिम कारण बन गई। शुक्रिया, Dropbox

    • उस तुलना की खामी को लेख में address करने की कोशिश की गई थी
      Facebook वाले example में लोग मानते हैं कि अपने personal evidence के आधार पर वे समझते हैं कि क्या हो रहा है, जबकि AI के मामले में लगभग उल्टा है। AI models अजीब black boxes हैं, वे secret रूप से बनाए जाते हैं, और यह समझने का कोई तरीका नहीं कि training data क्या था या उसने model को कैसे प्रभावित किया
      इस बात से पूरी तरह सहमत हूं कि अभी सबसे बड़ा खतरा complacency है। जब लोग गलत mental models बना लेते हैं और “बस ऐसा ही होता है” कहकर कंधे उचका देते हैं, तो असली समस्याओं को सुधारना मुश्किल हो जाता है
    • बेहतर दुनिया संभव है, इस पर विश्वास करना ही होगा। मौजूदा स्थिति असहनीय है, और अगर कल बेहतर नहीं हो सकता तो फिर किसी चीज का मतलब क्या है?
      data और privacy किसे सौंपनी है, इसमें बेहतर और बदतर choices जरूर होंगी, लेकिन यह भी नहीं पता कि वे कौन हैं, और broad sense में “trustworthy” कोई जगह मौजूद भी है या नहीं; इसलिए हम इस assumption के साथ चलते हैं कि किसी पर भरोसा नहीं किया जा सकता
      कम cynical होना चाहता हूं, लेकिन पिछले 10–20 साल देखें तो cynicism पूरी तरह justified लगता है। अगर यह attitude गलत है तो इसे कैसे ठीक किया जा सकता है?
    • यह कोई मामूली फर्क निकालना नहीं है, बल्कि बहुत अच्छा point है
      microphone app access को operating system control करता है, और user के पास OS-provided tools होते हैं जिनसे वह देख सकता है कि कौन-सा app कब microphone इस्तेमाल कर सकता है
      इसके विपरीत cloud data access पूरी तरह “मुझ पर भरोसा करो” वाला model है, और यह पहले ही सामने आ चुका है कि कई companies ने उस trust का दुरुपयोग किया है
    • मोटे तौर पर दो रास्ते हैं। open source और self-hosting tools इस्तेमाल करने के लिए जरूरी resources invest करें, या proprietary services की सुविधा स्वीकार करें लेकिन उनमें क्या डालते हैं, इसे लेकर सावधान रहें
      Dropbox इस्तेमाल तो करता हूं, लेकिन Dropbox में जो भी डालता हूं वह या तो encrypted होता है या ऐसा होता है जिसके public internet पर leak हो जाने से फर्क नहीं पड़ेगा। self-hosted solutions के साथ काफी समय लगाया, लेकिन एक point के बाद लगा कि practical benefit बहुत ज्यादा नहीं है और time और energy कहीं और लगाना बेहतर है
    • अपने self-hosted storage setup के बारे में थोड़ा और detail में बता सकते हैं? मैं काफी समय से ऐसा कुछ चाहता था
  • यह लेख मुझे थोड़ा भोला-सा और “भलाई मानकर चलें” वाली सोच से काफी भरा लगता है
    AI के बाहर पिछले 10 साल में क्या हुआ है, यह देखें तो हर कोई किसी जुनूनी संग्रहकर्ता की तरह डेटा निगल रहा है। सिर्फ Google या Facebook ही नहीं, जो अपने core product में डेटा इस्तेमाल करते हैं, बल्कि लगभग सभी ऐसा कर रहे हैं। आज ही देखा कि क्रिसमस पर इस्तेमाल होने वाली एक Swedish पारंपरिक recipe mini-site ने autoplay video और dark-pattern cookie consent banner जैसी चीजें जोड़ दी हैं
    लगभग हर नई app और site इसी आर्थिक धुरी के इर्द-गिर्द चल रही है, और जैसे ही large language models ताकतवर होने लगे, third-party APIs अचानक एक साथ बंद होने लगीं
    मौजूदा पीढ़ी का AI ऐसा नहीं है कि दूसरे players चोरी-छिपे late-night snack की तरह डेटा खा रहे हों; यह तो खून और दिमाग के भूखे तेज zombies जैसा है। एक वजह यह भी है कि data product में कहीं ज्यादा सीधी भूमिका निभाता है, और दूसरी वजह यह कि दशकों में संभव paradigm shift को लेकर tech venture capital की overheated प्रतिस्पर्धी मानसिकता नींद से जाग गई है
    सारे संकेत zombie apocalypse और gold rush की ओर हैं, यानी बाद में माफी मांग लेने वाली शैली। इसलिए मुझे पूरा यकीन है कि हर कोई अपरिहार्य reputation crisis से पहले safety और responsibility की बातचीत को मजबूत कर रहा है। यानी पहले से ही पानी गंदा करने के लिए गोला-बारूद जमा किया जा रहा है
    लेकिन technologists ऐसे ढीले पड़े हैं जैसे उन्होंने पिछले 10 साल गहराई से झेले ही न हों, और सोचते हैं कि इस बार अलग होगा क्योंकि AI की जड़ें academia में हैं, क्योंकि चमकदार नई companies हैं, क्योंकि safety discourse है, क्योंकि “realistic” founders के तीखे Twitter posts हैं
    मैं यह दिखावा नहीं करूंगा कि पीछे ठीक-ठीक क्या हो रहा है, मुझे पता है, लेकिन मैं लोगों के काम करने के तरीके को समझने के लिए काफी समय से यहां हूं। और लोग बेहतर नहीं हुए हैं

    • नई giant company वादा कर रही है कि वह बुरी नहीं बनेगी...
    • इन companies ने पहले ही सबका data चुरा लिया है, और technologists intellectual property law पर कुड़कुड़ाते हुए कह रहे हैं कि public internet पर जो कुछ भी है, उसे बिना अनुमति इस्तेमाल किया जा सकता है
      कानूनी तौर पर भले ही यही वास्तविकता हो, लेकिन ऐसा करने पर आप फिर भी tech industry के घटिया लोगों जैसे ही दिखते हैं
  • यह लेख इस बात को बहुत हल्के में लेता है कि मेरे data से training करने के अलावा भी privacy की चिंताएं हैं
    मैं professional तौर पर काम करने वाला व्यक्ति हूं, और मेरे ग्राहकों पर यह बात लागू होती है कि जानकारी कहां जाती है, इसे लेकर non-disclosure agreements और regulations हैं। मैं ऐसी service इस्तेमाल करना चाहूंगा जिसमें data बस server पर रहे, बजाय इसके कि data leak points लगातार बढ़ते जाएं
    सबसे पहले तो मुझे यही समझ नहीं आता कि मेरा data हमेशा पूरी तरह encrypted क्यों नहीं है और उसे सिर्फ मैं ही क्यों नहीं देख सकता। लेकिन यह विचार कि मेरी सहमति या रुचि के बिना उसे सक्रिय रूप से internet के पार किसी दूसरी company को खिलाने और process करने के लिए भेजा जा रहा है, डरावना है
    जब मैं खुद चुनकर on करता हूं तो AI features अक्सर इस्तेमाल करता हूं, लेकिन किसी company का मेरी personal files को मेरी सहमति के बिना internet पर इधर-उधर भेजना पागलपन है
    सच कहूं तो OneDrive में migration tool है, इसलिए मैंने Dropbox Business trial लिया और कल रात अपनी सारी files अपने-आप transfer कर दीं। desktop interface में फालतू चीजें और popups ठूंसने, और वह end-to-end encryption न देने जैसी हरकतों में यह आखिरी बूंद थी, जिसकी मैं लगातार मांग कर रहा था
    अगर आप Dropbox Business से Office 365 OneDrive account में कुछ clicks में move करना चाहते हैं, तो यहां है: https://learn.microsoft.com/en-us/sharepointmigration/mm-dro...

    • यह सिर्फ “AI” की समस्या नहीं है, बल्कि tech दुनिया के पूरे cloud-centric trend में मौजूद एक गहरी समस्या है
      homomorphic encryption distributed computing का समाधान हो सकता है, लेकिन उसे reality बनने में अभी कई साल लगेंगे। तब तक हमें de-clouding, on-premises की ओर वापसी, और trusted groups के भीतर hybrid private cloud cooperatives जैसे तरीकों पर जाना होगा
      एक और वजह individuals और छोटी companies से big data की ओर होने वाले विशाल wealth transfer को रोकना है
      यह अच्छी बात है कि सर्वशक्तिमान AI के दुनिया पर कब्जा करने वाली fantasy कम हो रही है और हमें ज्यादा सामान्य reality की बेहतर समझ मिल रही है। AI केवल पहले से मौजूद बेहूदा power imbalance को तेज करता है। जो निजी है, उसे निजी ही रखना चाहिए
    • Dropbox ने कल ही ऐसा statement दिया: “अगर आपने Dropbox के AI tools इस्तेमाल किए हैं, तो कुछ documents और files अस्थायी रूप से OpenAI के साथ share की गई हो सकती हैं”
      अगर आप मानते हैं कि cloud provider आपके सर्वोत्तम हित को प्राथमिकता देता है, तो शुभकामनाएं। यह Hacker News है, और यहां भरोसा अपने-आप नहीं मिलता; उसे कमाना पड़ता है
    • मैं ज्यादातर सहमत हूं, लेकिन क्या sensitive information को Dropbox account में upload या share होने से पहले खुद encrypt नहीं किया जा सकता?
      यह end-to-end encryption नहीं है, लेकिन इससे company encrypted data को training corpus के रूप में इस्तेमाल नहीं कर पाएगी। क्या colleagues या family द्वारा बनाए गए shared folders और files के मामले में वे encryption समझने जितने technical नहीं हो सकते?
    • बेहतर समाधान यह है कि जिस cloud storage का इस्तेमाल कर रहे हैं, उसके ऊपर Cryptomator जैसा अलग encryption overlay लगाया जाए
      अगर ग्राहकों के साथ non-disclosure agreement है, तो आपको end-to-end encryption के बिना Dropbox इस्तेमाल नहीं करना चाहिए, और OneDrive के लिए भी यही बात है
    • क्या OneDrive में end-to-end encryption है? अगर Microsoft ने अभी तक नहीं किया है, तो लगता है वह जल्द ही कोई मिलता-जुलता feature जोड़ देगा
  • मुख्य बात सिर्फ यह नहीं है कि Dropbox की निजी फ़ाइलें OpenAI model training data में चली जाएँगी या नहीं
    वे किसी भी उद्देश्य से इस्तेमाल हों, जब तक मैंने अनुमति न दी हो, मैं नहीं चाहता कि मेरा डेटा कहीं भी भेजा जाए
    इस मामले में हमें सिर्फ यह नहीं मानना होगा कि OpenAI हमारी फ़ाइलों से training नहीं कर रहा, बल्कि यह भी भरोसा करना होगा कि वे हमारी फ़ाइलों को सुरक्षित तरीके से संभाल सकते हैं। इस बात पर संदेह करने की कोई वजह नहीं कि training न करने की उनकी बात सच है, फिर भी समस्या बनी रहती है

    • भाषा के लिहाज से “user data से model train नहीं करते” शब्दशः सच हो सकता है। क्योंकि यहाँ training का अर्थ बहुत विशिष्ट रूप से लिया जा सकता है
      लेकिन साथ ही model output की किसी तरह की monitoring भी हो सकती है, और खासकर निजी फ़ाइलों पर retrieval-augmented generation (RAG) इस्तेमाल करने पर साफ़ तौर पर निजी जानकारी लीक हो सकती है
      यह मानना काफ़ी वाजिब है कि लोग detailed terms को पूरी तरह समझते नहीं हैं। शायद वे सच में नहीं समझेंगे, और AI कंपनियों ने एक बात साफ़ दिखाई है: वे मानती हैं कि creators की अनुमति हो या न हो, वे मनचाहा material मनचाहे तरीके से इस्तेमाल कर सकती हैं
    • आखिरकार यह SaaS vendor की लगातार चलने वाली संरचना ही है
      अगर आप नहीं चाहते कि कोई third party या second party डेटा पढ़ सके, तो यह सुनिश्चित करना होगा कि client side पर end-to-end encryption हो
      इसका मतलब है कि Dropbox नहीं, Syncthing इस्तेमाल करना चाहिए; और Slack या Discord नहीं, Signal इस्तेमाल करना चाहिए
    • OpenAI की “audit purposes के लिए डेटा सिर्फ 30 दिन रखते हैं” policy का मतलब है कि उन 30 दिनों में breach हो जाए तो डेटा leak हो सकता है, इसलिए चिंता करना बेहद वाजिब है
      खासकर क्योंकि अतीत में कुछ documented security issues रहे हैं
    • यही logic cloud में data processing पर भी लागू हो सकता है, लेकिन अजीब बात है कि Dropbox डेटा को AWS या Google Cloud जैसी जगहों पर store करता है, इस पर कोई शिकायत नहीं करता
  • लेख में mic trust वाली बात उस मुख्य मुद्दे से ध्यान हटाने वाला red herring लगती है जिसे और साफ़ किया जा सकता था
    Facebook सचमुच apps और internet से डेटा लेता है, internet behavior track करता है, और इस डेटा को आपके बारे में models में डालता है। ये models इतने accurate होते हैं कि कभी-कभी लगभग predict कर सकते हैं कि आप क्या सोच रहे हैं। इसलिए आम लोग निष्कर्ष निकालते हैं कि mic से चोरी-छिपे सुना जा रहा है
    OpenAI जैसी large language model कंपनियाँ और उनके partners भी लगभग बिल्कुल ऐसे ही models इस्तेमाल करते हैं। वे तरह-तरह के sources से डेटा scrape करके models को बेहतर बनाते हैं, और इस संभावना को monetize करते हैं कि आप वही जगहें click करते रहें जहाँ वे चाहते हैं

    • सही है। बड़े अर्थ में आम लोग ज़रूरी नहीं कि गलत ही हों
      mechanism के बारे में वे technically गलत हैं, लेकिन privacy में चरम दखल के मामले में बिल्कुल सही हैं। यह दखल mic के बजाय accurate models के रूप में आता है, यह सिर्फ technical detail है; अंतिम असर वही है
    • यह सब आखिरकार मुझे घटिया ads दिखाने के लिए है—ऐसे online games जो मैं कभी नहीं खेलूँगा, college-themed dating services जो नहीं इस्तेमाल करूँगा, yoga सामान, money transfer services वगैरह
      मैं एक बड़े college के पास रहता हूँ, शायद IP से अनुमान लगाते होंगे। कभी-कभी Lexus या Jaguar के ads भी दिख जाते हैं, वे ठीक हैं
  • मैं यह नहीं मानता कि Facebook चुपके से phone mic के जरिए किसी की बातें सुन रहा है, लेकिन “झूठ पकड़ा गया तो reputation risk खगोलीय होगा” वाला तर्क बिल्कुल भी convincing नहीं है
    जिन अमेरिकी non-technical लोगों को मैं जानता हूँ, उनके बीच Facebook की reputation पहले से ही बहुत खराब है। लोगों ने देखा कि Facebook ने 6 जनवरी 2021 के विद्रोह को भड़काने में योगदान दिया, और बाद में कोई जिम्मेदारी लिए बिना कुछ भी ठीक नहीं किया
    अगर यह पता भी चले कि उसने सच में वही किया है जो बहुत से लोग पहले से मानते हैं कि वह शायद कर रहा है, तो उससे होने वाला reputational damage उससे कहीं कम होगा

    • वे भी जानते हैं कि उनकी reputation खराब है, लेकिन लोग फिर भी Insta और WhatsApp इस्तेमाल करते रहते हैं
  • OpenAI हो या कोई और बड़ी कंपनी, वे क्या कर चुके हैं, क्या करने वाले हैं, या क्या कर रहे हैं — उनकी बातों पर मैं “भरोसा” नहीं करता
    फिर भी मुझे यह विश्वास नहीं है कि OpenAI यूज़र की सहमति के बिना Dropbox डेटा का इस्तेमाल मॉडल training में कर रहा है
    लेकिन यहाँ मुद्दा वह नहीं है। मुद्दा transit में मौजूद data है। वह डेटा जो किसी ऐसे third party को भेजा जा रहा है जो उसे वास्तव में पढ़ सकता है, जहाँ Dropbox के नियंत्रण से बाहर कोई malicious employee हो सकता है, जहाँ वह logs में रह सकता है या अलग policies के अधीन हो सकता है
    अगर मैं Dropbox को private data भेजता हूँ, तो Dropbox को “product improvement” समेत किसी भी वजह से, मेरी स्पष्ट और पूरी तरह informed सहमति के बिना, उसे किसी को भी नहीं भेजना चाहिए। मुझे समझ नहीं आता कि यह बहस का विषय क्यों है
    अगर Dropbox खुद model host करे और consent देने वाले users को retrieval-augmented generation search दे, तो वह अलग बात है
    अगर Dropbox पहले से किसी को बताए बिना सभी users का data किसी third party को भेजता है, तो वह बिल्कुल अलग और भयानक बात है

    • आप ऐसा क्यों मानते हैं? उन्होंने मेरी सहमति के बिना मेरे code पर training की है, तो user data को अलग क्यों समझना चाहिए?
      Training या तो fair use है या नहीं है। और high-growth Silicon Valley कंपनियाँ कानून की भावना का अच्छी तरह पालन करने के लिए मशहूर नहीं हैं
    • जैसे ही data बिना encryption के किसी third party को दे दिया गया, वह “private” नहीं रहा, और उनकी policy में लिखा है कि अगर वे “service और business operations के legitimate interests के लिए” दावा कर सकें, तो वे लगभग किसी भी चीज़ के लिए उसका इस्तेमाल कर सकते हैं — इसलिए इस पर बहस हो सकती है
      यहाँ तक कि policy में यह भी लिखा है कि वे चाहें तो उसे कभी भी update कर सकते हैं
      Privacy policy तो कानूनी रूप से binding भी नहीं होती। अगर आप अमेरिका में हैं और Dropbox के साथ आपका contract नहीं है, तो आपके पास लगभग कोई अधिकार नहीं है; और जिन अधिकारों के होने की आप सोचते हैं, उन्हें enforce कराने के लिए आपको court जाना होगा, जहाँ system असल में पैसे से जीता जाता है और सामने वाली कंपनी के पास अरबों की संपत्ति है
      अगर Dropbox आपके द्वारा सौंपे गए trust को खुलेआम तोड़े, तो यह वाकई घटिया बात होगी, और ऐसा भयानक business decision हो सकता है कि कोई भी फिर कभी Dropbox को data न सौंपे। लेकिन अगर किसी दिन वह पूरी तरह बुरा बन जाए और जो भी पैसे दे उसे data देना शुरू कर दे, तो मुझे लगता है आप बहुत कम कर पाएँगे
      जिस data की आपको परवाह है, उसे local backup और encryption के बिना cloud में नहीं डालना चाहिए। तब cloud provider चाहे जो करे, चाहे जिसे दे, आपको चिंता करने की ज़रूरत नहीं रहेगी
    • मैं Dropbox का paid customer हूँ, लेकिन ऐसी feature के लिए पैसे नहीं देना चाहता
      इसके बजाय मैं चाहता हूँ कि वे मेरे data को encrypt करें ताकि ऐसी feature दे ही न सकें। मुझे data recovery चाहिए, लेकिन यह AI “feature” दे पाने की बात ही ऐसा लगता है जैसे उन्होंने malicious insider या third party को मेरे data तक पहुँचने से रोकने के लिए बहुत कम कोशिश की है
    • अगर Dropbox ने HIPAA के तहत आने वाले documents इस्तेमाल करने वाले enterprise customers के साथ कभी BAA किया है, तो अघोषित third party के साथ documents share करना बहुत जल्दी बड़ी समस्या पैदा करेगा
      Financial penalties हर exposure और संबंधित employee के हिसाब से बहुत ऊँची होती हैं, और जिस employee ने सीधे disclose/share किया उस व्यक्ति पर भी जिम्मेदारी आती है
      इसलिए भले ही उन्होंने बिना notice के किसी अघोषित third party के साथ documents share किए हों, मुझे भरोसा है कि “सब कुछ” नहीं होगा। Enterprise data शायद safe होगा। ऐसे contracts पर signature से पहले कड़ी review होती है
    • सही। असली बात यही है कि मेरे sensitive data को कौन देख सकता है
  • AI का trust crisis?
    खासकर तब, जब हमने देखा कि एक कंपनी के board और CEO को जैसे झूठ बोलने या manipulation के आरोपों में हटाया/बदला गया, लेकिन किसी को साफ पता नहीं कि मामला क्या था?
    अगर Dropbox user data scan करके derived data बनाता है, तो वह “derived” data अब “user data” नहीं बल्कि Dropbox data बन जाता है और share किया जा सकता है। वह शायद सिर्फ statistical nature का हो और किसी individual user से सीधे जुड़ा न हो, लेकिन क्या वही तो training data नहीं है? क्या यह मूल रूप से ऐसे ही काम नहीं करता? तो क्या उसे AI model training के लिए share नहीं किया जा सकता?
    यह झूठ नहीं, शब्दों का खेल है। नहीं, यह अनैतिक व्यवहार है और बड़ी tech कंपनियों का standard बन गया है

    • Sam Altman और OpenAI के साथ fairness रखें तो, जिन भरोसेमंद reports को मैंने सुना है, खासकर Kara Swisher के काम में, यह AI safety या CEO द्वारा board से झूठ बोलने का मामला नहीं था, बल्कि OpenAI की दिशा को लेकर CEO और board ने जो उचित माना, उसमें व्यापक टकराव था
      इस लड़ाई में मेरा कोई stake नहीं है। मैं न Altman का पक्ष लेता हूँ, न OpenAI का। और मुझे इस brave new world के हमें कहाँ ले जाने को लेकर काफी चिंता है। मंज़िल कितनी भी अनाकर्षक हो, मुझे नहीं पता कि इस merry-go-round से उतरने का कोई भरोसेमंद विकल्प है भी या नहीं
      यहाँ Dropbox की जो हरकत बताई गई है, वह tech कंपनियों द्वारा trust तोड़ने की बहुत लंबी कतार में बस एक और उदाहरण है
    • अनैतिक व्यवहार का दावा बहुत बार reflexive, बेबुनियाद और अनुमान पर आधारित होता है
      लेखक के दिए उदाहरण में Dropbox data केवल तब OpenAI को भेजता है जब user document summary जैसी AI-related feature को स्पष्ट रूप से run करने को कहता है। लेकिन backlash मानो बिना सबूत यह मानकर चल रहा है कि वे लोगों के documents को mass scale पर scan और upload कर रहे हैं
      AI कंपनियों में अनैतिक व्यवहार निश्चित रूप से मौजूद है। निजी तौर पर मैं यह फैसला रोककर रखता हूँ कि उसका अनुपात आम population में unethical behavior की baseline rate से ज्यादा है या कम। किसी भी हालत में, खराब व्यवहार पर बात करनी हो तो fearmongering नहीं, बल्कि cite किए जा सकने वाले evidence वाले specific examples इस्तेमाल करने चाहिए
  • जो लोग AI companies पर भरोसा नहीं करते, उनके कई तरह की कंपनियों, non-profits, यहाँ तक कि government agencies के बारे में भी समान भावनाएँ होने की संभावना बड़ी है
    यह इस पर निर्भर करेगा कि आप किससे पूछते हैं, लेकिन AI-based कंपनियों के दायरे से कहीं बड़ा trust problem दिखता है। इसलिए सिर्फ इस खास sector से कहना कि वे अपने खिलाफ अविश्वास से लड़ें, मतलब चारों तरफ से आने वाले अविश्वास से निपटना — जो इन कंपनियों के scope से बाहर एक असंभव task जैसा लगता है
    मुझे नहीं पता इस समस्या का जवाब क्या है, यह सच में समस्या है भी या नहीं, या अगर ऐसी हर तरफ फैली cynicism हर चीज़ और हर व्यक्ति तक फैल जाए तो हम कहाँ जा रहे हैं। शायद हम बस दिलचस्प समय में जीने के लिए अभिशप्त हैं

    • trust वापस पाने का पहला कदम trust abuse बंद करना है
      हमारी पूरी industry trust का अविश्वसनीय रूप से दुरुपयोग कर रही है, और निकट भविष्य में बदलने के कोई संकेत नहीं दिखते