ग्राहक डेटा के साथ होने वाली Slack AI ट्रेनिंग
(slack.com)- Slack ग्राहक डेटा का उपयोग करके generative AI models विकसित नहीं करता, लेकिन emoji और channel recommendations जैसे predictive models के लिए messages, content, files और usage information का विश्लेषण किया जा सकता है
- global models को इस तरह डिज़ाइन किया जाता है कि वे ग्राहक डेटा के किसी हिस्से को पुन:उत्पादित न करें, और AI/ML development या analysis के दौरान कर्मचारियों को underlying content तक पहुंचने से रोकने के लिए controls लगाए जाते हैं
- ग्राहक अपने workspace या organization के डेटा को Slack global model training से बाहर रखने का अनुरोध कर सकते हैं, और opt-out के बाद भी globally trained ML models के फ़ायदे लेते रह सकते हैं
- channel recommendations, search results, autocomplete, और emoji recommendations external models, numerical scores, past interaction counts, और public phrases का उपयोग करके इस तरह काम करते हैं कि ग्राहक डेटा का exposure कम हो
- Slack की generative AI features third-party LLMs का उपयोग करती हैं, लेकिन ग्राहक डेटा Slack की trust boundary के भीतर रहता है और explicit opt-in के बिना generative AI model training में उपयोग नहीं होता
Slack के AI/ML डेटा उपयोग सिद्धांत
- Slack के product development principles का केंद्र ग्राहक डेटा की privacy और security है
- ML और AI का उपयोग Slack products को बेहतर बनाने के लिए एक tool के रूप में किया जाता है
- ग्राहक डेटा से generative AI models विकसित नहीं किए जाते
- emoji recommendations और channel recommendations जैसे predictive models के विकास के लिए निम्न डेटा का विश्लेषण किया जा सकता है
- Slack में जमा किया गया customer data: messages, content, files आदि
- privacy policy और customer contracts में परिभाषित अन्य जानकारी: जिसमें usage information शामिल है
global models और access controls
- Slack ऐसे models का निर्माण या training नहीं करता जो सभी ग्राहकों में व्यापक रूप से उपयोग हों और ग्राहक डेटा के किसी हिस्से को पुन:उत्पादित कर सकें
- AI/ML model development या customer data analysis की प्रक्रिया में Slack कर्मचारी underlying content तक पहुंच नहीं सकते
- customer data की confidentiality और security की रक्षा के लिए कई technical measures लागू किए जाते हैं
- ग्राहक अपने customer data को Slack global model training में उपयोग होने से रोकने के लिए opt out कर सकते हैं
- opt-out किए गए workspace का customer data केवल उसी workspace के अनुभव को बेहतर बनाने के लिए उपयोग होगा
- globally trained ML models के लाभ मिलते रहेंगे
- Org या Workspace Owners, या Primary Owner को
feedback@slack.comपर Workspace/Org URL और subjectSlack Global model opt-out requestके साथ ईमेल भेजना होगा - Slack अनुरोध पूरा होने के बाद completion status के साथ जवाब देगा
customer data और अन्य जानकारी से service improvement
- Slack की product और analytics teams service को develop, update और improve करने के लिए customer data और अन्य information का उपयोग कर सकती हैं
- ऐसी personalization और improvement इस प्रक्रिया से संभव होती है जिसमें यह अध्ययन और समझा जाता है कि उपयोगकर्ता Slack के साथ कैसे interact करते हैं
- Slack के customer contracts और Privacy Policy में दिए गए confidentiality obligations हर scenario पर लागू होते हैं
- ग्राहक अपने customer data के मालिक होते हैं
- Slack customer data को aggregate और separate करता है ताकि service updates में customer data के उपयोग के बावजूद कोई third party किसी विशेष customer या individual को improvement के source के रूप में पहचान न सके
- Slack affiliates या subprocessors इस अपवाद में शामिल हैं
predictive features के अनुसार data protection का तरीका
-
channel recommendations
- कंपनी के भीतर नए public channels में शामिल होने की recommendation दी जा सकती है
- recommendations channel membership, activity और topic overlap पर आधारित होती हैं
- model पिछली recommendations और इस बात से सीखता है कि उपयोगकर्ता ने channel join किया या नहीं
- Slack messages पर train न किया गया external model topic similarity का आकलन करके numerical score आउटपुट करता है
- global model केवल इस numerical score और non-customer data का उपयोग करके recommendations देता है
-
search results
- search ML model किसी विशेष query के लिए उपयुक्त results पहचानता है ताकि उपयोगकर्ता अपनी इच्छित जानकारी पा सके
- यह past search results और previous engagement history पर आधारित होता है
- model को इस तरह डिज़ाइन किया गया है कि वह search queries या results को पुन:उत्पादित न कर सके
-
autocomplete
- search queries या अन्य text को autocomplete किया जा सकता है
- उदाहरण के लिए, यदि उपयोगकर्ता
Customer Supportके शुरुआती कुछ अक्षर टाइप करे, तो यह उस phrase को पूरा कर सकता है - suggestions local रूप से बनती हैं और उपयोगकर्ता के workspace में मौजूद सामान्य public message phrases से ली जाती हैं
- संभावित suggestions चुनने वाला algorithm पहले globally इस बात से सीखता है कि कौन-सी completions suggest की गईं और स्वीकार की गईं
- यह input text और suggestion के बीच similarity को score करने वाले rules का उपयोग करता है, और algorithm में केवल numerical scores और past interaction counts ही जाते हैं
-
emoji recommendations
- message के content और sentiment, emoji के past usage, और खास context में team के भीतर emoji usage frequency के आधार पर reaction emoji सुझाए जा सकते हैं
- यदि किसी खास channel में congratulatory messages पर 🎉 reaction आम है, तो वैसे ही सकारात्मक नए message पर भी 🎉 reaction सुझाया जा सकता है
- Slack messages पर train न किया गया external model message sentiment को classify कर सकता है
- Slack model केवल इस बात को देखता है कि उस workspace में किसी खास sentiment वाले messages और किसी खास emoji के बीच संबंध कितनी बार देखा गया
generative AI में customer data का प्रबंधन
- generative AI AI systems की वह category है जो उपयोगकर्ता के दिए prompt के जवाब में text जैसे content generate कर सकती है
- इस category में large language models (LLM) शामिल हैं
- AI in Slack generative AI का उपयोग करता है और third-party LLMs का सहारा लेता है
- जब तक ग्राहक स्पष्ट रूप से opt-in consent न दें, customer data का उपयोग generative AI model training में नहीं किया जाता
- AI in Slack off-the-shelf LLMs का उपयोग करता है, और ये models request के बाद customer data से update नहीं होते और न ही customer data को किसी अन्य तरीके से retain करते हैं
- ये models AWS जैसे cloud provider infrastructure पर host किए जाते हैं
- customer data Slack की trust boundary के भीतर रहता है, और LLM providers customer data तक पहुंच नहीं सकते
- subprocessor changes की notifications Trust and Compliance webpage पर प्राप्त की जा सकती हैं
Slack AI search answers के sources
- AI in Slack का search feature जवाबों के source Slack की internal features और connected documents से लेता है
- search sources में निम्न शामिल हैं
- Slack features: canvas, huddles canvas notes, clip transcripts, text snippets
- Slack में uploaded files: PDF, email, docx, pptx, Keynote
- Google Drive के connected documents: Docs, Slides
- Sharepoint/OnDrive documents: Word, Powerpoint
- Box जैसे file storage partner apps: यदि installed हों
- उपयोगकर्ता को उन files तक पहुंच के लिए Slack integrations के माध्यम से authenticated होना चाहिए
- admins सभी file results को disable कर सकते हैं या external hosted files को source के रूप में उपयोग होने से रोक सकते हैं
- संबंधित जानकारी Help Center में देखी जा सकती है
1 टिप्पणियां
Hacker News की राय
सपोर्ट टीम से संपर्क करके opt-out किया था, और जवाब में कहा गया कि अनुरोध पूरा हो गया है
Slack ने बताया कि चैनल/emoji recommendations और search results जैसे platform-level machine learning models हैं, लेकिन इन्हें इस तरह नहीं बनाया या train नहीं किया जाता कि वे customer data को सीखें, याद रखें या फिर से reproduce कर सकें
Slack AI अलग से खरीदा जाने वाला add-on है, customer data से LLM को train नहीं करता, और Slack के AWS infrastructure के भीतर hosted LLM का उपयोग करता है, इसलिए data बाहरी LLM providers के साथ share नहीं किया जाता
policy links: https://slack.com/trust/data-management/privacy-principles, https://slack.engineering/how-we-built-slack-ai-to-be-secure...
हालांकि शायद सिर्फ अगली Terms of Service update तक ही
शायद आपने वही किया होगा?
अगर व्यवस्था यह है कि “Slack global model training में customer data का उपयोग न हो, इसके लिए opt-out कर सकते हैं। opt-out के बाद भी workspace data सिर्फ उसी workspace experience को बेहतर बनाने में इस्तेमाल होगा, और global training model के फायदे मिलते रहेंगे,” तो सोचता हूं कोई opt-out क्यों नहीं करेगा
बेशक उन लोगों को छोड़कर जिन्हें यह पता ही नहीं कि उन्हें opt-out करना है; यह पूरी तरह नुकसान वाला विकल्प लगता है
individual users को अपनी data के इस्तेमाल के तरीके पर कोई अधिकार नहीं दिखता, और उन्हें Workspace Owner से संपर्क करना होगा
जब ऐसा संपर्क करूंगा, तो बेहतर होगा कि उनसे alternative platform पर विचार करने को कहूं
अंत में यह opt-out whack-a-mole बन जाता है, तरीका भी सामान्य inquiry जैसा है, और opt-out करने पर भी वे फिर भी training करते हैं—ऐसा लगता है
शायद terms के करीब 300वें पेज पर कहीं बहुत न दिखने वाली जगह एक छोटा सा hint रख देंगे
अगर opt-out न करने को “बेहतर product बनाने में मदद” के रूप में देखें, तो product तो पहले से paid है, और अगर बिना extra time लगाए अगला release बेहतर हो सकता है, तो क्यों नहीं
उसी कीमत पर बेहतर product मिलता है, और company को बेचने के लिए बेहतर product मिलता है
यह ऐसा सौदा हो सकता है जिसमें company को ज्यादा फायदा हो, लेकिन अगर एक पक्ष ज्यादा जीतता है तो इसका मतलब यह नहीं कि दूसरा हार रहा है
अगर आप data privacy को बहुत महत्व देते हैं या मानते हैं कि training की अनुमति देने से सच में private information exposure का जोखिम बनता है, तो बात अलग है; तब रोकने का option है, इसलिए हर व्यक्ति “बेहतर product” और “private information exposure के अनुमानित जोखिम” के बीच value खुद तौल सकता है
“जो model सभी customers के लिए व्यापक रूप से इस्तेमाल होगा, उसे customer data के कुछ हिस्सों को सीखने, याद रखने या reproduce करने के तरीके से बनाया या train नहीं किया जाता” वाला वाक्य इतने सूक्ष्म संकेतों और liability-disclaimer wording से भरा है कि भरोसे से ज्यादा अविश्वास पैदा करता है
यह सिर्फ उन models पर लागू है जो “सभी customers के लिए व्यापक रूप से” इस्तेमाल होते हैं, इसलिए अगर वे व्यापक रूप से इस्तेमाल नहीं होते या सिर्फ कुछ customers के लिए इस्तेमाल होते हैं, तो पूरा वाक्य लागू नहीं होता
तार्किक रूप से यह ऐसे मामलों में data leak हो सकने की तरफ इशारा जैसा लगता है, जो काफी खराब है
इस वाक्य को ठीक करना चाहिए, और जिसने इसे लिखा है वह risk है
मतलब customer data का इस्तेमाल “सभी customers के लिए व्यापक रूप से इस्तेमाल होने वाले model को उस तरीके से” train करने में नहीं होता, लेकिन global model training में मदद करता है
हालांकि वह समस्या उनसे ज्यादा हमारे लिए बड़ी है
अगर कोई बहुत specific situation के बारे में conversation की तरह पूछे, तो customer name से attributed न होने पर भी confidential data बाहर आ सकता है
ऐसा भी नहीं है कि किसी specific industry की किसी specific या random company ने कोई चीज कैसे design की होगी, यह LLM से पूछा ही नहीं जा सकता
वे कहते हैं कि channel recommendation model पिछली recommendations और user ने recommended channel join किया या नहीं, यह सीखता है, लेकिन privacy बचाने के लिए customer data और model को अलग रखते हैं
Slack messages पर train न किए गए external model से topic similarity assess करके numeric score बनाया जाता है, और global model उसी score और non-customer data के आधार पर recommend करता है
search भी queries या result text को खुद train नहीं करता, बल्कि team-specific context information सीखता है, जैसे कोई message search में कितनी बार click हुआ या query और recommended message के words में कितना overlap है
autocomplete suggestions workspace के public messages में common phrases से ली जाती हैं, और globally पहले suggest/accept की गई completions के आधार पर train करती हैं, लेकिन algorithm सिर्फ scores और past interaction counts का उपयोग करता है
emoji recommendations भी Slack messages पर train न किए गए external model से sentiment classify करती हैं, और सिर्फ यह देखती हैं कि उस workspace में उस sentiment वाले messages और किसी particular emoji का साथ में इस्तेमाल कितनी बार हुआ
संक्षेप में, डेटा को global model से बाहर रखना हो तो opt out करना होगा।
साथ ही “डेटा workspaces के बीच leak नहीं होता” जैसी अस्पष्ट बात कही जाती है, इसलिए यह बहुत उलझाऊ है।
“leak नहीं होगा” नहीं, बल्कि “leak हो ही नहीं सकता” वाले tools इस्तेमाल करने चाहिए।
“AI/ML models विकसित करते समय या customer data analyze करते समय Slack underlying content तक access नहीं कर सकता। इसे रोकने के लिए कई technical measures हैं” — यह वाक्य भ्रमित करने वाला है।
“नहीं कर सकता” एक कड़ा दावा है, लेकिन AI model डेटा तक access कर सकता है और Slack, Inc खुद नहीं कर सकता—यह कैसे संभव है, यह समझना मुश्किल है।
अगर मैंने कुछ miss नहीं किया है, तो यह “नहीं कर सकता” से ज़्यादा “नहीं करता” जैसा लगता है।
शायद इसका मतलब “Slack employees” है, लेकिन “Slack” में कंपनी की assets, agents, systems, computers, servers, AI models आदि सब शामिल हो सकते हैं।
Signal भी अगर कहे “हम user content तक access नहीं कर सकते”, तो वह भी अस्थिर और optimistic wording जैसी लगती है।
“नहीं कर सकते” सुनकर व्यक्ति यही समझता है कि कंपनी के अंदर कोई भी कानूनी दायरे में रहकर वह काम नहीं कर सकता।
Slack employees वे technical measures बंद कर सकते हैं, और Signal employees भी app update के ज़रिए सभी messages को किसी दूसरे server पर route करवा सकते हैं।
बेहतर wording होगी: “Slack employees underlying content तक access नहीं करते।”
तो इससे बहुत साफ़ तौर पर access possible लगता है।
उदाहरण के लिए model training batch job ऐसे system user के रूप में चल सकती है जिसके पास “interactions” के रूप में annotated डेटा तक access हो, लेकिन message body या user query text जैसे “content” data तक access permission न हो।
अगर training job ऐसा content लाने के लिए RPC भेजे, तो उसे वैसे ही reject कर दिया जाएगा जैसे login किए बिना किसी और के DM तक पहुंचने की कोशिश पर होता है।
बड़ी कंपनियों में engineers या product managers मनमाने ढंग से access-control lists तय नहीं कर सकते; वे batch job access के लिए किसी system से request करते हैं, और उस system को operate करने वाले लोग भी company policies का पालन करते हैं।
यह कुछ वैसा है जैसे bank teller account number handle करता है, लेकिन चुपचाप अपने personal account में पैसा transfer नहीं कर सकता या पकड़ा जाएगा।
यह वाक्य शायद यह कहने के करीब है कि कोई Slack PM अपनी team के OKR बढ़ाने के लिए policy ignore करके, किसी दूसरी team द्वारा इस्तेमाल न किए जा रहे customer data पर चुपचाप training करवा सके—ऐसा system-wise संभव नहीं है।
बेशक analogy perfect नहीं है।
bank teller शायद Slack customer support rep के ज़्यादा करीब है, जो customer consent के बाद messages देख सकता है; और किसी व्यक्ति को दिए गए limited access को model training job तक बहा देने का तरीका असल में होने की संभावना कम है।
mature company में employee के personal data access rights से arbitrary notebook पर model train करना और उस model को production में deploy करना भी blocked होना चाहिए।
startups में ऐसा हो सकता है, लेकिन।
Telegram और WhatsApp भी ऐसे ही हैं।
लगता है ऐसी companies की सूची बना दी जाए तो उनसे बचा जा सकेगा।
अगर आपको ऐसी दूसरी companies पता हों जो आसान, high-visibility opt-out toggle दिए बिना customer data पर training करती हैं, तो नीचे comment करें।
पहले कहा गया था कि technical support requests से मिली जानकारी सिर्फ problem solving के लिए इस्तेमाल होगी, और personal information हटाने के बाद कुछ technical details bug reports बनाने में इस्तेमाल की जा सकती हैं।
नई wording में शामिल है कि personal information हटाने के बाद specific technical information bug reports बनाने में इस्तेमाल हो सकती है, और anonymized technical information को Microsoft Azure पर भेजकर OpenAI services के ज़रिए technical support experience improve किया जा सकता है।
कहा गया है कि नाम, phone number, address, email, IP address, product serial number जैसी personally identifiable information exclude की जाएगी।
पहले मैं privacy policy update emails बस delete कर देता था, लेकिन अब आदत हो गई है कि कहीं ऐसी wording चुपके से जोड़ी गई है या नहीं, इसका diff देखूं।
incentives इतने मजबूत हैं कि resist करना मुश्किल है।
https://twitter.com/kepano/status/1688610782509211648
https://twitter.com/kepano/status/1682829662370557952
list खाली है।
समझ नहीं आता कि यह यूरोप के right to be forgotten कानून के साथ कैसे compatible हो सकता है
सच कहें तो लगता है कि ऐसे AI models में से कौन-सा उस अधिकार का पालन कर भी सकता है
अगर user deletion का अनुरोध करे, तो क्या पूरा model फिर से train किया जाएगा? ऐसा तो नहीं लगता
Copyright अब जैसे बचा ही नहीं; कहते हैं कि यह चोरी नहीं, transformation है; और पूरे internet पर model train करने से पहले आपको opt out करना होगा, फिर भी शायद वे ऐसा न करें
कहते हैं jobs बिल्कुल कम नहीं होंगी, और फिर हर company तुरंत 15% लोगों को निकाल देती है, office वापसी को मजबूर करती है ताकि car data तक और हासिल किया जा सके
“एक अजीब तरकीब” से आपको सबसे productive programmer बनाने के नाम पर बेचते हैं, लेकिन खुद कोई profitable product बनाने के बजाय इसे individuals को बेचने की कोशिश करते दिखते हैं
सबसे गंभीर और खतरनाक बात यह है कि जानकारी लोगों की उंगलियों या आंखों के सामने पहुंचने से पहले ही सबसे निचले स्तर पर censor हो रही है
[0] https://ai.stanford.edu/~kzliu/blog/unlearning
मेरी समझ में, अगर model पहले ही train हो चुका है, तो right to be forgotten request की वजह से उसे delete करने की जरूरत नहीं होती, लेकिन legal uncertainty बहुत बड़ी है
हाल के GDPR judgments देखें तो opt-in नहीं बल्कि opt-out होने की वजह से अब भी violation होने की संभावना ज्यादा है
शायद EEA में generated data को वे पूरी तरह filter कर रहे होंगे
Team messaging के लिए Matrix/Element जैसे self-hosted solutions सच में इस्तेमाल करने चाहिए
अगर अपनी hardware अपने office में नहीं रखना चाहते तो ठीक है, लेकिन solution यह है कि ऐसा end-to-end encrypted solution चलाया जाए जिसमें hosting provider data access न कर सके
cryptpad.fr भी शानदार software है
इसमें source code (Ruby on Rails) लेकर जहां चाहें deploy करते हैं, और हम इसे DigitalOcean droplet पर चला रहे हैं
Slack, Google, Microsoft समेत सभी SaaS tools providers के लिए ऐसा करने का incentive बहुत बड़ा है
कंपनियों को vendor द्वारा commodity बना दिए जाने से बचना है तो आखिरकार उन्हें अपने data और AI strategy पर control रखना होगा
इसका मतलब शायद छोटे, महंगे और business को नुकसान पहुंचा सकने वाले features बंद करना, access control और governance ठीक से सेट किए हुए central knowledge base बनाना, और फिर किसी भी provider के open source या black-box LLM को plug in करके इस्तेमाल करना होगा
इसी वजह से मैं चाहता था कि company Slack की जगह Mattermost self-hosting इस्तेमाल करे
संदर्भ के लिए, Windows 11 default रूप से files को Microsoft servers पर sync करता है
शायद बात ऐसी हो जाएगी: “इसे बस emoji चुनने में इस्तेमाल करेंगे, और अंदरूनी इस्तेमाल के एक मजेदार stock recommendation tool में थोड़ा-सा”
यानी सैकड़ों-हजारों tech companies की anonymized real-time अंदरूनी सोच के आधार पर खरीदने लायक मजेदार stocks recommend करने वाला tool