1 पॉइंट द्वारा GN⁺ 2023-12-18 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • University of Technology Sydney के शोधकर्ताओं ने केवल EEG मस्तिष्क तरंगों के आधार पर चुपचाप पढ़े जा रहे वाक्यों को स्क्रीन पर टेक्स्ट में बदलने वाली एक non-invasive brain-to-text तकनीक पेश की
  • AI मॉडल DeWave brain implant या MRI के बिना काम करता है, और उपयोगकर्ता केवल मस्तिष्क गतिविधि रिकॉर्ड करने वाली EEG cap पहनता है
  • EEG में implant-आधारित signals की तुलना में अधिक noise होता है, फिर भी इसने BLEU मानक पर लगभग 0.4 स्कोर किया और noun की तुलना में verb matching में बेहतर नतीजे दिखाए
  • “the author” का “the man” बन जाना जैसी त्रुटियाँ दिखीं, यानी सटीक शब्द के बजाय अर्थ में करीब शब्द चुनने की सीमा अभी मौजूद है
  • शोधकर्ताओं का मानना है कि सटीकता को 0.9 तक बढ़ाया जा सकता है; नतीजे NeurIPS में पेश किए गए, लेकिन ArXiV preprint अभी peer review से नहीं गुजरी है

केवल EEG से वाक्य पढ़ने का प्रयोग

  • University of Technology Sydney के GrapheneX-UTS Human-centric Artificial Intelligence Centre के शोधकर्ताओं ने raw EEG waveform को सीधे भाषा में बदलने की विधि पर प्रयोग किया
  • Ching-Ten Lin ने कहा कि brain-to-text अनुवाद प्रक्रिया में discrete encoding तकनीक को एकीकृत करने का यह पहला उदाहरण है
  • प्रतिभागियों ने टेक्स्ट के अंशों को चुपचाप पढ़ा, और AI मॉडल DeWave ने केवल मस्तिष्क तरंगों को input के रूप में लेकर स्क्रीन पर शब्द दिखाए
  • यह परिणाम AI और machine learning शोधकर्ताओं के वार्षिक सम्मेलन NeurIPS conference में spotlight paper के रूप में चुना गया

non-invasive तरीके के फायदे और मौजूदा सीमाएँ

  • मौजूदा brain signal-to-language तकनीकों से अलग, इस तरीके में brain implant या MRI उपकरण की जरूरत नहीं होती
    • इसे eye-tracking software जैसे अतिरिक्त input के बिना भी इस्तेमाल किया जा सकता है
    • शोधकर्ताओं का मानना है कि इसे अन्य उपकरणों के साथ मिलाकर भी उपयोग किया जा सकता है
  • उपयोगकर्ता को केवल EEG से मस्तिष्क गतिविधि रिकॉर्ड करने वाली cap पहननी होती है
    • EEG signals में implant से मिलने वाली जानकारी की तुलना में ज्यादा noise होता है
    • BLEU algorithm के मानक पर इसका स्कोर लगभग 0.4 है
  • Yiqun Duan ने बताया कि मॉडल noun की तुलना में verb matching में अधिक सक्षम है
    • noun के मामले में “the author” की जगह “the man” जैसे परिणाम आए, जहाँ सटीक अनुवाद के बजाय समानार्थी या अर्थ में करीब शब्द आने की प्रवृत्ति दिखी
    • शोधकर्ताओं का मानना है कि जब मस्तिष्क शब्दों को प्रोसेस करता है, तो अर्थ में समान शब्द समान मस्तिष्क तरंग पैटर्न बना सकते हैं
  • भविष्य का लक्ष्य 0.9 सटीकता है
    • 0.9 का स्तर पारंपरिक language translation programs के तुलनीय माना जाता है
    • प्रयोग में 29 प्रतिभागी थे, जिसे कई अन्य decoding तकनीक प्रयोगों की तुलना में एक order अधिक माना गया
  • नतीजे NeurIPS में पेश किए गए और preprint ArXiV पर उपलब्ध है
    • यह अभी peer review से नहीं गुजरी है

1 टिप्पणियां

 
GN⁺ 2023-12-18
Hacker News राय
  • brain-computer interface में PhD किया है, और EEG व implant electrodes के साथ काम किया है
    BCI रिसर्च का बड़ा हिस्सा लकवाग्रस्त मरीजों को फिर से communication करने में मदद करने पर केंद्रित है
    दुर्भाग्य से, Faraday cage वाली लैब, कई दिनों/हफ्तों तक noise removal, और eye-movement artifacts हटाने जैसी शर्तों के बाहर EEG पर्याप्त signal-to-noise ratio नहीं देता, इसलिए अच्छी communication speed पाना मुश्किल है
    यह skull से बाहर आते समय brain electric field के कमजोर हो जाने की physical limit है, इसलिए इसे पार करना आसान नहीं है। उदाहरण के लिए commercial “mind-reading” toys असल में head और eye muscle signals के आधार पर काम करते हैं
    Implant electrodes बेहतर signal देते हैं, लेकिन commercially viable बनने के लिए अभी कई iterations की जरूरत है। कुछ महीनों बाद brain electrodes के आसपास scar tissue बना देता है, जिससे signal degrade होता है, और brain surgery खुद भी जाहिर तौर पर काफी risky है
    Human testing के लिए government approval चाहिए, इसलिए iteration cycle भी बहुत धीमी है। अगर मेरा कोई लकवाग्रस्त दोस्त सिर्फ आंखें हिला सकता हो, तो मैं निश्चित रूप से eye-tracking technology पर focus करूंगा। यह मेरे सुने हुए हर BCI से कहीं बेहतर है

    • Elon की Neuralink के बारे में आपका क्या नजरिया है, यह जानने की उत्सुकता है
      और यह भी कि क्या आपको लगता है कि article में बताए अनुसार अच्छे AI algorithms बहुत-सा noise filter करने या interpret करने में मदद कर सकते हैं
    • हाल ही में मैंने दो दिन का mobile EEG test कराया था, और जब भी मैं कोई ऐसा काम करता था जो electrically noisy हो सकता था, उसे record करता था
      जैसे metal detector से गुजरना या mobile phone को छूना
      उम्मीद के मुताबिक सबसे बड़े noise sources में से एक charging में लगे phone को छूना था
      EEG के लिए Faraday beanie जैसी चीज वाकई काम कर सकती है, और अगर supplementary first-person video भी जोड़ दें तो doctors काफी noise filter कर पाएंगे
    • यह नई technology को असंभव बताकर बहुत आत्मविश्वास से खारिज करने जैसा लगता है। बेशक इस forum को ऐसी चीजें पसंद हैं, लेकिन GPT के समय भी ऐसा ही हुआ था
      यह paper खुद बल्कि इस बात का काफी मजबूत evidence लगता है कि algorithms बेहतर होने से EEG का signal-to-noise ratio problem सुधर सकता है
    • हाल ही में Swiss-French team ने brain और legs के बीच communication संभव किया था, और device भी काफी mature लग रहा था
      Patient शायद spinal side की nerves damaged होने वाला case था। यह promising development लगा, इस पर आपकी राय जानना चाहूंगा
      https://actu.epfl.ch/news/thought-controlled-walking-again-a...
    • मैं मानता हूं कि signal-to-noise ratio बहुत खराब है, लेकिन strongly लगता है कि पर्याप्त data हो तो फिर भी चौंकाने वाली progress हो सकती है
      जैसे keyboard वाले कमरे के audio से क्या type किया गया था उसे reconstruct करना; noise में से signal वापस निकालने की deep learning की क्षमता को कम करके नहीं आंकना चाहिए
      सबसे बड़ी challenge शायद signal से correlated EEG data बनाने की relatively high cost हो सकती है। इसलिए किसी known target को देखने या process करने वाले लोगों के millions of hours data को model में डालना मुश्किल है
      दूसरी ओर eye-tracking data नए consumer hardware का core component बनते हुए जल्द ही बहुत तेजी से बढ़ेगा
  • सही जवाब: Bob attended the University of Texas at Austin where he graduated, Phi Beta Kappa with a Bachelor’s degree in Latin American Studies in 1973, taking only two and a half years to complete his work, and obtaining generally excel- lent grades
    Prediction: was the University of California at Austin in where he studied in Beta Kappa in a degree of degree in history American Studies in 1975. and a one classes a half years to complete the degree. and was a excellent grades
    वाह, यह 70–80 के दशक के शुरुआती speech-to-text conversion systems जैसा दिखता है। Brain interface तेजी से science fiction के दायरे से बाहर निकलकर reality बन रहा है। अभी समझ नहीं आ रहा कि इसे कैसे लिया जाए

    • Figure 1 actual result नहीं, बल्कि paper का “goal” दिखाने वाली illustration है
      Actual results Table 3 में हैं, और वे काफी खराब हैं
    • trained model को बस उस व्यक्ति द्वारा सोची जाने वाली expected language पर trained large language model के साथ combine करने से यह बहुत तेजी से काफी बेहतर हो सकता है
      यानी TTS model उस चीज की bottom-up processing जिसे वह व्यक्ति “सोच रहा है” मानता है, और अब तक की conversation को देखते हुए grammar model किसी average person के “अगली बात कहने” के बारे में जो top-down processing मानता है—इन दोनों के बीच balance खोजने का तरीका। असली neocortex की तरह
      सोचें तो, अगर उस व्यक्ति की transcribed conversation corpus हो, तो LLM को उसी के हिसाब से train भी किया जा सकता है। तब यह लगभग ठीक-ठीक “यह व्यक्ति इस समय क्या कहेगा” predict करने के function से मेल खाता है
      शायद EEG pad positions और भी खोजी जा सकती हैं जो AMPAR और NMDAR action के electrical परिणाम पढ़ सकें। इससे पता लगाया जा सकेगा कि व्यक्ति अभी अपने internal top-down speech model पर कितना निर्भर है, या वह पहले कभी न सोचे गए अजीब और नए वाक्य बनाने के लिए internal bottom-up processing इस्तेमाल कर रहा है; और इस जानकारी से TTS model और LLM का output पर influence weight adjust किया जा सकेगा
    • अगर “समझ नहीं आ रहा कि इसे लेकर कैसा महसूस करें”, तो हम आपके लिए पढ़ देंगे
    • यह जरूर open source या paid commercial-grade technology ही होनी चाहिए
      कोई न कोई maximum surveillance करने वाला “free” BCI जरूर निकालेगा
    • यह podcast उस future को शानदार तरीके से cover करता है जिसकी ओर हम दौड़ रहे हैं
      https://www.youtube.com/watch?v=OSV7cxma6_s
      “जब ये सारी technologies अकल्पनीय गति से आगे बढ़ रही हैं, future पर नजर रखने वाले futurist Peter Diamandis आपकी सोच को झकझोर देंगे और healthspan के बारे में नई संभावनाएं और अवसर कल्पना करने पर मजबूर करेंगे”
  • इसमें यह हिस्सा है कि “यह मस्तिष्क संकेतों को भाषा में अनुवाद करने वाली पहली तकनीक नहीं है, लेकिन अब तक आई तकनीकों में यह अकेली है जिसे न तो brain implant की ज़रूरत है और न ही पूरी तरह की MRI मशीन तक पहुंच की”
    सोचता हूं कि 10–20 साल बाद sensor technology इतनी बेहतर हो जाए कि टोपी पहनने की भी ज़रूरत न रहे, तो क्या कोई यह कहने लगेगा कि सार्वजनिक जगहों पर आपके विचार पढ़े न जाने की कोई वाजिब उम्मीद नहीं है
    surveillance technology आम तौर पर सामान्यीकृत हो जाती है, और यह भी सोचने वाली बात है कि इसके कितनी दूर तक जाने की कोई वास्तविक सीमा है भी या नहीं

    • तब तक शायद हम tinfoil hat पहनना शुरू कर देंगे
    • मस्तिष्क संकेत पढ़ने की बात न भी हो, तो सिर्फ aggregated data processing से ही कोई centralized processing entity आपके बारे में लगभग सब कुछ जान सकती है
      10 साल से भी पहले Target के loyalty program algorithm के बारे में कहानी थी कि उसने खरीदारी में बदलावों के correlation—जैसे scented candles से unscented candles पर जाना—देखकर एक किशोरी की pregnancy का पता उसके परिवार को बताने से पहले ही लगा लिया था
      अगर social media, CCTV की face और gaze tracking, फोन के gyroscope data, खरीदारी के records, search history, और आपके connected acquaintances का वही data मिल जाए, तो पर्याप्त बड़े comparison dataset से हर तरह के छिपे हुए राज़ निकाले जा सकते हैं
      यह “मेरा फोन मेरी बातें सुन रहा है” वाले डर जैसा है। असल में वह सुन नहीं रहा होता, लेकिन ज़्यादा चिंता की बात यह है कि बिना छिपकर सुने भी वह बहुत सटीक अंदाज़ा लगा लेता है कि आप आखिर क्या कहने वाले हैं
    • https://en.m.wikipedia.org/wiki/The_Hood_Maker
    • हम अभी भी 1970 के दशक जैसी ही विधि, यानी keyboard और screen से कंप्यूटर चलाते हैं
      मुझे बहुत उम्मीद नहीं है
  • यह बेहद प्रभावशाली और उपयोगी है, और साथ ही डरावना भी
    सबने तुरंत interrogation के लिए mind reading की बात सोची, लेकिन आत्म-चिंतन का क्या? क्योंकि हम पूरी तरह objectively अपना self-analysis नहीं कर सकते, इसी वजह से education और therapy के कई रूप मौजूद हैं
    अगर अपने thought patterns को दिमाग के बाहर analyze किया जा सके, तो तरह-तरह के सुधार संभव हो सकते हैं। यह पता लगाया जा सकता है कि कौन-सी teaching technique सच में सबसे असरदार है, कब हम सबसे ज़्यादा या सबसे कम focused होते हैं यह objectively देखा जा सकता है, और anxious thoughts कब शुरू हुए और उन्हें किसने trigger किया, यह भी ठीक-ठीक पहचाना जा सकता है
    सबसे बढ़कर, इसे निजी तौर पर, partner के साथ, या किसी group में चुनिंदा तरीके से किया जा सकता है
    साथ ही आज भी fMRI को brain-scan lie detector की तरह इस्तेमाल किया जा सकता है। हालांकि उसकी वैधता पर अब भी कई सवाल हैं
    https://scholarship.law.columbia.edu/cgi/viewcontent.cgi?art...

    • हर सुबह 15 मिनट diary text file में type करने का तरीका पहले से मौजूद है, और मुफ्त है
    • डर एक मजबूत emotion है, और हमें यह तो बहुत कम पता है कि इससे क्या मिलेगा, लेकिन यह बहुत पता है कि क्या खो सकता है
    • automatic logging शानदार लगती है
      मुश्किल सिर्फ self-reflection नहीं है, बल्कि यह भी है कि बाद में analysis के लिए याद रखना पड़ता है कि किस बात पर reflection करना है और events लिखकर रखने पड़ते हैं। यह तभी संभव है जब accuracy पर भरोसा किया जा सके
    • निजी विचारों के खत्म हो जाने के फायदे सोचना आसान नहीं है
      इस मुद्दे में ethical holes ब्रह्मांड जितने बड़े हैं, फिर भी सीधे फायदों पर कूद जाना हैरान करता है
      हालांकि शायद tech optimist का स्वभाव यही होता है
  • 14 साल पहले DARPA का Silent Talk याद आता है
    लक्ष्य था “neural signal analysis के जरिए battlefield में बोले गए speech के बिना users के बीच communication संभव बनाना”
    https://www.engadget.com/2009-05-14-darpa-working-on-silent-...

    • silent speech recognition पर भी उतने ही लंबे समय से research हो रही है
  • यह बेहद प्रभावशाली और उपयोगी है, और साथ ही डरावना भी
    लगता है यह stroke patients की मदद कर सकता है, लेकिन साथ ही कल्पना करता हूं कि unfiltered thoughts बाहर आ सकते हैं और मुश्किल खड़ी हो सकती है

    • सही है। इसलिए 2200 में job applications शायद विचारों को सीधे analyze करके जल्दी process होंगी
      Neuralink हो तो कोई समस्या नहीं। बस thought traces सीधे upload कर दो
      गलत विचार हों तब भी चिंता की ज़रूरत नहीं। mental state बदलने वाले rehabilitation schools होंगे
      खुश रहना है, यह मत भूलना। उदास होना मना है
      अभी तो read-only है, लेकिन write का क्या?
      यह real-life Matrix जैसी नई संभावनाएं भी खोल सकता है
      वैसे Lightspeed Briefs के बारे में सुना है?
      बेशक research अपने आप में बेहतरीन है और उपयोगी होगी। लेकिन long term में political misuse की संभावना बहुत बड़ी है
    • law enforcement agencies और employers को यह बहुत पसंद आएगा
      locked-in syndrome patients के लिए यह कल्पना से परे positive benefit है, लेकिन साथ ही यह ऐसी बात भी लगती है कि “Torment Nexus बनाना बंद करो!”
    • फिर भी यह अच्छी बात है कि शायद आखिरकार हम बात कर पाएंगे कि हमारे unfiltered thoughts क्या होते हैं, उनसे हमें कितना नियंत्रण या editing करने की उम्मीद की जाती है, और psychologically helpful तरीके से ऐसा कैसे किया जाए
    • presidential candidate debates या bills explain करते समय इसे पहनाने की कल्पना करें, तो यह democracy में बड़ा सुधार कर सकता है और लोगों को सच में समझा सकता है कि वे किस चीज़ के लिए vote कर रहे हैं
    • unfiltered thoughts, Tourette syndrome के कुछ forms जैसी मौजूदा problems से भी बहुत दूर नहीं हैं
  • अगर मैं कोई बड़ी बात मिस नहीं कर रहा हूं, तो एक ब्लाइंड कंट्रोल डेमो ज्यादा भरोसेमंद होगा, जिसमें प्रतिभागी शब्दों को कागज पर लिखकर रखे और बाद में नतीजों से तुलना की जाए
    अफसोस, लेख में दिखाया गया डेमो ऐसा लगा कि कोई पेशेवर जादूगर या mentalist भी कर सकता है
    यह सही है कि हम brain interface के करीब पहुंच रहे हैं, लेकिन इस मामले में कुछ अजीब है
    मान लीजिए कुछ साल बाद कोई “बुरे विचार” detect करने वाला airport scanner बना देता है। लेकिन उसे verify करने का कोई तरीका नहीं है, और false positive/false negative की कोई जिम्मेदारी भी नहीं। नतीजा वही है जो operator कहता है
    अगर पर्याप्त लोग इसे इतनी हद तक स्वीकार कर लें कि विरोध न करें, और यहां तक कि detect हुए लोगों पर हमला भी करें, तो असल में क्या सच है, यह मायने नहीं रखता। यह बस एक साझा सहानुभूति वाला जादुई अनुष्ठान बन जाता है जिसमें लोग मिलकर हिस्सा लेते हैं। हाल की यादों में भी ऐसी ही dynamics के उदाहरण महसूस होते हैं

  • सोच रहा हूं कि क्या गैर-भाषाई सोच भी संभव होगी
    रोजमर्रा की गतिविधियों से जुड़े signal dataset के आधार पर क्या हम यह पता लगा सकते हैं कि कुत्ता क्या सोच रहा है या क्या सपना देख रहा है
    शरीर से अनुभव की गई चीजों की अभिव्यक्ति को output करना ठीक से बनाना और interpret करना मुश्किल काम होगा। हालांकि शारीरिक अनुभव से जुड़े signal dataset को vision-language models की मदद से भाषा में विवरण देकर ज्यादा आसानी से और robust तरीके से annotate किया जा सकता है
    तब dog mind-reading model उन भाषाई विवरणों को predict करके output कर सकता है
    कल्पना कीजिए कि आप ठीक-ठीक जान सकें कि आपका pet dog किस पार्क में जाना चाहता है, क्या वह किसी बीमारी या चोट के subtle शुरुआती संकेत महसूस कर रहा है, या कौन-सा snack खरीदवाना चाहता है

  • संदर्भ के लिए, इस paper में इस्तेमाल किए गए foundation model में code bug है, जिसकी वजह से baseline results बढ़े-चढ़े दिखे
    फिलहाल इस समस्या की जांच चल रही है
    https://github.com/duanyiqun/DeWave/issues/1

  • डरावने implications को छोड़ दें, तो यह एक बेहद शानदार चीज संभव बनाता है: दो-तरफा telepathic communication
    आप message के बारे में सोचें और “send” के बारे में सोचें, फिर earbuds में reply सुनें। voice cloning जोड़ दें तो message भेजने वाले की आवाज में मिल सकता है
    बाहरी observer के लिए यह पूरी तरह शांत और अदृश्य होगा

    • शायद earbuds की भी जरूरत न पड़े
      इस system के hardware को एक तरह के transducer की तरह इस्तेमाल करने के नतीजे मुझे बहुत उत्सुक करते हैं। यानी यहां के machine learning model को target text से उल्टी दिशा में चलाना, और निकले हुए lower-level electrical signals को transcranial direct current stimulation signals के रूप में EEG pads के जरिए वापस भेजना
      अगर नतीजे में इंसान उस text को अपने मन की आवाज में verbal thought के तौर पर “सुन” पाए, तो यह वाकई दिलचस्प होगा
    • सिर पर 72 EEG probes लगाने वाली बात छोड़ दें तो अदृश्य है
    • 20 साल पहले मैंने कल्पना भी नहीं की थी कि कोई दिन ऐसा आएगा जब smartphone कुछ उबाऊ लगने लगेंगे
      तब GameBoy Color दुनिया की सबसे शानदार चीज थी
      PsOne का Tomb Raider high resolution जैसा दिखता था, और high resolution नाम की चीज भी मौजूद नहीं थी; हमें लगता था कि हम gaming के शिखर पर पहुंच गए हैं
      Apple Pro One कंप्यूटर को spatial बनाने की कोशिश कर रहा है, और हमें telepathy cool लगती है
      अच्छा होगा अगर जंगल में दौड़ते हुए या scuba diving करते हुए, 10-10 सेकंड के लिए सिर्फ मन से coding कर सकें
      अच्छा होगा अगर किसी और के मन में बनी image को लेकर अपने सामने प्रकट कर सकें और आसपास के लोगों से कह सकें, “अरे, Julia ने जो बनाया है उसे देखो”
      असल में यह ठीक वही है जो अभी भी होता है, बस और ज्यादा immediate तरीके से। smartphone को मन से और screen को environment से बदल दें, तो आप उस future world में पहुंच चुके हैं
      अगर novelty की वजह से यह cool दिखता है, तो फिर punch cards पर code punch करना या terminal में ed से lines लिखना भी cool नहीं होगा क्या
      कुछ साल पहले मैं DAW music production से 70–84 के दशक के 10 synthesizers और tape machine पर शिफ्ट हुआ, और वह कहीं ज्यादा cool लगा; वापस जाने का इरादा नहीं है
      लेकिन क्या मैं पहले जितनी तेजी से बना रहा हूं? नहीं
      मैं सिर्फ अपने मन और virtual floating screens से code लिखना क्यों चाहूंगा—novelty से मिलने वाले कुछ दिनों के cool factor को हटाकर—इसकी बस एक वजह है
      क्योंकि मैं कम काम करना चाहता हूं, और ज्यादा सही कहें तो workplace में कम रहना चाहता हूं
      लेकिन हकीकत में मुझसे और ज्यादा काम बनाने को कहा जाएगा। सिर्फ मन की ताकत से, अपने आसपास 5–6 virtual screens तैराते हुए काम करना अनिवार्य हो जाएगा
      और बस यही होगा। जब तक कोई और नया आविष्कार cool न दिखने लगे
    • मैं इसे कभी इस्तेमाल नहीं करूंगा, क्योंकि मैं अपने विचारों को 100% control नहीं कर सकता
      जैसे intrusive thoughts, दिमाग में घूमते रहने वाले गाने, secrets वगैरह
    • जो चाहते हैं, उससे सावधान रहना चाहिए
      इस technology के unintended consequences कल्पना से परे होंगे