- सॉफ़्टवेयर का केंद्र स्क्रीन और मेनू से हटकर बातचीत/डेलीगेशन/बैकग्राउंड एक्जीक्यूशन की ओर जा रहा है, और इसके साथ UX डिज़ाइन का विषय भी स्थिर स्क्रीन नहीं बल्कि उपयोगकर्ता की मंशा को समझकर कार्रवाई करने वाली सिस्टम बन रही है
- चैट हर काम को बदल देने वाला इंटरफेस नहीं है; जब उपयोगकर्ता को साफ़ पता हो कि उसे क्या चाहिए, तब structured GUI उपयुक्त है, और केवल तब conversational interface सही है जब लक्ष्य अस्पष्ट हो
- वॉइस को सामाजिक इंटरैक्शन की तरह लिया जाता है, इसलिए एक-बार के कमांड से ज़्यादा बातचीत के संदर्भ को बनाए रखना महत्वपूर्ण है, और latency/context loss/error recovery स्क्रीन-आधारित इंटरफेस की तुलना में कहीं अधिक गंभीर समस्या बन जाते हैं
- एजेंटिक AI बिना इंटरफेस के भी काम कर सकता है, लेकिन उपयोगकर्ता के भरोसे के लिए उसे action plan, प्रोग्रेस, permission scope और irreversible point दिखाने होंगे; इसके मुख्य पैटर्न हैं plan visibility/progressive delegation/graceful intervention
- तीनों पैरेडाइम UX का केंद्र interaction flow से हटाकर मंशा और भरोसे के रिश्ते पर ले जाते हैं, लेकिन यह बुनियादी सिद्धांत नहीं बदलता कि उपयोगकर्ता चाहते हैं कि उन्हें समझा जाए, उनका नियंत्रण बना रहे, और उनके समय व ध्यान का सम्मान हो
स्क्रीन-केंद्रित UX का विभाजन
- पिछले 30 वर्षों में UX डिज़ाइन का काम स्क्रीन, मेनू, modal, button, carousel और states के बीच flow को डिज़ाइन करना था
- window, folder और file से बना desktop metaphor डिजिटल प्रोडक्ट बनाने के लिए एक साझा शब्दावली देता था
- यह शब्दावली गायब नहीं हो रही, बल्कि कई ऐसी interaction शैलियों में बंट रही है जो एक-दूसरे से लगभग मिलती-जुलती नहीं हैं
- उपयोगकर्ता सॉफ़्टवेयर से बात करते हैं, काम डेलीगेट करते हैं, और कभी-कभी केवल वही नतीजे देखते हैं जो पहले से बैकग्राउंड में पूरे हो चुके होते हैं
- स्क्रीन बनी रहती है, लेकिन वह अब इंसान और प्रोडक्ट के बीच के मूल अनुबंध का प्रतिनिधि सतह नहीं रह गई है
- आज UX को फिर से गढ़ने वाले तीन पैरेडाइम हैं चैट, वॉइस और एजेंटिक AI, और हर एक अलग interaction contract मांगता है
चैट कोई universal interface नहीं है
- 2022 में बहुत कम लोगों ने प्रोडक्ट इंटरफेस में natural language command डालकर देखा था, लेकिन 2025 तक 73% कंपनियां customer interaction में किसी न किसी रूप में conversational interface इस्तेमाल करने लगेंगी
- टेक्स्ट इनपुट बॉक्स एक मुख्य UI तत्व के रूप में उभरा है, लेकिन सिर्फ चैट अच्छा UX सुनिश्चित नहीं करती
- Erika Hall की Conversational Design यह फर्क करती है कि बातचीत केवल तब उपयुक्त है जब सिस्टम और उपयोगकर्ता को मिलकर अर्थ तय करना हो
- अगर उपयोगकर्ता पहले से जानता है कि उसे
कार्ट में जोड़ें,कीमत के अनुसार फ़िल्टर,फ़ॉर्म सबमिटजैसा कौन-सा काम करना है, तो structured interface ज़्यादा तेज़, सटीक और कम थकाने वाला होता है - जब उपयोगकर्ता खोजबीन कर रहा हो, लक्ष्य अस्पष्ट हो, और अपनी मांग को क्लिक या फ़ॉर्म से व्यक्त करना कठिन हो, तब बातचीत उपयोगी होती है
- अगर उपयोगकर्ता पहले से जानता है कि उसे
- इस सोच को अपनाने वाले प्रोडक्ट सिर्फ चैट से पूरे प्रोडक्ट को नहीं बदलते, बल्कि hybrid interface इस्तेमाल करते हैं
- Notion AI दस्तावेज़ को नहीं बदलता, बल्कि दस्तावेज़ के बगल में sidebar में काम करता है
- Linear का command palette उन टिकटों के creation को संभालता है जिन्हें उपयोगकर्ता पहले से जानता है, और AI “मोबाइल टीम को क्या ब्लॉक कर रहा है?” जैसे अस्पष्ट सवालों को संभालता है
- GitHub Copilot IDE को चैट विंडो से नहीं बदलता, बल्कि मौजूदा work environment के भीतर inline suggestion देता है
- मुख्य मानदंड यह है कि जब उपयोगकर्ता की मंशा स्पष्ट हो तो structured GUI, और जब मंशा अस्पष्ट हो तो बातचीत का उपयोग किया जाए
- अगर चैट को हर interface समस्या का universal समाधान मान लिया जाए, तो अनावश्यक interaction cost पैदा होती है
मंशा की स्पष्टता ही इंटरफेस तय करती है
- multi-stage intent-based recommendation system पेटेंट US20260065349A1 requests को दो स्तरों में बांटता है
- micro intent वह request है जिसमें उसी category के भीतर भरोसा अधिक हो
- macro intent वह exploratory goal है जो कई categories के बीच जाता है
- कौन-सा इंटरफेस दिया जाए, यह इस पर निर्भर होना चाहिए कि प्रोडक्ट चैट-केंद्रित है या GUI-केंद्रित नहीं, बल्कि इस पर कि उपयोगकर्ता की मंशा कितनी स्पष्ट है
- Perplexity search box को बेहतर बनाने के बजाय हर सवाल के लिए summary, source citation, follow-up question और structured data को real time में जोड़कर एक answer page बनाता है
- रिसर्च में उस तरीके को, जिसमें उपयोगकर्ता अपनी चाहत बताता है और उसी उद्देश्य के मुताबिक इंटरफेस तुरंत तैयार हो जाता है, Generative UI कहा जाता है
- डिज़ाइनर हर screen state को सीधे बनाने के बजाय सही states पैदा करने वाली system और rules डिज़ाइन करने लगते हैं
- यह तैयार वाक्य लिखने की भूमिका से उस grammar को बनाने की भूमिका में बदलाव है जो वाक्य पैदा करेगी
जनरेटिव इंटरफेस में भरोसे की डिज़ाइन
- अगर generated result को एक साथ दिखाने के बजाय टेक्स्ट को क्रमवार दिखाया जाए, तो उपयोगकर्ता यह समझते हैं कि सिस्टम रुकी नहीं है बल्कि काम कर रही है
- generation के दौरान हमेशा दिखने वाला stop button उपयोगकर्ता को यह एहसास देता है कि वह opaque process में हस्तक्षेप कर सकता है
- क्लिक किए जा सकने वाले source citation chatbot को अंतिम सत्य सुनाने वाले oracle से बदलकर ऐसे सहयोगी में बदल देते हैं जिसके साथ सबूत की समीक्षा की जा सके
- streaming, stop button और source display जैसी छोटी interaction design choices पूरे सिस्टम के भरोसे और अपनाए जाने की संभावना तय करती हैं
वॉइस command channel नहीं, social channel है
- smart speaker दौर से ही वॉइस इंटरफेस को ambient computing का मुख्य हिस्सा बताया गया था, लेकिन वास्तविक अनुभव उम्मीदों तक नहीं पहुंचा
- 2025 के अंत से बदलाव का केंद्र स्क्रीन नहीं बल्कि कान बनने लगा
- जून 2026 में घोषित Siri AI को फ़ोन पर चिपका हुआ voice assistant नहीं, बल्कि devices के पार फैली conversational layer के रूप में पेश किया गया
- iPhone पर शुरू हुआ सवाल iPad पर जारी रखा जा सकता है और बातचीत का संदर्भ बना रहता है
- यह स्क्रीन पर दिख रही चीज़ों को पहचानता है और email, calendar और photos के व्यक्तिगत संदर्भ का उपयोग करता है
- संवेदनशील requests को privacy-सुरक्षित on-device inference से संभाला जाता है, और AirPods को सहायक डिवाइस नहीं बल्कि मुख्य इंटरफेस तक बढ़ाया जाता है
- Clifford Nass और Scott Brave की Wired for Speech यह विश्लेषण करती है कि इंसान वॉइस को command channel नहीं बल्कि social interaction channel की तरह लेते हैं
- आवाज़ सुनते ही reciprocity, context और relationship की अपेक्षा करने वाली social cognition system सक्रिय हो जाती है
- पुराना Siri transactional model था, जहां कमांड दिया, नतीजा मिला और रिश्ता समाप्त हो गया; इसलिए वह इन अपेक्षाओं से मेल नहीं खाता था
- नया model बातचीत, devices और समय के पार context बनाए रखने वाली relational structure की ओर जाता है
Humane AI Pin और Rabbit R1 ने असफलता की शर्तें दिखाईं
- Humane AI Pin स्क्रीन-रहित, voice-first wearable प्रोडक्ट था जिसमें 240 million dollar लगाए गए; यह अप्रैल 2024 में 699 dollar पर लॉन्च हुआ, लेकिन एक साल पूरा होने से पहले ही बंद हो गया
- Cathy Pearl की Designing Voice User Interfaces वॉइस अनुभव को तय करने वाले मुख्य variables के रूप में latency और error recovery को पेश करती है
- AI Pin को रोज़मर्रा के सवालों में भी 2~5 सेकंड लगते थे, और voice interface में 2 सेकंड भी बहुत लंबे लगते हैं
- हर interaction के साथ state reset हो जाती थी, इसलिए वह बातचीत की बुनियादी शर्त यानी persistent context दे ही नहीं पाया
- Rabbit R1 को लॉन्च के समय वही समस्या झेलनी पड़ी, लेकिन hardware बदलने से नहीं बल्कि 2025 के अंत में RabbitOS 2 द्वारा voice interaction की ज़रूरतों को प्रतिबिंबित करने के बाद सुधार हुआ
- voice UX स्क्रीन की तुलना में latency और context loss के प्रति कहीं अधिक संवेदनशील है
- स्क्रीन पर उपयोगकर्ता आसपास के तत्वों को देखकर फिर से समझ सकता है कि वह कहां है
- वॉइस में spatial memory को सहारा देने वाले visual reference point नहीं होते, इसलिए बातचीत का flow टूटने पर recovery मुश्किल हो जाती है
- तेज़ response, context retention और natural error recovery के लिए infrastructure की मांग भी अधिक होती है
कान और शरीर के लिए नए डिज़ाइन एलिमेंट
- spatial audio स्क्रीन की जगह लेने वाली feedback layer के रूप में उभर रहा है
- AirPods का real-time audio scene analysis signal और आसपास के शोर में फर्क करके आवाज़ को खुद state communication का माध्यम बना सकता है
- wearable की haptic vibration स्क्रीन देखे बिना action complete होने की पुष्टि करने देती है
- voice paradigm सिर्फ फ़ोन से बात करने की क्षमता नहीं, बल्कि cooking, walking और driving जैसी दूसरे काम करते समय होने वाली interaction को डिज़ाइन करने की समस्या है
- उपयोगकर्ता का ध्यान प्रोडक्ट पर केवल आंशिक रूप से रहता है
- context स्क्रीन के भीतर नहीं बल्कि शारीरिक गतिविधि और आसपास के माहौल में शामिल होता है
- केवल screen layout-केंद्रित डिज़ाइन मॉडल से इसका सामना करना मुश्किल है
एजेंटिक AI बिना इंटरफेस के कार्रवाई करता है
- एजेंटिक AI सवालों के जवाब देने से आगे बढ़कर tools का उपयोग करता है, web browse करता है, code लिखता है, email भेजता है और forms submit करने जैसी कई कार्रवाइयां करता है
- 2024~2025 के बीच यह research demo से वास्तविक प्रोडक्ट तक पहुंचा
- OpenAI Operator restaurant booking करता है
- Anthropic Claude computer use API के जरिए उपयोगकर्ता की ओर से web browser चलाता है
- Salesforce Agentforce बिना मानवीय हस्तक्षेप के customer service case को शुरू से अंत तक संभालता है
- Gartner का अनुमान है कि 2025 में 5% से कम रहने वाला task-specific AI agents को integrate करने वाले enterprise applications का हिस्सा 2026 के अंत तक 40% तक पहुंच जाएगा
- एजेंट को काम करने के लिए इंटरफेस की ज़रूरत नहीं होती, लेकिन उपयोगकर्ता के भरोसे के लिए उसकी कार्रवाइयों को समझने और नियंत्रित करने वाला दिखाई देने वाला इंटरफेस ज़रूरी है
ऑटोमेशन और मानव नियंत्रण को साथ-साथ बढ़ाना
- Ben Shneiderman की Human-Centered AI के अनुसार मानव निर्णय को autonomous agent से बदलने वाला तरीका तकनीकी रूप से जल्दबाज़ी और नैतिक रूप से जोखिमभरा है
- विकल्प यह नहीं है कि ऑटोमेशन घटाकर human control लिया जाए या human control हटाकर ऑटोमेशन बढ़ाया जाए, बल्कि उच्च human control और उच्च automation दोनों साथ दिए जाएं
- इंसान की भूमिका को न्यूनतम करने के बजाय supervision को समझने में आसान, सुलभ और कम बोझिल बनाकर डिज़ाइन करना चाहिए
- एजेंटिक UX का लक्ष्य autonomy और control में से किसी एक को चुनना नहीं, बल्कि शुरू से ही controllable autonomy बनाना है
एजेंट transparency का paradox
- बिना कुछ बताए चुपचाप काम करने वाला एजेंट efficient हो सकता है, लेकिन डर भी पैदा कर सकता है
- हर कार्रवाई लगातार समझाने वाला एजेंट भरोसेमंद लग सकता है, लेकिन वह उपयोगकर्ता को system log से थका सकता है
- सही डिज़ाइन में इतना दिखना चाहिए कि उपयोगकर्ता को नियंत्रण महसूस हो, लेकिन जानकारी इतनी सीमित भी रहे कि वह सिस्टम की अंदरूनी गतिविधि से अभिभूत न हो
- वास्तविक रूप से deploy किए गए agent products में आम पैटर्न हैं plan visibility, progressive delegation और graceful intervention
योजना की दृश्यता
- एजेंट को कार्रवाई शुरू करने से पहले उपयोगकर्ता को दिखाना चाहिए कि वह क्या करने वाला है
POST /api/calendar/event를 실행합니다जैसी system language नहीं, बल्कि “मैं आपके बताए रेस्तरां में शाम 7 बजे की टेबल बुक करने जा रहा हूँ। पहले उपलब्ध सीट देख लूँ?” जैसी इंसान-समझने योग्य भाषा इस्तेमाल करनी चाहिए- execution से पहले preview वह बिंदु बनता है जहां उपयोगकर्ता तय करता है कि वह सिस्टम पर भरोसा करेगा या नहीं
- multi-agent reinforcement learning research में भी यह दिखाया गया कि कई agents को system consistency बनाए रखने के लिए action से पहले plan share करना होता है
क्रमिक डेलीगेशन
- एजेंट को शुरू से पूरी autonomy नहीं देनी चाहिए; उसे जितना भरोसा मिले उतना ही विस्तार मिलना चाहिए
- Intercom का agent पहले सरल और high-confidence tasks संभालता है, और high-risk actions से पहले approval मांगता है
- उपयोगकर्ता की पिछली approval history trust model की तरह काम करती है, और जैसे-जैसे agent अपनी reliability साबित करता है, उसे wider action permissions मिलती हैं
- इंसान loop में सीधे काम करके नहीं, बल्कि वे सीमाएं तय करके बना रहता है जिन्हें agent को पार नहीं करना चाहिए
graceful intervention और irreversible actions
- उपयोगकर्ता को agent workflow के किसी भी बिंदु पर stop मांगने और नियंत्रण वापस लेने में सक्षम होना चाहिए
- agent email भेजने या flight ticket बुक करने जैसे मुश्किल से undo होने वाले actions कर सकता है, इसलिए साधारण undo feature पर्याप्त नहीं है
- सिस्टम को action के बाद recovery की कोशिश करने के बजाय irreversible point पार करने से पहले उसे साफ़ चिह्नित करना और approval लेना चाहिए
explainability ही प्रोडक्ट बन जाती है
- जब clinical AI systems ने बिना आधार बताए सिर्फ recommendations दिखाईं, तो medical staff ने उनका उपयोग नहीं किया
- इंटरफेस बदलकर एक समय में केवल एक recommendation दिखाने, reason panel देने और एक क्लिक में dismiss करने की सुविधा देने के बाद adoption बढ़ा
- AI model या recommendation result नहीं बदले; केवल इंटरफेस बदला गया
- एजेंटिक UX में explainability regulatory compliance के लिए बाद में जोड़ी गई चीज़ नहीं, बल्कि उपयोगकर्ता को प्रोडक्ट अपनाने के लिए प्रेरित करने वाला मुख्य product experience है
स्क्रीन state से system behavior तक
- डिज़ाइनर अब सिर्फ इंटरफेस में दिखने वाली state नहीं, बल्कि तब भी सिस्टम कैसे व्यवहार करेगी जब उपयोगकर्ता उसे नहीं देख रहा होगा, यह भी डिज़ाइन करने लगते हैं
- सवाल “उपयोगकर्ता को क्या दिखता है?” से बदलकर “उपयोगकर्ता को इस सिस्टम पर भरोसा करने के लिए क्या मान पाने योग्य होना चाहिए?” बन जाता है
- visual composition से अधिक महत्वपूर्ण behavior, responsibility, intention और trust के बारे में निर्णय हो जाते हैं
interaction से intention तक
- Don Norman की The Design of Everyday Things के अनुसार डिज़ाइन तब असफल होता है जब उपयोगकर्ता जिस तरह सिस्टम के काम करने को मानता है और सिस्टम वास्तव में जिस तरह काम करती है, उनमें अंतर हो
- पारंपरिक UX यह मानकर चलती थी कि उपयोगकर्ता इंटरफेस तक पहुंचने से पहले ही तय कर चुका है कि उसे कौन-सी कार्रवाई करनी है
- मेनू इसलिए है क्योंकि उपयोगकर्ता जानता है कि कौन-सा मेनू खोलना है
- फ़ॉर्म इसलिए है क्योंकि उपयोगकर्ता जानता है कि कौन-सा field भरना है
- वास्तविकता में उपयोगकर्ता जो साथ लाता है वह कोई ठोस intention नहीं, बल्कि अधिक अमूर्त goal होता है
- इस अंतर को नज़रअंदाज़ करने वाली यह धारणा पूरी तरह सही नहीं थी, फिर भी स्क्रीन-आधारित UX बनाने के लिए 30 साल तक काफ़ी उपयोगी रही
- नए इंटरफेस goal और intention को अलग कर देते हैं
- चैट में उपयोगकर्ता natural language में goal बताता है और सिस्टम intention को ठोस बनाती है
- वॉइस हाथ इस्तेमाल न कर पाने वाली स्थिति में भी goal व्यक्त करने देती है
- एजेंट goal एक बार लेकर उसे पूरा करने वाली multi-step plan चलाता है
- इन तीनों पैरेडाइम को जोड़ने वाला साझा बदलाव यह है कि मुख्य डिज़ाइन विषय interaction नहीं बल्कि intention बन जाती है
डिज़ाइनर भरोसे का रिश्ता डिज़ाइन करते हैं
- डिज़ाइनर की भूमिका interaction flow के डिज़ाइनर से बदलकर उपयोगकर्ता की ओर से काम करने वाली सिस्टम और इंसान के बीच के भरोसे के रिश्ते के डिज़ाइनर की हो जाती है
- अब जिन चीज़ों को संभालना होगा, उनमें ये शामिल हैं
- उपयोगकर्ता सिस्टम को कितना काम डेलीगेट करेगा
- सिस्टम अस्पष्ट मांगों की व्याख्या कैसे करेगी
- उपयोगकर्ता ने जो कहा और वास्तव में जो चाहा, उनके बीच के अंतर की पुष्टि कैसे की जाएगी
- इस काम के लिए नए tools और evaluation methods की ज़रूरत है
- human-AI interaction research यह सुझाती है कि केवल task completion न मापकर यह भी आंका जाए कि उपयोगकर्ता को पर्याप्त जानकारी मिली और उसने नियंत्रण बना रहने का अनुभव किया या नहीं
- जब हम उपयोगकर्ता की ओर से निर्णय लेने वाली systems बनाते हैं, तब यह तय करने के लिए ethical criteria भी चाहिए कि कौन-से निर्णय डेलीगेट किए जा सकते हैं
चैट/वॉइस/एजेंट डिज़ाइनरों की चुनौतियां
- चैट इंटरफेस में सबसे कठिन काम यह तय करना है कि चैट कहां नहीं इस्तेमाल करनी चाहिए, न कि सिर्फ कहां करनी चाहिए
- अच्छे परिणाम देने वाले प्रोडक्ट वे नहीं हैं जिनके पास सबसे शक्तिशाली AI है, बल्कि वे हैं जो बातचीत और forms के लिए सही tasks को ठीक-ठीक अलग कर पाते हैं
- यह विभाजन engineering नहीं बल्कि design decision है
- voice interface में स्क्रीन के बाहर की चीज़ों को डिज़ाइन करना पड़ता है
- layout से अधिक response time महत्वपूर्ण है, इसलिए समय को डिज़ाइन करना पड़ता है
- उपयोगकर्ता क्या याद रखे हुए है, इसे ध्यान में रखकर context डिज़ाइन करना पड़ता है
- जब सिस्टम समझ न पाए तो बातचीत को कैसे recover किया जाए, यह डिज़ाइन करना पड़ता है
- audio feedback, haptics, spatial signals और conversation recovery strategy नए tools बन जाते हैं
- एजेंटिक systems सबसे कम स्थापित पैटर्न और सबसे अधिक जोखिम वाला क्षेत्र हैं
- transparency, intervention control और progressive delegation पर लिए गए निर्णय तय करते हैं कि उपयोगकर्ता खुद को empowered महसूस करेगा या monitored
- इसका असर सिर्फ अलग-अलग प्रोडक्ट पर नहीं, बल्कि कई industries में इस बात पर भी पड़ेगा कि लोग AI को कितनी autonomy देना चाहेंगे
- जब एक ही प्रोडक्ट में तीनों पैरेडाइम साथ समर्थित हों, तो अलग-अलग interaction contract वाले इंटरफेस को एक सुसंगत अनुभव में जोड़ने की coordination problem भी सुलझानी होती है
UX के वे सिद्धांत जो नहीं बदलते
- नए इंटरफेस आने पर भी उपयोगकर्ता अब भी यह महसूस करना चाहते हैं कि उन्हें समझा गया है
- वे नियंत्रण खोने से डरते हैं, opaque प्रोडक्ट से बचते हैं, और ईमानदार प्रोडक्ट पर भरोसा करते हैं
- जो प्रोडक्ट उपयोगकर्ता को अयोग्य या धीमा महसूस कराते हैं, उन्हें आगे भी नज़रअंदाज़ किया जाएगा
- अच्छे UX डिज़ाइनर की भूमिका हमेशा यही रही है कि वह उपयोगकर्ता को सक्षम और समझा गया महसूस कराए
- चैट, वॉइस और एजेंट यह काम करने के नए वाद्ययंत्र हैं, और clarity/trust/delight/time व attention के प्रति सम्मान के मानदंड नहीं बदलते
आगे पढ़ें
- Erika Hall — Conversational Design
- Cathy Pearl — Designing Voice User Interfaces
- Clifford Nass / Scott Brave — Wired for Speech
- Ben Shneiderman — Human-Centered AI
- Don Norman — The Design of Everyday Things
अभी कोई टिप्पणी नहीं है.