• अगर जनरेटिव AI भरोसेमंद डेटा पर काम नहीं करता, तो उसके analysis results पर भी भरोसा करना मुश्किल हो जाता है; इसी वजह से डेटा मैनेजमेंट तकनीकी support काम से बढ़कर रणनीतिक मुख्य function बन गया है
  • शुरुआती दौर में application developers डेटा structure तक संभालते थे; बाद में roles database designer/administrator, CIO, CDO में बंट गए, और data integrity व पूरे enterprise में consistent understanding मुख्य चुनौती बन गए
  • structured data में data model और database को सीधे बदला जाता है, लेकिन generative AI environment में LLM में जाने वाले text को चुनकर और साफ करके indirect control किया जाता है
  • unstructured text के लिए पारंपरिक data model की जगह ontology/taxonomy की जरूरत होती है; इसे Enterprise Logical Data Model (ELDM) के साथ जोड़कर लगातार update करना चाहिए
  • डेटा कई systems/PCs/Internet में बिखरने से physical centralization असंभव हो गया है, और ELDM के जरिए enterprise-level meaning को integrate करने वाला semantic centralization महत्वपूर्ण हो गया है

Application development work से शुरू हुआ डेटा मैनेजमेंट

  • शुरुआती computer systems में application developers requirements gathering, methodology compliance, programming, testing के साथ-साथ system द्वारा उपयोग किए जाने वाले डेटा और उसकी structure भी define करते थे
  • Data design कोई स्वतंत्र enterprise function नहीं था, बल्कि development process में शामिल कई कामों में से एक था

Transaction processing और database specialist roles का उदय

  • Transaction processing systems के फैलने के साथ response time, system availability और transaction execution integrity को database design में शामिल करना जरूरी हो गया
  • इन requirements को professionally संभालने वाले database designers सामने आए, और डेटा मैनेजमेंट को स्वतंत्र काम के रूप में देखा जाने लगा
  • Transaction processing databases की संख्या तेजी से बढ़ने पर कई databases को control और coordinate करने वाले database administrators की जरूरत पड़ी

Data integrity की समस्या और data warehouse

  • आपस में जुड़े अनेक applications में वही data elements बार-बार store होने लगे, जिससे अलग-अलग जगहों पर अलग-अलग values होने की समस्या पैदा हुई
  • Enterprise की समस्या डेटा रखने से बदलकर यह तय करने की हो गई कि किस डेटा पर भरोसा किया जाए
  • सिर्फ applications और technology जोड़ने से integrity की समस्या हल नहीं हुई; उलटे समस्या बढ़ी और तेज हुई
  • technical fixes के बजाय operational data और analytical data को अलग करने वाला architectural solution जरूरी हो गया, और इसी से data warehouse सामने आया

Data model और structured data environment

  • operational data को analytical data और data warehouse में बदलने के लिए एक data model चाहिए, जो अभी मौजूद या आगे जरूरी होने वाले data types को abstract करता है
  • Operational systems और data warehouses structured data environment से बने होते हैं, जहां हर record का format समान रहता है और केवल content बदलता है
  • Applications, databases और transaction processing databases के structured data को database management system (DBMS) से manage किया जाता है
  • Transaction systems की failures ATM, airline reservation systems जैसे वास्तविक business operations और customers को सीधे प्रभावित करने लगीं, जिससे accurate और stable systems तथा data management का महत्व बढ़ा

Structured data administrator का काम

  • Data model बनाने के बाद economic conditions, competition, technology, laws और market changes के अनुसार उसे लगातार maintain और modify किया जाता है
  • Database design में normalization principles का पालन किया जाता है, लेकिन transaction processing performance के लिए जरूरत के अनुसार denormalization लागू किया जाता है
    • Data administrator system के goals और performance requirements के हिसाब से normalization और denormalization के बीच संतुलन बनाता है
  • Data model के आधार पर database define करने वाली DDL लिखी जाती है
  • Transaction processing equipment कब capacity limit पर पहुंचेगा, इसका अनुमान लगाने के लिए capacity planning की जाती है
  • Database activity और data growth को लगातार monitor किया जाता है
  • समस्या मिलने पर संबंधित data model या database में सीधे जाकर सुधार करने वाली direct control approach अपनाई जाती है

Unstructured/text data का विस्तार

  • Enterprises में structured data के साथ व्यापक unstructured/text data भी मौजूद होता है, और कुछ अनुमानों के अनुसार enterprise data का 90% तक text हो सकता है
  • महत्वपूर्ण enterprise information का बड़ा हिस्सा text रूप में होता है, इसलिए data management organization को इसे भी साथ में manage करना चाहिए
  • Structured data और text data की structure और management methods मूल रूप से अलग हैं

Text environment में ontology और taxonomy

  • Text environment में पारंपरिक structured data model को सीधे लागू करना मुश्किल है
  • Structured data में data model जो role निभाता है, text environment में वही role ontology/taxonomy निभाते हैं
  • दोनों models समान भूमिका निभाते हैं, लेकिन उनकी structure और management techniques काफी अलग हैं
  • Structured data modeling और management techniques को text पर जस-का-तस लागू करना उपयुक्त नहीं है, और इससे practical results भी बहुत कम मिलते हैं

LLM input text का selection और cleaning

  • Generative AI environment में सबसे महत्वपूर्ण data management task यह है कि source text LLM में जाने से पहले review किया जाए
  • Enterprise work से संबंधित नहीं होने वाले अनावश्यक text को LLM में जाने से रोकने के लिए हटाना चाहिए
  • अनावश्यक text हटाने से हर query चलाते समय process किए जाने वाले data की मात्रा घटती है और cost बचती है
  • केवल work-related text छोड़ने पर यह scope साफ हो जाता है कि LLM क्या express और handle करता है

ELDM और structured/unstructured data का connection

  • Generative AI environment में data administrators को ontology/taxonomy को enterprise-wide ELDM(Enterprise Logical Data Model) के साथ जोड़ना चाहिए
  • ELDM का उपयोग traditional structured data model और text environment की ontology/taxonomy को integrate करने के लिए किया जाता है
  • Enterprise की business requirements बदलें तो ontology/taxonomy को भी साथ में update करना चाहिए

External text collection और continuous maintenance

  • Internet जैसे sources से पहले broad range का source text select करना चाहिए
  • इसके बाद selected text में से enterprise work से संबंधित data को फिर से छांटने वाली two-stage selection process चलती है
  • Work environment और global conditions लगातार बदलते हैं, इसलिए ontology/taxonomy को लगातार monitor और manage करना चाहिए
  • बदली हुई conditions और taxonomy को आपस में aligned रखने के लिए repeated maintenance जरूरी है

LLM पर indirect control

  • Structured data administrators data model और database को सीधे बदल सकते हैं, लेकिन generative AI environment में LLM itself को उसी तरह directly control नहीं कर सकते
  • Generative AI के output को control करने का साधन यह manage करना है कि LLM में कौन-सा text input किया जाए
  • इसलिए generative AI data management direct modification के बजाय input data के selection और cleaning के जरिए indirect control के करीब है

Enterprise organizations में data management role का बदलाव

  • शुरुआती दौर में data management system developer द्वारा किए जाने वाले कई कामों में से एक था, और इसके लिए अलग enterprise organization या role नहीं था
  • Transaction processing महत्वपूर्ण होने पर database design अलग independent work के रूप में अलग हुआ और database designer का role बना
  • Databases तेजी से बढ़ने और manage किए जाने वाले data elements की संख्या बढ़ने पर database administrator का role expanded हुआ
  • कई systems के data में mismatch की समस्या बढ़ने पर enterprise-wide information integration संभालने वाला CIO(Chief Information Officer) सामने आया
  • Structured data और text data को integrate करके enterprise data को overall समझने की जरूरत पैदा हुई, जिससे यह CDO(Chief Data Officer) role तक विकसित हुआ
  • Data forms जितने विविध होते हैं, management की complexity और importance, usage opportunities और challenges भी साथ-साथ बढ़ते हैं

Physical centralization से semantic centralization तक

  • पूरे enterprise में data और उसके meaning को consistently समझने के लिए centralized data understanding framework की जरूरत होती है
  • शुरुआती computing में centralization का मतलब databases को बड़े mainframe में इकट्ठा करने वाला physical centralization था
  • बाद में data personal computers, Internet, enterprise systems आदि कई जगहों पर फैल गया, जिससे physical centralization असंभव हो गया
  • Data जितना distributed होता है, Internet और enterprise के भीतर एक ही object को एक ही meaning में समझने के लिए coordination की जरूरत उतनी बढ़ती है
  • Centralization का target data की storage location से हटकर data के meaning और definition पर आ गया
  • ELDM का उपयोग enterprise-level common data meaning को centrally maintain करने के साधन के रूप में किया जाता है, भले ही data कई physical locations पर मौजूद हो

अभी कोई टिप्पणी नहीं है.

अभी कोई टिप्पणी नहीं है.