नमस्ते।

हाल ही में मैंने एक Chrome Extension बनाया है, जो ब्राउज़र में किए गए कार्यों को अपने-आप यूज़र मैनुअल (SOP) में बदल देता है।

मौजूदा स्क्रीन रिकॉर्डिंग तरीके से अलग, यह क्लिक और इनपुट events को DOM context के साथ इकट्ठा करता है और उन्हें इंसान के लिए आसानी से समझ आने वाले कार्य-चरणों में फिर से संरचित करता है।

फिलहाल pipeline इस प्रकार है।

Browser Recording → DOM Context Extraction → Solar Pro 3 → AI Validation → Word / PDF / Markdown

इसे implement करते समय सबसे कठिन हिस्सा यह था कि “कहाँ तक को एक Step माना जाए।”

ब्राउज़र events को ज्यों का त्यों रिकॉर्ड करने पर वे बहुत ज्यादा बारीक हो जाते हैं, और उल्टा अगर बहुत ज्यादा merge कर दें तो यूज़र का महत्वपूर्ण intent खो जाता है। फिलहाल इसे DOM बदलावों, input state, page transition आदि के आधार पर events को merge करने के बाद, Solar Pro 3 हर चरण को प्राकृतिक भाषा में description के रूप में बनाता है, और AI sequence व किसी omission को एक बार और verify करता है।

अभी तक दस्तावेज़ generate करने वाले चरण तक implementation हो चुका है, और आगे generated manual को structured Task Plan के रूप में इस्तेमाल करने की दिशा में प्रयोग कर रहा हूँ। लक्ष्य केवल एक document बनाना नहीं, बल्कि इसे ऐसे executable workflow में विकसित करना है जिससे AI Agent काम को समझकर guide कर सके या दोहराए जाने वाले browser tasks को reproduce कर सके।

Interaction Segmentation और Task Planning अभी भी लगातार improve किए जा रहे हैं। संबंधित research या implementation experience रखने वाले लोगों से feedback सुनना चाहूँगा।

अभी कोई टिप्पणी नहीं है.

अभी कोई टिप्पणी नहीं है.