1 पॉइंट द्वारा GN⁺ 3 시간 전 | 1 टिप्पणियां | WhatsApp पर शेयर करें
  • Claude एप्लिकेशन को लागू करने के लिए व्यावहारिक गाइड और उदाहरणों का संग्रह, जिसमें एजेंट बनाने से लेकर RAG·टूल उपयोग·मल्टीमॉडल·इवैल्युएशन तक व्यापक विषय शामिल हैं
  • Claude Agent SDK·Managed Agents उदाहरणों में मल्टी-एजेंट orchestration, सेशन मैनेजमेंट, डिप्लॉयमेंट, आउटेज प्रतिक्रिया, vulnerability detection, user memory जैसे ऑपरेशंस पैटर्न शामिल हैं
  • लंबे समय तक चलने वाले एजेंटों के लिए memory·context compression, प्रोग्रामेटिक टूल कॉलिंग, embedding-आधारित टूल सर्च, और asynchronous sub-agent तकनीकें प्रदान की गई हैं
  • RAG, SQL generation, knowledge graph, document summary, image·audio processing के साथ-साथ evaluation·cost·observability·guardrails भी इम्प्लीमेंटेशन उदाहरणों के जरिए देखे जा सकते हैं
  • Docker·Modal·Kubernetes डिप्लॉयमेंट, prompt version management और rollback, human approval, cost analysis को समेटते हुए इसे development और production operations दोनों में इस्तेमाल किया जा सकता है

एजेंट इवैल्युएशन और guardrails

मल्टी-एजेंट और workflow patterns

  • asynchronous multi-agent orchestration: shared hub में peer messages का आदान-प्रदान करने वाली निश्चित N-एजेंट टीम और dynamically generated asynchronous sub-agents की messaging और lifecycle संरचना को कवर करता है
  • multi-agent: specialist team coordination: coordinator web search researcher·file review handler·rule-based pricing handler का नेतृत्व करके sales proposal तैयार करता है
    • इसमें multiagent फ़ील्ड, thread_created·thread_message_received events, और role-based tool scope restrictions शामिल हैं
  • Outcomes: अपने काम को सत्यापित करने वाला एजेंट: writer cited research summary बनाता है, फिर stateless grader URL और उद्धरणों की जांच करता है, और पास होने तक सुधार करने वाला grading·improvement loop बनाता है
    • user.define_outcome, span.outcome_evaluation_* events और grader द्वारा चलाए जा सकने वाले evaluation criteria लिखने के तरीके को कवर करता है
  • बेसिक workflows: तीन multi-LLM patterns देता है जो cost या latency को performance के बदले ट्रेड ऑफ करते हैं
  • evaluator-optimizer: एक LLM परिणाम बनाता है और दूसरा LLM evaluation feedback देता है, ऐसी iterative संरचना
  • orchestrator-workers: केंद्रीय LLM काम को dynamically delegate करता है और worker LLMs के परिणामों को synthesize करता है
  • Haiku को sub-agent के रूप में उपयोग करना: Haiku sub-agent वित्तीय रिपोर्टों से डेटा निकालता है और Opus परिणामों को synthesize करता है

Claude Agent SDK

  • एक-पंक्ति research agent: Claude Code SDK और WebSearch के साथ autonomous research agent बनाता है
  • chief of staff agent: sub-agents, hooks, output style, plan mode के साथ multi-agent system बनाता है
  • observability agent: MCP server के जरिए एजेंट को बाहरी सिस्टम से जोड़कर GitHub monitoring और CI workflows संभालता है
  • site reliability agent: read·write MCP tools से incidents का diagnosis·recovery करता है और postmortem report लिखता है
  • OpenAI Agents SDK से migration: expense approval agent के उदाहरण से tools·guardrails·sessions·handoffs को Claude Agent SDK के बुनियादी घटकों से मैप करता है
  • session browser बनाना: डिस्क पर मौजूद Agent SDK sessions को list·browse करके rename·tag·fork करता है, ताकि अलग conversation history parser के बिना sidebar बनाया जा सके
  • vulnerability detection agent: C targets का threat modeling करता है, built-in file tools से memory safety bugs ढूंढता है, और them structured reports में classify करता है
  • agent hosting: वही container image और HTTP interface बनाए रखते हुए research agent को Docker·Modal·Kubernetes के तीन चरणों में डिप्लॉय करता है

Claude Managed Agents

मेमोरी और context management

Tool use और external integration

सर्च·RAG·नॉलेज प्रोसेसिंग

मल्टीमॉडल·वॉइस·डॉक्यूमेंट्स

प्रतिक्रिया·तर्क·प्रॉम्प्ट

Skills और कार्य अनुप्रयोग

LlamaIndex एजेंट पैटर्न और कम्युनिटी योगदान

  • ReAct एजेंट: LlamaIndex के साथ टूल-आधारित तर्क और action workflow चलाने वाला ReAct एजेंट बनाता है
  • नए Cookbook आइडियाज़ के लिए कम्युनिटी योगदान स्वीकार किए जा रहे हैं, और योगदान गाइड प्रदान की गई है

1 टिप्पणियां

 
GN⁺ 3 시간 전
Hacker News की राय
  • सच कहूँ तो लगभग सभी AI उपयोग गाइड अर्थहीन लगते हैं। तरीका तो सीधे AI से पूछ सकते हैं, और अगर बात AI के इस्तेमाल की है, तो या तो उसे harness में built-in होना चाहिए या वह इतनी छोटी feature है कि Anthropic/OpenAI के उसे implement करने का इंतज़ार किया जा सकता है
    agent workflow, memory management, harness engineering जैसी चीज़ें भी ज़्यादातर दिखावे जैसी लगती हैं

    • 2023 में कहा जा रहा था कि prompt engineering नई software engineering बन जाएगी, इसलिए CoT, ReAct वगैरह मेहनत से सीखे, लेकिन 2024 में इनमें से ज़्यादातर reasoning models और harness updates की वजह से अनावश्यक हो गए
      नए AI techniques या frameworks भी 3 महीने के चक्र में absorb या replace हो जाते हैं, इसलिए उनमें निवेश करना कम मूल्यवान लगता है
    • जैसे-जैसे models की क्षमता बढ़ती है, वे आसपास के tools को खुद में समाहित कर लेते हैं, इसलिए ऐसे tools की shelf life बहुत छोटी होती है। यही pattern पहले भी बार-बार देखा है
    • Vercel ने दिखाया कि tool calling से ज़्यादा असरदार एक साफ़ निर्देशों वाली single Markdown file हो सकती है, और compressed index इस्तेमाल करने का तरीका भी बताया। मैंने भी tool calling को ठीक से पूरा करने में कई घंटे लगाए, लेकिन मिलता-जुलता नतीजा मिला; उसके बाद से सिर्फ Claude.md, Agents.md, और ज़रूरत हो तो Project.md इस्तेमाल करता हूँ
    • harness के अंदर दूसरे LLM का उपयोग करने में LLM बहुत कमजोर लगते हैं। उन्हें छोड़ दो तो वे .md files में तरह-तरह की बातें भरकर context को प्रदूषित कर देते हैं
      आखिरकार LLM से ही ऐसी सामग्री खोजवानी पड़ती है, इसलिए यह इंसानों से ज़्यादा LLM के लिए बनी सामग्री भी हो सकती है
    • जब सब MCP की तारीफ़ कर रहे थे, तब skills ज़्यादा efficient विकल्प बन चुके थे, और आक्रामक context management भी लंबे context window और agent features की वजह से कम महत्वपूर्ण हो गया। अगर कोई technique सच में अच्छी है, तो उसके अगले version में built-in होने की संभावना है
      इसलिए जब तक बहुत ज़रूरी न हो, plugins और MCP से बचता हूँ और वफ़ादार prompts इस्तेमाल करता हूँ। इससे पुराने optimizations को LLM पर थोपकर उसकी प्रगति रोकने से भी बचा जा सका
  • फ्रंटएंड aesthetics prompting की before/after images तो हँसी का विषय हैं। लगता है किसी ने यह जाँचा ही नहीं कि इस skill ने सच में design सुधारा भी या नहीं

    • दिए गए सारे नतीजे सुधार नहीं, गिरावट जैसे लगते हैं
    • कई guides typical LLM-style cargo cult की तरह frontend design skill को बिना सोचे recommend करती हैं, लेकिन उसका असली content लोगों की सोच से अलग है
    • aesthetics लागू की हुई site 2000 के शुरुआती दशक के keygen जैसी दिखती है, बस techno music की कमी है
    • सच में काफ़ी शर्मनाक परिणाम हैं। लगभग ऐसा लगता है जैसे “काला background और भयानक रूप से चौड़ा font इस्तेमाल करो”
    • सोचता हूँ क्या असरदार होने का impression देने के लिए before/after का अंतर जानबूझकर ज़्यादा दिखाया गया। मेरी नज़र में हर example में पहले वाला design बेहतर है
  • फ्रंटएंड aesthetics prompting का परिणाम पहले सादा है, और बाद में gradient जुड़ी हुई सादगी बन जाता है

    • कुछ examples में पहले वाला बेहतर है, और सच में सुधार कहा जा सके ऐसा सिर्फ blog example है
    • बल्कि मुझे aesthetics के बिना वाला version ज़्यादा पसंद है
    • AI-designed pages की एक सामान्य पहचान, यानी ALL-CAPS labels, भी जोड़ दिए गए हैं
  • घर पर Matt Pocock के skills इस्तेमाल कर रहा हूँ और वे काफ़ी शानदार हैं। वे auto-call नहीं होते, बल्कि user खुद invoke करता है, इसलिए सिर्फ मौजूद रहने भर से ज़्यादा context नहीं घेरते
    वे programmer को अंतिम नतीजे से बाहर नहीं करते, बल्कि उसे परिणाम पर और गहराई से सोचने के लिए प्रेरित करते हैं। grill skills असली requirements साफ़ करने में मदद करते हैं, और prototype skill उन हिस्सों को explore करने में मदद करता है जहाँ सही फ़ैसला लेने के लिए खुद अनुभव करना ज़रूरी होता है

  • OpenAI Cookbook भी उपयोगी है। दूसरी AI labs भी GitHub और Hugging Face पर examples और cookbooks अक्सर जारी करती हैं, इसलिए उन पर नज़र बनाए रखना फायदेमंद है

  • coding agents backend की तुलना में frontend में कहीं ज़्यादा buggy, टूटे हुए, अधूरे और अजीब features देते हैं। इसकी वजह दोनों क्षेत्रों की verifiability में अंतर लगती है, और सिर्फ basic test suite काफ़ी नहीं है
    Garry Tan का gstack जैसा approach ठीक लगता है, लेकिन adoption लायक mature है या नहीं, पता नहीं। कुछ लोग कहते हैं कि Gemini 3.5 Flash frontend काम में Opus या GPT-5.5 से बेहतर है; शायद multimodal क्षमता या Chrome की समझ की वजह से, लेकिन असली user evaluation जानने की उत्सुकता है

    • Claude के Front End Design skill जैसे agent से जुड़े विकल्प भी हो सकते हैं, लेकिन मैंने खुद इस्तेमाल नहीं किया। Magic Patterns ऐसा tool है जो features और constraints जानने वाला agent चलाए तो initial prototype generation में खास तौर पर बेहतरीन है
      creative results चाहिए हों तो ज़्यादा स्पष्ट माँग करनी पड़ती है, लेकिन standard frontend design के लिए अच्छा है। हालांकि मैं इसे मनमानी features जोड़ने या बदलाव के लिए नहीं, बल्कि ideas आज़माने के लिए ही इस्तेमाल करता हूँ
    • agents जटिल asynchronous state updates को context में ठीक से व्यक्त नहीं कर पाते, इसलिए उन्हें संभालने में कमजोर हैं। दूसरी ओर, जटिल components को अलग से बनाना या animation जैसी कम-coupled functionality implement करने में ठीक-ठाक हैं
  • मुझे लगा यह LLM से भरोसेमंद और वास्तव में पकाई जा सकने वाली recipes बनाने वाली असली cookbook है, लेकिन शायद अभी हम वहाँ तक नहीं पहुँचे हैं

    • एक साल से ज़्यादा समय से मैं महीने में कुछ बार LLM की मदद से खाना बना रहा हूँ, और दस में से नौ बार नतीजा अच्छा रहा। model weights में मौजूद औसत recipes भी आम तौर पर काफ़ी मजबूत होती हैं, और “ingredient X नहीं है” या “इसे vegetarian बना दो” जैसी ingredient substitution में तो यह खास तौर पर अच्छा है
      recipe मिलने के बाद “इसे और स्वादिष्ट बना दो” एक-दो बार कहकर नतीजा देखना भी मज़ेदार होता है
    • मैं ChatGPT से Italian cooking सीख रहा हूँ, और कुछ trial-and-error को छोड़ दें तो यह चौंकाने वाला अच्छा काम करता है
    • इस साल Gemini के साथ कुछ बार खाना बनाया और वह उम्मीद से बेहतर निकला। आप कह सकते हैं, “मेरे pantry में ये ingredients हैं और मुझे keto diet चाहिए,” फिर बातचीत से विकल्पों को संकुचित कर सकते हैं
    • मैं भी digital meal planning tool की उम्मीद कर रहा था
  • मुझे लगा यह Claude से recipes generate करने वाला नया product है

    • मैं Claude project को recipes के लिए इस्तेमाल कर रहा हूँ, और यह menu recommend करने तथा pantry में मौजूद ingredients के हिसाब से recipes adjust करने में शानदार है, इसलिए मैं भी ऐसे product की उम्मीद कर रहा था
    • असल में इसे उस काम के लिए इस्तेमाल भी किया जा सकता है
  • cookbook लागू करने से पहले और बाद का design, दोनों ही vibe coding से बने हुए लगते हैं। मैं designer नहीं हूँ इसलिए सही वजह नहीं बता सकता, लेकिन Claude की शैली की range कुछ सीमित सी लगती है
    शायद ज़रूरी बदलावों को और ज़्यादा specific तरीके से बताने पर इस प्रवृत्ति को दबाया जा सके

  • UI को कम से कम एक बार review किया जाना चाहिए था। साधारण table spacing तक ठीक से align नहीं हुई