मैंने public benchmark traces में agent के duplicate execution को मापकर देखा। गिनती का तरीका यह था कि जब वही tool उसी argument के साथ दो बार call हुआ हो और result भी वही हो, तो उसे count किया जाए.
6,780 traces में ऐसे 8,042 मामले मिले, लेकिन इनमें से task completion declaration की पुनरावृत्ति जैसी चीज़ें हटाने पर यह 4,249 रह गए। उनमें state बदलने वाले tools के 3,432 duplicate calls के लिए response में मौजूद entity ID की तुलना की, तो 159 मामलों में यह पुष्टि हुई कि वास्तव में दो अलग objects बने थे। जैसे एक ही title वाले दो documents, या एक ही spreadsheet की चार copies बन गईं।
यहाँ एक स्पष्ट सीमा है। ये सारे आँकड़े benchmark traces के हैं। यह 22 models के task solve करने के records हैं, कोई वास्तविक production service नहीं। मैंने आठ public datasets खंगाले, और यह phenomenon observe कर सकने वाला केवल यही एक मिला। ज़्यादातर benchmarks accuracy scoring के लिए design किए गए हैं, इसलिए duplicate होने पर वह सीधे wrong answer बन जाता है।
इसीलिए मैं आप लोगों से पूछना चाहता हूँ जो इसे production में चला रहे हैं।
- आप कितने MCP tools (या servers) जोड़कर इस्तेमाल करते हैं?
हमने जिन दो datasets को देखा, उनमें duplicate rate में 3 गुना अंतर था (0.80% vs 2.41%)। tools की संख्या भी 20 बनाम 523 थी, लेकिन task का nature और model configuration भी अलग थे, इसलिए tools की संख्या ही कारण है या नहीं, इसे अलग करके नहीं देख पाए।
वास्तव में benchmark के अंदर जब task से जुड़े servers की संख्या के आधार पर बाँटा, तो 4~5 servers पर rate सबसे ज़्यादा था (लगभग 2.5%), और उसके बाद उल्टे कम हो जाता था — यानी non-monotonic pattern। हमें ऐसा सीधा संबंध नहीं दिखा कि "tools ज़्यादा हों तो duplicates बढ़ते हैं"। production में आपका अनुभव कैसा है, यह जानना चाहता हूँ।
- क्या आपने duplicate execution का अनुभव किया है? आपने उसे कैसे पकड़ा?
हमने जो cases देखे उनमें ज़्यादातर में कोई error नहीं था। दोनों बार 200 response था और logs भी साफ़ थे, इसलिए बाद में सिर्फ logs देखकर यह दिखता नहीं था। लगता है कि वास्तविक दुनिया में अक्सर ग्राहक बताने पर ही पता चलता होगा — आपका अनुभव क्या है?
- क्या आपके tools response में entity ID लौटाते हैं?
यही वह बिंदु था जहाँ "दो बार call हुआ" और "दो चीज़ें बन गईं" के बीच फर्क किया जा सका। document creation API आमतौर पर ID देता है, लेकिन email sending में अक्सर सिर्फ "success" string मिलती है। जिन 3,197 मामलों में फैसला नहीं हो पाया, उनमें 2,011 ऐसे ही थे, और 24 प्रकार के tools ऐसे थे जो response में कभी ID नहीं देते थे।
मैं कोई तय जवाब नहीं चाहता, बस यह समझना चाहता हूँ कि benchmarks और वास्तविक production कितने अलग हैं। केवल अनुभव साझा करना भी बहुत मददगार होगा।
अभी कोई टिप्पणी नहीं है.