AI एजेंट संदर्भ लागत: बार-बार दोहराए जाने वाले प्रॉम्प्ट और टूल कॉल को कैसे मापें

मल्टी-स्टेप AI एजेंटों में संदर्भ लागत को मापने और अनुकूलित करने के लिए व्यावहारिक मार्गदर्शिका: टूल स्कीमा प्रोफाइलिंग, बेसलाइन मापन और गुणवत्ता नियंत्रण।

स्वायत्त AI एजेंटों (Claude Code, Cline, Roo Code या कस्टम मल्टी-स्टेप वर्कफ़्लो) का निर्माण करते समय डेवलपर्स अक्सर API लागत में अचानक वृद्धि का सामना करते हैं। इसका मुख्य कारण संदर्भ का संचय है: प्रत्येक विचार चक्र में मॉडल पूरे सिस्टम प्रॉम्प्ट, उपलब्ध सभी टूल स्कीमा (Tool Schemas), पिछले वार्तालाप इतिहास और निष्पादित फ़ंक्शन परिणामों को फिर से पढ़ता है।

सटीकता से समझौता किए बिना बजट को नियंत्रित करने के लिए एक निश्चित कार्य पर आधार रेखा (Baseline) को मापना और एक-एक चर के आधार पर एजेंट वातावरण को अनुकूलित करना आवश्यक है।

AI एजेंट संदर्भ की संरचना: प्रत्येक चरण में टोकन कहाँ खर्च होते हैं

प्रत्येक चरण में मॉडल को भेजे जाने वाले संदर्भ में चार मुख्य घटक होते हैं:

  1. सिस्टम निर्देश और दिशानिर्देश (System Prompt): शैली के नियम, सुरक्षा सीमाएँ और प्रोजेक्ट संदर्भ।
  2. टूल स्कीमा परिभाषाएँ (Tool Schemas): सभी जुड़े हुए फ़ंक्शन का JSON विवरण। यदि 20 टूल जुड़े हैं, तो प्रत्येक कॉल में उनका स्कीमा भेजा जाता है, जो 3,000 से 15,000 इनपुट टोकन खर्च करता है।
  3. संदेश इतिहास (Message History): उपयोगकर्ता के अनुरोध और एजेंट के पिछले उत्तरों का संचय।
  4. टूल निष्पादन परिणाम (Tool Outputs): पढ़ी गई फ़ाइलों की सामग्री, टर्मिनल आउटपुट और कच्चा API डेटा।

10 चरणों के कार्य में 15,000 टोकन का आधारभूत संदर्भ बिना प्रॉम्प्ट कैशिंग के 10 बार इनपुट टोकन के रूप में बिल किया जाएगा।

संदर्भ घटकों और उनके अनुकूलन की तुलना तालिका

संदर्भ घटककुल मात्रा में हिस्सामुख्य लागत जोखिमअनुशंसित अनुकूलन विधि
Tool Schemas20–40%सूची में दर्जनों अप्रयुक्त टूल शामिल होनाविशिष्ट भूमिकाओं के अनुसार टूल फ़िल्टरिंग
Tool Outputs30–60%पूरी फ़ाइलों को अनावश्यक रूप से पढ़नालाइन सीमाएं (slices) और grep फ़िल्टर
संदेश इतिहास15–30%विफल मध्यवर्ती प्रयासों का संचयआवधिक सारांश और पुराने चरणों की सफ़ाई
System Prompt5–15%गतिशील परिवर्तनों से कैश अमान्य होनाप्रॉम्प्ट कैशिंग के लिए स्थिर उपसर्ग तय करना

चरण-दर-चरण मार्गदर्शिका: बेसलाइन मापना और खर्च कम करना

व्यवस्थित लागत नियंत्रण के लिए इस एकल-चर परीक्षण पद्धति का पालन करें:

चरण 1. एक पुनरुत्पादनीय परीक्षण कार्य तय करें

स्वचालित सत्यापन के साथ एक स्पष्ट परिदृश्य चुनें (उदाहरण: «प्रोजेक्ट में एक सत्यापन फ़ंक्शन खोजें, एज केस हैंडलिंग जोड़ें और यूनिट टेस्ट पास करें»)।

चरण 2. बेसलाइन मापें (Input, Output, Cache)

मानक एजेंट कॉन्फ़िगरेशन के साथ कार्य चलाएँ और रिकॉर्ड करें:

  • पूरे किए गए चरणों की संख्या (उदा. 10 चरण);
  • कुल इनपुट टोकन (उदा. 150,000 टोकन);
  • कुल आउटपुट टोकन (उदा. 2,500 टोकन);
  • कैश किए गए टोकन (Cached Tokens);
  • सक्रिय दरों के आधार पर कुल वित्तीय लागत।

उदाहरण के लिए बिना कैशिंग के प्रति 1M इनपुट टोकन 3.00कीदरपर150,000टोकनखर्चकरनेवाले10चरणोंकेकार्यकीलागतलगभग3.00 की दर पर 150,000 टोकन खर्च करने वाले 10 चरणों के कार्य की लागत लगभग 0.45 होती है।

2026-08-22 तक प्रमुख मॉडलों की आधिकारिक दरें BetterToken मूल्य निर्धारण पृष्ठ पर जांची जा सकती हैं। BetterToken Dashboard प्रत्येक चरण के लिए पारदर्शी टोकन खपत आंकड़े प्रदर्शित करता है।

चरण 3. एक समय में एक चर बदलें

प्रत्येक परीक्षण में केवल एक पैरामीटर बदलकर स्वतंत्र परीक्षण चलाएँ:

  • प्रयोग A (टूल फ़िल्टरिंग): 15 टूल के स्थान पर केवल 3 मुख्य टूल (read_file, replace_content, run_test) प्रदान करें (प्रति चरण 8,000 टोकन तक की बचत)।
  • प्रयोग B (आउटपुट ट्रंकेशन): पूरे टर्मिनल लॉग के स्थान पर त्रुटि की पहली 50 पंक्तियाँ ही संदर्भ में भेजें।
  • प्रयोग C (प्रॉम्प्ट कैशिंग): सिस्टम प्रॉम्प्ट और टूल स्कीमा को शुरुआत में स्थिर रखें ताकि कैश पढ़ने की लागत लगभग $0.30 प्रति 1M टोकन तक कम हो सके।

चरण 4. बचत और कोड गुणवत्ता का मूल्यांकन करें

आधार रेखा के साथ परिणामों की तुलना करें। यदि परीक्षण सटीकता अप्रभावित रहती है और इनपुट टोकन 40-60% कम हो जाते हैं, तो परिवर्तन को लागू करें।

AI एजेंट वास्तुकला के लिए सर्वोत्तम अभ्यास

  1. विशेषज्ञ सब-एजेंटों का उपयोग करें: मुख्य एजेंट को सभी टूल न सौंपें। कोड अनुसंधान के लिए केवल पढ़ने वाले हल्के सब-एजेंट तैनात करें।
  2. स्थिर प्रॉम्प्ट उपसर्ग बनाए रखें: प्रॉम्प्ट कैशिंग छूट (पढ़ने पर 90% तक की छूट) का अधिकतम लाभ उठाने के लिए स्थिर नियमों को अनुरोध के शीर्ष पर रखें।
  3. अधिकतम पुनरावृत्ति सीमा (Max Iterations) तय करें: त्रुटियों के कारण अनंत लूप से बचने के लिए अधिकतम चरणों की सीमा (उदा. 15 चरण) निर्धारित करें।

सामान्य गलतियाँ और सावधानियां

  • आवश्यक टूल स्कीमा को अत्यधिक हटाना: टूल विवरण बहुत अधिक काटने से मॉडल अमान्य JSON आउटपुट देने लगता है, जिससे पुनः प्रयास बढ़ जाते हैं।
  • सोशल मीडिया दावों पर आँख बंद करके भरोसा करना: वास्तविक बचत आपके प्रोजेक्ट के आकार और संरचना पर निर्भर करती है।
  • सटीक टेलीमेट्री का अभाव: कैश स्थिति की पुष्टि के लिए BetterToken दस्तावेज़ का संदर्भ लें और उपयोग की निगरानी करें।

अपना LLM वर्कफ़्लो बेहतर बनाना चाहते हैं?

एक API से मॉडल जोड़ें, कुंजियाँ प्रबंधित करें और AI खर्च नियंत्रित करें।