आमंत्रित करें और कमाएँ

आमंत्रण पुरस्कार कैसे काम करते हैं

अपना आमंत्रण लिंक साझा करें। मित्र इसके माध्यम से पंजीकरण करके टॉप-अप करता है तो उसके बाद के टॉप-अप पर आपको दिखाया गया पुरस्कार मिलेगा।

AI एजेंट संदर्भ लागत: दोहराए जाने वाले प्रॉम्प्ट और टूल कॉल कैसे मापें

मल्टी-स्टेप AI एजेंटों में संदर्भ लागत को मापने और अनुकूलित करने की व्यावहारिक गाइड: टूल स्कीमा, बेसलाइन मापन और गुणवत्ता नियंत्रण।

विषय-सूची

AI एजेंट (Claude Code, Cline, Roo Code या कस्टम मल्टी-स्टेप पाइपलाइन) बनाते समय, संदर्भ जमा होने के साथ API उपयोग बढ़ सकता है। हर अनुरोध की सटीक संरचना क्लाइंट पर निर्भर करती है: उसमें सिस्टम प्रॉम्प्ट, उपलब्ध टूल स्कीमा, संदेश इतिहास और फ़ंक्शन कॉल के परिणाम शामिल हो सकते हैं।

कार्यात्मकता खोए बिना बजट नियंत्रित करने के लिए, एक निश्चित कार्य पर baseline लें, अतिरिक्त टोकन के मुख्य स्रोत को पहचानें और एजेंट वातावरण में एक बार में केवल एक चर बदलकर अनुकूलन करें।

AI एजेंट संदर्भ की संरचना: हर चरण में टोकन किसके लिए खर्च होते हैं

मापन के लिए मॉडल को भेजे जाने वाले संदर्भ को चार देखे जा सकने वाले घटकों में बाँटें:

  1. सिस्टम निर्देश और नियम (System Prompt): बुनियादी शैली आवश्यकताएँ, सुरक्षा सीमाएँ और रिपॉज़िटरी संदर्भ।
  2. टूल स्कीमा (Tool Schemas): जुड़े हुए फ़ंक्शन, पैरामीटर और डेटा प्रकार के JSON विवरण, जब क्लाइंट उन्हें अनुरोध में शामिल करता है।
  3. संदेश इतिहास (Message History): पिछले उपयोगकर्ता संदेश और एजेंट उत्तर जो कार्य के दौरान जमा होते हैं।
  4. टूल आउटपुट (Tool Outputs): पढ़ी हुई फ़ाइलों की सामग्री, टर्मिनल कमांड लॉग और API डंप।

पहले अनुरोध के आकार को चरणों की संख्या से अंधाधुंध गुणा न करें। प्रत्येक कॉल का usage निर्यात करें: इतिहास बढ़ सकता है, क्लाइंट डेटा को छोटा कर सकता है और प्रदाता cached tokens को अलग से गिन सकता है।

संदर्भ स्रोतों और उनके अनुकूलन की तुलना तालिका

संदर्भ घटकक्या मापेंमुख्य अधिक-खर्च जोखिमअलग परीक्षण के लिए बदलाव
Tool Schemasवास्तव में भेजी गई सूची का आकारसाझा सेट में अप्रयुक्त टूलकार्य के लिए जरूरी tools ही रखें
Tool Outputsहर परिणाम का आकारलक्षित हिस्सों के बजाय पूरी फ़ाइल पढ़नालाइन रेंज और लॉग की मात्रा सीमित करें
चरण इतिहासकॉल से कॉल input की वृद्धिअब जरूरी न रहे परिणाम जमा होते हैंक्लाइंट द्वारा समर्थित इतिहास संक्षेपण जाँचें
System Promptप्रीफ़िक्स का आकार और स्थिरतादोहराए हुए निर्देशअनिवार्य नियम रखते हुए दोहराव हटाएँ

चरण-दर-चरण गाइड: baseline मापें और खर्च घटाएँ

सबसे पहले मौजूदा मॉडल दरें दर्ज करें। baseline की गणना के लिए पुराने उदाहरणों के बजाय BetterToken की वर्तमान कीमतें उपयोग करें। BetterToken की वर्तमान कीमतें देखें

वस्तुनिष्ठ अनुकूलन के लिए एक-चर मापन पद्धति अपनाएँ:

चरण 1. परीक्षण के लिए एक नियंत्रण कार्य तय करें

एक पुनरुत्पादनीय इंजीनियरिंग परिदृश्य चुनें, जैसे: “रिपॉज़िटरी में validation फ़ंक्शन खोजें, edge case हैंडलिंग जोड़ें और unit tests चलाएँ।” कार्य के पास स्पष्ट पूर्णता मानदंड होना चाहिए, जैसे pytest या bun test में exit code 0।

चरण 2. Baseline मापें (Input, Output, Cache)

कार्य को एजेंट के मानक कॉन्फ़िगरेशन में चलाएँ। लॉग या मॉनिटरिंग पैनल में दर्ज करें:

  • निष्पादित चरणों की संख्या;
  • कुल input tokens;
  • कुल output tokens;
  • कैश किए गए टोकन का आकार (cached tokens);
  • वर्तमान दरों पर वित्तीय लागत।

चुने हुए मॉडल की वर्तमान दरें BetterToken मूल्य पृष्ठ पर जाँचें। Workspace में स्वीकृत अनुरोध के लिए मॉडल, समय और स्थिति, input/output tokens, मॉडल द्वारा समर्थित होने पर cached tokens और कॉल लागत देखी जा सकती है। यदि एजेंट का एक चरण कई अनुरोध बनाता है, तो अनुरोध-स्तर रिकॉर्ड को तैयार चरण-स्तर विभाजन न मानें: समय और अपने क्लाइंट के डेटा से उन्हें मिलाएँ।

चरण 3. संदर्भ का एक चर बदलें

हर पुनरावृत्ति में केवल एक पैरामीटर बदलते हुए अलग-अलग परीक्षण चलाएँ:

  • प्रयोग A (Tool Filtering): नियंत्रण कार्य के लिए जरूरी टूल ही रखें और input tokens का अंतर मापें।
  • प्रयोग B (Output Truncation): 2,000 पंक्तियों के पूरे डंप के बजाय टर्मिनल आउटपुट को त्रुटि की पहली 50 पंक्तियों तक सीमित करें।
  • प्रयोग C (Prefix Stability): यदि मॉडल और endpoint prompt caching का समर्थन करते हैं, तो सिस्टम प्रॉम्प्ट और टूल स्कीमा का क्रम अपरिवर्तित रखें, फिर वास्तविक cached tokens डेटा जाँचें।

चरण 4. अर्थशास्त्र और समाधान की गुणवत्ता का मूल्यांकन करें

अंतिम मेट्रिक्स की तुलना मूल baseline से करें। बदलाव तभी रखें जब नियंत्रण कार्य उसी गुणवत्ता मानदंड को पूरा करता रहे और मापा गया समय या खर्च आपके रन के सेट में बेहतर हो।

एजेंट वातावरण कॉन्फ़िगर करने के लिए सिफारिशें

  1. भूमिका के अनुसार टूल सेट छोटा करें: पढ़ने वाले एजेंट को लिखने के फ़ंक्शन नहीं चाहिए; जाँचें कि इससे परिणाम को नुकसान पहुँचाए बिना वास्तविक input घटता है या नहीं।
  2. स्थिर प्रीफ़िक्स रखें: यदि caching समर्थित है, तो साझा नियमों का क्रम बिना जरूरत न बदलें और छूट मानने के बजाय cached tokens जाँचें।
  3. लूप को सीमा में रखें: विशिष्ट कार्य के लिए उपयुक्त सीमित प्रयास और स्पष्ट रुकने की शर्त तय करें।

सीमा स्थितियाँ और सामान्य गलतियाँ

  • गलती: महत्वपूर्ण validation schema बंद करना। यदि tool schema का विवरण बहुत अधिक काट दिया जाए, तो मॉडल अमान्य JSON भेज सकता है और बार-बार अनुरोधों की श्रृंखला शुरू हो सकती है।
  • गलती: सोशल मीडिया के बचत दावों पर आँख बंद कर भरोसा करना। संदर्भ अनुकूलन का प्रभाव आपके रिपॉज़िटरी ढाँचे और औसत फ़ाइल आकार पर निर्भर करता है।
  • गलती: पारदर्शी telemetry न होना। यदि endpoint input/cache tokens के अलग आँकड़े नहीं लौटाता, तो अनुमान के आधार पर कैश उपयोग न आँकें; मान को अज्ञात चिह्नित करें।

अपना LLM वर्कफ़्लो बेहतर बनाना चाहते हैं?

एक API से मॉडल जोड़ें, कुंजियाँ प्रबंधित करें और AI खर्च नियंत्रित करें।

मुफ़्त शुरू करें