आमंत्रित करें और कमाएँ

आमंत्रण पुरस्कार कैसे काम करते हैं

अपना आमंत्रण लिंक साझा करें। मित्र इसके माध्यम से पंजीकरण करके टॉप-अप करता है तो उसके बाद के टॉप-अप पर आपको दिखाया गया पुरस्कार मिलेगा।

Cherry Studio में Claude सोचता है पर जवाब नहीं देता: Max tokens कैसे सेट करें

Cherry Studio में thinking चालू होने पर Claude के खाली जवाबों के पीछे के कारण का विश्लेषण: मॉडल विचार प्रक्रिया (reasoning) के दौरान टोकन सीमा क्यों समाप्त कर देता है और असिस्टेंट स्तर पर Max tokens को सही तरीके से कैसे कॉन्फ़िगर करें।

विषय-सूची
Cherry Studio में Claude सोचता है पर जवाब नहीं देता: Max tokens कैसे सेट करें

15 सितंबर को BetterToken की सपोर्ट टीम के पास Cherry Studio क्लाइंट का उपयोग कर रहे एक यूज़र की समस्या आई: सीधे और सरल सवालों पर Claude सामान्य रूप से जवाब दे रहा था, लेकिन बड़े एनालिटिकल कार्यों में अंतिम टेक्स्ट दिखाई नहीं दे रहा था। थिंकिंग ब्लॉक (thinking) तो खुल रहा था, टोकन भी कट रहे थे, और ऐप में कोई एरर भी नहीं आ रहा था।

स्ट्रीमिंग (Stream) को टॉगल करने से भी कोई मदद नहीं मिली। BetterToken कंसोल में रिक्वेस्ट लॉग्स की जांच करने पर एक सामान्य बात सामने आई: अलग-अलग चैनलों के ज़रिए दिए गए कई लंबे जवाब ठीक 8192 आउटपुट टोकन पर आकर समाप्त हो गए थे।

चूंकि लॉग्स में स्टॉप स्टेटस (stop_reason) सुरक्षित नहीं रहा था, इसलिए रुकने के सटीक कारण की स्पष्ट रूप से पुष्टि नहीं की जा सकती। हालांकि, बार-बार आ रहा 8192 का मान यह संकेत देता है कि शायद आउटपुट वॉल्यूम की सीमा लागू हो गई थी: संभवतः टोकन लिमिट विचार प्रक्रिया (reasoning) के दौरान ही समाप्त हो गई, और वास्तविक जवाब के लिए टोकन बचे ही नहीं।

सपोर्ट रिक्वेस्ट कैसे आगे बढ़ी

यूज़र के संदेशों का सार कुछ इस प्रकार था:

यूज़र का पहला संदेश (पुनर्कथन): छोटे प्रॉम्प्ट्स पर जवाब सामान्य रूप से आते हैं। जटिल कार्यों में मॉडल काफी देर तक सोचता है, टोकन कटते हैं, लेकिन कोई अंतिम टेक्स्ट नहीं मिलता — जवाब का हिस्सा खाली रहता है।

हमने प्रोवाइडर की सीमाओं के भीतर रहते हुए उस विशिष्ट असिस्टेंट की सेटिंग्स में Max tokens पैरामीटर को सक्षम करने और उसका मान बढ़ाने की सलाह दी।

यूज़र का दूसरा संदेश (पुनर्कथन): असिस्टेंट की सेटिंग्स में लिमिट बदलने के बाद समस्या हल हो गई; यूज़र ने यह भी पूछा कि क्या इस पैरामीटर को प्रत्येक असिस्टेंट के लिए अलग से कॉन्फ़िगर करना आवश्यक है।

Cherry Studio में यह कॉन्फ़िगरेशन प्रत्येक असिस्टेंट के लिए अलग-अलग सेट किया जाता है।

जवाब क्यों गायब हो जाता है: thinking की कार्यप्रणाली

रीज़निंग (chain-of-thought) का समर्थन करने वाले Claude मॉडल्स में, सोचने की प्रक्रिया भी कुल जनरेशन लिमिट का हिस्सा होती है।

Anthropic के थिंकिंग और लागत नियंत्रण दस्तावेज़ के अनुसार, max_tokens पैरामीटर प्रति रिक्वेस्ट एक सख्त कुल सीमा (hard total cap) तय करता है। इस सीमा में छिपे हुए विचार टोकन (thinking) और दिखने वाला अंतिम जवाब टेक्स्ट दोनों शामिल होते हैं। effort पैरामीटर केवल विश्लेषण की गहराई के लिए एक लचीला दिशा-निर्देश प्रदान करता है, यह कुल सीमा को नहीं बढ़ाता। यदि विचार प्रक्रिया ही उपलब्ध पूरी सीमा का उपयोग कर लेती है, तो जनरेशन बीच में ही रुक जाता है। लिमिट के कारण रुकने पर आधिकारिक दस्तावेज़ या तो effort को कम करने की सलाह देता है, या फिर max_tokens को बढ़ाने की — बशर्ते मॉडल और उपयोग किया जाने वाला इंटरफ़ेस इस मान का समर्थन करते हों।

Cherry Studio में चरण-दर-चरण सेटअप

Cherry Studio के चैट दस्तावेज़ के अनुसार, सेटिंग्स चुने गए असिस्टेंट की सभी बातचीत पर लागू होती हैं। Max tokens को उस असिस्टेंट में बदलें जिसके साथ आप काम कर रहे हैं। यह सेटिंग केवल उसी पर लागू होगी और अन्य असिस्टेंट्स के पैरामीटर्स में कोई बदलाव नहीं करेगी।

बदलाव करने से पहले, सटीक मॉडल आईडी और अपने API प्रोवाइडर की अधिकतम आउटपुट आकार से जुड़ी सीमाओं की पुष्टि कर लें।

स्टेप 1. असिस्टेंट सेटिंग्स खोलें

बाईं ओर की असिस्टेंट सूची में संबंधित प्रोफ़ाइल खोजें, तीन बिंदुओं वाले आइकन पर क्लिक करें (या राइट-क्लिक करें) और Edit Assistant चुनें।

Cherry Studio में असिस्टेंट का संदर्भ मेनू: तीन बिंदु वाला बटन और Edit Assistant विकल्प केस सामग्री से उदाहरण: Edit Assistant मेनू विकल्प के माध्यम से असिस्टेंट संपादन विंडो खोलना।

स्टेप 2. Max tokens को सक्षम करें और बढ़ाएं

Model टैब पर जाएं और Max tokens विकल्प ढूंढें।

  1. पैरामीटर के पास स्थित टॉगल को चालू करें।
  2. एक नया मान दर्ज करें जो पुरानी सीमा से अधिक हो, लेकिन आपके प्रोवाइडर द्वारा मॉडल के लिए निर्धारित विनिर्देशों से बाहर न हो।

Cherry Studio में Model टैब: Max tokens टॉगल चालू और 128000 मान सेट केस सामग्री से उदाहरण: Model टैब पर 128000 मान के साथ सक्षम किया गया Max tokens पैरामीटर।

इस विशेष मामले में, यूज़र ने मान 128000 सेट किया, जिसके बाद लंबे जवाब सामान्य रूप से बनने लगे। हालांकि, इन व्यावहारिक पहलुओं को ध्यान में रखें:

  • स्क्रीनशॉट में दिख रहा 128000 का मान इस विशिष्ट मामले की सेटिंग है, कोई सार्वभौमिक नियम या सिफ़ारिश नहीं।
  • यह संख्या आउटपुट संदेश की लंबाई की सीमा तय करती है, न कि संपूर्ण संदर्भ विंडो (context window) का आकार।
  • हर मॉडल एक बार में इतनी बड़ी मात्रा में टेक्स्ट जनरेट करने का समर्थन नहीं करता।
  • अधिक टोकन सीमा मॉडल को अधिक देर तक सोचने की अनुमति देती है, जिससे जवाब के इंतज़ार का समय और टोकन की खपत बढ़ सकती है।

स्टेप 3. कस्टम पैरामीटर्स की जांच करें

Model टैब में नीचे स्क्रॉल करके Custom parameters अनुभाग पर जाएं।

Cherry Studio में कस्टम पैरामीटर्स को इंटरफ़ेस टॉगल पर प्राथमिकता मिलती है। यदि इस सूची में पहले से ही पुराने मान के साथ max_tokens पैरामीटर मौजूद है, तो उसे हटा दें या नई संख्या में बदल दें; अन्यथा क्लाइंट पुरानी सीमा ही भेजता रहेगा।

परिणाम की जांच कैसे करें

छोटे वाक्यों पर इस सेटिंग का परीक्षण न करें: सरल प्रॉम्प्ट्स बुनियादी सीमा के भीतर आ जाते हैं और वास्तविक स्थिति नहीं दर्शाते।

  1. उस अधूरे संवाद के संदर्भ को साफ़ करने के लिए उसी असिस्टेंट में एक नया विषय बनाएं।
  2. एक विस्तृत एनालिटिकल कार्य भेजें, जो उस प्रॉम्प्ट जैसा हो जिस पर जवाब अधूरा रह गया था।
  3. सही संचालन के संकेतों की जांच करें:
    • thinking ब्लॉक के नीचे पूरा और दृश्यमान टेक्स्ट दिखाई दे रहा हो।
    • विचार तार्किक रूप से पूरा हुआ हो और वाक्य बीच में न कटा हो।
    • यदि आउटपुट टोकन (output tokens) के आंकड़े उपलब्ध हैं, तो उनकी तुलना पिछली सीमा से करें और सुनिश्चित करें कि जनरेशन फिर से ठीक 8192 पर नहीं रुका है। ध्यान दें कि सफल उत्तर के लिए इस सीमा को पार करना आवश्यक नहीं है — यह कम टोकन में भी सही ढंग से पूरा हो सकता है। पूरे अनुरोध के कुल टोकन खर्च की तुलना कभी भी आउटपुट सीमा से न करें।

यदि जवाब फिर भी न आए

इस समस्या के कई कारण हो सकते हैं। यदि आपने सेटिंग्स बदल दी हैं और फिर भी जवाब नहीं आ रहा है:

  1. सक्रिय असिस्टेंट की जांच करें। सुनिश्चित करें कि प्रॉम्प्ट उसी असिस्टेंट से भेजा गया है जहां टॉगल चालू किया गया था, और Max tokens का टॉगल सक्रिय बना हुआ है।
  2. प्रोवाइडर की मान्य सीमा जांचें। यदि आप प्रोवाइडर द्वारा मॉडल के लिए समर्थित सीमा से अधिक संख्या दर्ज करते हैं, तो अनुरोध पैरामीटर सत्यापन त्रुटि के साथ विफल हो जाएगा।
  3. आउटपुट टोकन की संख्या जांचें। BetterToken कंसोल में रिक्वेस्ट डेटा का मिलान करें और विशेष रूप से आउटपुट टोकन (output tokens) पर ध्यान दें, न कि कुल गिनती पर। यदि जनरेशन निर्धारित सीमा से काफी पहले ही रुक गया है, तो स्ट्रीमिंग (Stream) डिस्प्ले, नेटवर्क स्थिरता या बाहरी टूल्स (MCP सर्वर और फ़ंक्शंस) के कॉल्स की जांच करनी चाहिए, हालांकि max_tokens के प्रभाव को पूरी तरह से नकारा नहीं जा सकता।

सपोर्ट टीम से संपर्क करते समय केवल सुरक्षित तकनीकी जानकारी ही साझा करें: रिक्वेस्ट आईडी (Request ID), सटीक समय, मॉडल का नाम और उपयोग किए गए टोकन की संख्या। अपनी गोपनीय API कीज़ और निजी प्रॉम्प्ट टेक्स्ट कभी न भेजें。

अपना LLM वर्कफ़्लो बेहतर बनाना चाहते हैं?

एक API से मॉडल जोड़ें, कुंजियाँ प्रबंधित करें और AI खर्च नियंत्रित करें।

मुफ़्त शुरू करें