GPT-6 Luna बनाम GPT-5.6 Luna: सफल Codex कार्य की वास्तविक लागत कैसे निकालें
GPT-6 Luna की टोकन दरें GPT-5.6 Luna से काफी कम हैं, लेकिन Codex के लिए मॉडल चुनते समय केवल सूची मूल्य नहीं, बल्कि प्रति स्वीकृत कार्य की लागत देखनी चाहिए। यह मार्गदर्शिका 2026-09-25 को सत्यापित OpenAI Standard और BetterToken कीमतों, एक समान काल्पनिक टोकन मिश्रण और स्वीकृति, पुनः प्रयास, समय तथा पूर्ण कार्य लागत मापने की पुनरुत्पाद्य विधि देती है।
विषय-सूची

आपका असली निर्णय यह नहीं है कि Luna की कौन-सी पीढ़ी नई लगती है; आपको तय करना है कि Codex के अगले कार्य पहले किस मॉडल पर चलें और असफलता के बाद कब बदलना चाहिए। इसे पढ़ने के बाद आप प्रति-प्रयास लागत से पहला उम्मीदवार चुन सकेंगे, फिर acceptance rate, retries और manual repair समय जोड़कर हर सफल कार्य की वास्तविक लागत निकाल सकेंगे।
शुरुआत यहां से करें: अधिकतर स्वतः-जांच योग्य कार्यों में पहले gpt-6-luna आजमाएं
जब scope स्पष्ट हो और tests, lint या acceptance script खराब परिणाम को जल्दी अस्वीकार कर सके, तब gpt-6-luna बेहतर पहला उम्मीदवार है। इसकी प्रति-प्रयास Token लागत कम है, इसलिए आप कम बजट में baseline बना सकते हैं और फिर तय कर सकते हैं कि जटिल कार्य gpt-5.6-luna को देने चाहिए या नहीं।
| आपकी स्थिति | पहले क्या करें | सुझाव कब बदलेगा |
|---|---|---|
| छोटे fixes या batch changes, जिनके automated tests हैं | gpt-6-luna से शुरू करें | बार-बार failure हो, या manual repair कीमत का लाभ खत्म कर दे |
| Cross-file feature, refactor या interface change | दोनों मॉडल पर paired test चलाएं | gpt-5.6-luna retries और repair समय स्पष्ट रूप से घटाए तो इस वर्ग को उसे दें |
| Input 272K के पास या उससे ऊपर है | पहले irrelevant files हटाएं, history घटाएं या task बांटें | Context कम न हो सके तो long-context rates से तुलना करें |
| आप ChatGPT या Codex plan allowance उपयोग कर रहे हैं | Plan dashboard और Credit rules देखें, API table नहीं | API Key या custom provider पर आने के बाद ही नीचे के Token rates लागू करें |
सार्वजनिक जानकारी में अभी समान Codex version, repository और reasoning effort पर दोनों मॉडल का paired result नहीं है। कीमत testing order तय कर सकती है, लेकिन default model आपके अपने task data से तय होना चाहिए।
Interface limits समान हैं, इसलिए वे coding quality नहीं बताते
दोनों मॉडल के मुख्य interface और context limits लगभग समान हैं, इसलिए specification sheet यह नहीं बता सकती कि आपकी codebase में कौन अधिक भरोसेमंद होगा। दोनों text और image input, text output, Responses API, reasoning tokens और none से max तक reasoning effort समर्थित करते हैं; दोनों का context window 1,050,000 tokens, maximum input 922,000 tokens और maximum output 128,000 tokens है।
| बिंदु | gpt-6-luna | gpt-5.6-luna |
|---|---|---|
| आधिकारिक स्थिति | केंद्रित, उच्च-मात्रा कार्यों के लिए दक्ष मॉडल | लागत-संवेदी, उच्च-मात्रा workloads के लिए मॉडल |
| ज्ञान कटऑफ | 2026-05-18 | 2026-02-16 |
| Context window | 1,050,000 टोकन | 1,050,000 टोकन |
| डिफ़ॉल्ट reasoning effort | medium | medium |
इन विशेषताओं से यह सिद्ध नहीं होता कि आपकी codebase में किसी मॉडल की acceptance rate अधिक होगी, वह जल्दी पूरा करेगा, या कम retries लेगा। Codex का परिणाम कार्य के प्रकार, context की गुणवत्ता, tool permissions, client version, reasoning effort और आपके acceptance criteria पर भी निर्भर करता है।
272K तक gpt-6-luna की Token दरें कम हैं
Complete input context 272K या कम होने पर gpt-6-luna की input, cache-read और cache-write दरें gpt-5.6-luna की आधी हैं, जबकि output rate लगभग 41.7% है। तालिका 2026-09-25 को सत्यापित हुई, मुद्रा USD प्रति 10 लाख tokens है, और केवल OpenAI Standard तथा BetterToken API billing की तुलना करती है—ChatGPT/Codex plan allowance या Credit billing की नहीं।
272K या कम: इस तालिका से सीधे गणना करें
यदि हर request का पूरा input context 272K या कम है, तो यही tier उपयोग करें; long-context multiplier न लगाएं।
| Model ID | प्रदाता | इनपुट | कैश रीड | कैश राइट | आउटपुट |
|---|---|---|---|---|---|
gpt-6-luna | OpenAI Standard | $0.10 | $0.01 | $0.125 | $0.50 |
gpt-6-luna | BetterToken | $0.068 | $0.0068 | $0.085 | $0.34 |
gpt-5.6-luna | OpenAI Standard | $0.20 | $0.02 | $0.25 | $1.20 |
gpt-5.6-luna | BetterToken | $0.136 | $0.0136 | $0.17 | $0.816 |
BetterToken की कीमतें बदल सकती हैं, इसलिए प्रकाशन या खरीद के दिन वर्तमान कीमत देखें और उसी दिन पृष्ठ पर दिख रहे आंकड़े इस्तेमाल करें। BetterToken, OpenAI का आधिकारिक उत्पाद नहीं है। ऊपर की दरें उसके GPT समूह के लिए हैं, जिसका उपयोग API, Codex और custom Base URL समर्थित tools में किया जा सकता है; ये ChatGPT या Codex subscription allowance नहीं हैं।
इन मॉडल के लिए OpenAI Batch और Flex की कीमत Standard की 50% है, इसलिए वे यहां दिखाई गई BetterToken दरों से कम हैं। वे इस तुलना के दायरे में नहीं हैं। इस तालिका को यह दावा नहीं माना जाना चाहिए कि BetterToken हर OpenAI processing option से सस्ता है।
272K से ऊपर: पहले input घटाएं, जरूरत हो तो long-context rates लगाएं
यदि task बांटा जा सकता है, तो threshold पार करने से पहले irrelevant files हटाएं, history छोटी करें या काम विभाजित करें, क्योंकि पूरा request महंगा हो जाता है। Threshold में cached हिस्से सहित पूरा input context गिना जाता है; 272K से ऊपर input, cache read और cache write short-context rate के 2 गुना, और output 1.5 गुना हो जाता है:
| Model ID | प्रदाता | इनपुट | कैश रीड | कैश राइट | आउटपुट |
|---|---|---|---|---|---|
gpt-6-luna | OpenAI Standard | $0.20 | $0.02 | $0.25 | $0.75 |
gpt-6-luna | BetterToken | $0.136 | $0.0136 | $0.17 | $0.51 |
gpt-5.6-luna | OpenAI Standard | $0.40 | $0.04 | $0.50 | $1.80 |
gpt-5.6-luna | BetterToken | $0.272 | $0.0272 | $0.34 | $1.224 |
चार Token categories अलग रखकर एक प्रयास की लागत दोबारा निकालें
एक Codex attempt की गणना में uncached input, cache read, cache write और output अलग रखें। नीचे का समान hypothetical usage profile केवल तरीका दिखाता है; अपने billing details डालकर आप वास्तविक per-attempt cost निकाल सकते हैं:
- 32,000 uncached input tokens;
- 160,000 cache-read tokens;
- 16,000 cache-write tokens;
- 8,000 output tokens;
- हर request का पूरा input context 272K या उससे कम है, इसलिए short-context दरें लागू होती हैं।
सूत्र:
कार्य लागत = uncached input / 1,000,000 × input price
+ cache read / 1,000,000 × cache-read price
+ cache write / 1,000,000 × cache-write price
+ output / 1,000,000 × output price
| Model ID | प्रदाता | इनपुट लागत | कैश-रीड लागत | कैश-राइट लागत | आउटपुट लागत | प्रति प्रयास कुल |
|---|---|---|---|---|---|---|
gpt-6-luna | OpenAI Standard | $0.003200 | $0.001600 | $0.002000 | $0.004000 | $0.010800 |
gpt-6-luna | BetterToken | $0.002176 | $0.001088 | $0.001360 | $0.002720 | $0.007344 |
gpt-5.6-luna | OpenAI Standard | $0.006400 | $0.003200 | $0.004000 | $0.009600 | $0.023200 |
gpt-5.6-luna | BetterToken | $0.004352 | $0.002176 | $0.002720 | $0.006528 | $0.015776 |
इस काल्पनिक टोकन संरचना में gpt-6-luna का एक प्रयास gpt-5.6-luna के प्रयास का लगभग 46.6% खर्च करता है। BetterToken दोनों मॉडल पर समान price multiplier लगाता है, इसलिए दोनों प्रदाताओं पर मॉडल-अनुपात समान है। फिर भी यह प्रति प्रयास लागत है, प्रति सफल कार्य लागत नहीं।
Cache read अलग गिनें, वरना लागत अधिक या कम दिखेगी
Cache read को सामान्य input rate पर न लगाएं और bill से हटाएं भी नहीं। Codex repository context, conversation history और tool output बार-बार पढ़ता है; cached tokens सस्ते होते हैं, लेकिन उनकी संख्या बड़ी हो सकती है, इसलिए एक संयुक्त “input” संख्या गलत परिणाम देती है।
हर run के लिए input, cached input, cache write और output अलग-अलग सुरक्षित रखें। यदि कोई access layer केवल अंतिम डॉलर राशि दिखाती है और चारों token categories नहीं देती, तो यह समझाना कठिन हो जाता है कि किसी model या task की लागत अधिक क्यों है।
Default model को प्रति सफल कार्य लागत से चुनें
सस्ता call जरूरी नहीं कि सस्ता पूरा हुआ task हो; failures, rollbacks और retries की पूरी API लागत जोड़ें। अधिक उपयोगी metric है:
प्रति सफल कार्य लागत = सभी प्रयासों की कुल API लागत / स्वीकृत कार्यों की संख्या
कम से कम ये आयाम दर्ज करें:
- Acceptance rate: पूर्वनिर्धारित criteria को बिना developer द्वारा solution दोबारा लिखे पूरा करने वाले कार्यों का अनुपात;
- Retries: उसी कार्य पर दोबारा prompt, rollback या नया model run;
- Elapsed time: कार्य शुरू होने से acceptable diff मिलने तक का समय, केवल first-token latency नहीं;
- Manual repair: क्या developer को generated code बदलना पड़ा और कितना समय लगा;
- Token mix: uncached input, cache reads, cache writes और output।
ऊपर के काल्पनिक OpenAI Standard खर्च में प्रति प्रयास अनुपात 0.010800 / 0.023200 ≈ 46.6% है। यदि token profile समान रहे, तो gpt-6-luna की अपेक्षित API लागत तब भी कम होगी जब उसकी acceptance rate, gpt-5.6-luna की acceptance rate के लगभग 46.6% से अधिक हो। यह काल्पनिक कीमतों से निकला break-even संबंध है, measured quality claim नहीं। Token उपयोग, retries या task mix बदलते ही सीमा भी बदल जाएगी।
तुलना पर भरोसा करने से पहले पांच शर्तें स्थिर रखें
हर मॉडल को एक बार चला देना विश्वसनीय तुलना नहीं है; दोनों को समान शुरुआत, समान task class और समान acceptance criteria चाहिए। ये पांच कदम cache, run order और मानवीय judgment के bias को घटाते हैं।
1. Environment स्थिर करें
दोनों मॉडल के लिए समान Codex version, शुरुआती Git commit, configuration, tool permissions, reasoning effort, prompt और acceptance command रखें। एक मॉडल को OpenAI Standard और दूसरे को किसी अलग access path से चलाकर हर latency या failure अंतर को model पर न डालें।
2. कार्य श्रेणियां अलग रखें
कम से कम तीन task classes अलग दर्ज करें:
| कार्य श्रेणी | उदाहरण | सुझाया acceptance criterion |
|---|---|---|
| छोटा fix | एक या कुछ files में स्पष्ट defect | Targeted tests pass हों; unrelated files न बदलें |
| Cross-file change | Feature, refactor या coordinated interface change | Full tests और lint pass हों; मांगा गया behavior मौजूद हो |
| Review और diagnosis | Bug ढूंढना, risk समझाना, fix सुझाना | Known issue मिले और concrete code evidence दिया जाए |
तीनों को एक औसत में न मिला दें। छोटे fixes पर दो मॉडल लगभग समान हो सकते हैं, जबकि cross-file work में retry rate अलग हो सकती है।
3. Model चलाने से पहले acceptance तय करें
Testing से पहले required tests, allowed directories, dependency policy और failure conditions तय करें। Output देखने के बाद bar कम करने से acceptance rate अर्थहीन हो जाती है।
4. Model order बदलते रहें
हर कार्य में एक ही model को पहले न चलाएं। Order को alternate करें, या संभव हो तो समान कठिनाई वाले स्वतंत्र tasks उपयोग करें, ताकि first-run caching, environment repair और operator familiarity किसी एक model को लगातार लाभ न दें।
5. हर कार्य का raw record रखें
एक उपयोगी row में task ID, task class, model ID, provider, processing tier, reasoning effort, start/end time, चार token categories, attempt count, pass/fail, failure reason, manual-repair minutes और final cost हों। Raw rows सुरक्षित रखने के बाद ही task class के अनुसार aggregate करें।
gpt-6-luna कब रखें और gpt-5.6-luna पर कब जाएं
जब तक gpt-6-luna की acceptance rate कीमत का लाभ बनाए रखती है और manual repair समय करीब है, उसे default candidate रखें। अलग task classes में परिणाम बदलें तो routing करें; हर काम पर एक ही global model न थोपें।
| आपको क्या दिखता है | सुझाया कदम |
|---|---|
gpt-6-luna acceptance, gpt-5.6-luna की acceptance के लगभग 46.6% से अधिक है और token profile तथा repair समय समान हैं | gpt-6-luna रखें; expected API cost कम है |
gpt-6-luna break-even से नीचे है, या retries और repair कुल लागत बढ़ा देते हैं | उस task class को gpt-5.6-luna पर भेजें |
छोटे fixes में gpt-6-luna सस्ता है, लेकिन cross-file work में gpt-5.6-luna कम rework करता है | Task class के अनुसार route करें, universal default न चुनें |
| अंतर मुख्यतः provider latency, errors या rate limits से है | Model को दोष देने से पहले एक ही access path पर फिर चलाएं |
| Input अक्सर 272K पार करता है | Context optimize करके फिर तुलना करें; pricing-tier jump को quality difference न मानें |
46.6% सीमा ऊपर के hypothetical token profile पर ही लागू होती है। Output length, cache usage या retry count बदलें तो दोनों मॉडल की वास्तविक per-attempt cost से नया break-even निकालें।
सुझाव: gpt-6-luna से baseline बनाएं, फिर सफल कार्य लागत से निर्णय लें
यदि आज एक मॉडल चुनना जरूरी है, तो स्पष्ट और स्वतः-जांच योग्य कार्य gpt-6-luna पर शुरू करें। जटिल कार्यों का प्रतिनिधि sample बचाकर समान conditions में gpt-5.6-luna control चलाएं; केवल एक call की कीमत देखकर न रुकें।
समान tasks की एक batch के बाद acceptance rate, average retries, manual-repair time और प्रति सफल कार्य लागत निकालें। gpt-6-luna वास्तव में सस्ता रहे तो default रखें; यदि किसी task class में gpt-5.6-luna का कम rework उसकी ऊंची Token दर की भरपाई करे, तो केवल वही class उसे दें।
आधिकारिक संदर्भ
Model specifications और OpenAI pricing दोबारा जांचने के लिए ये तीन official pages पर्याप्त हैं।