Convide e ganhe

Como funcionam as recompensas

Compartilhe seu link. Quando um amigo se cadastrar por ele e adicionar saldo, você receberá a recompensa exibida nas recargas posteriores.

GPT-6 Luna vs. GPT-5.6 Luna: como calcular o custo real de uma tarefa aceita no Codex

O GPT-6 Luna tem tarifas por token bem menores que o GPT-5.6 Luna, mas a escolha no Codex deve considerar o custo por tarefa aceita, não apenas o preço de tabela. Este guia usa preços de OpenAI Standard e BetterToken verificados em 2026-09-25, a mesma combinação hipotética de tokens e um método reproduzível para medir aceitação, tentativas, tempo e custo total.

Conteúdo
GPT-6 Luna vs. GPT-5.6 Luna: como calcular o custo real de uma tarefa aceita no Codex

Você não precisa decidir qual geração Luna parece mais nova, mas qual modelo deve executar o próximo lote de tarefas do Codex e quando trocar depois de uma falha. Ao final, você poderá escolher o primeiro candidato pelo custo por tentativa e calcular o custo real de cada tarefa aceita com taxa de aceitação, novas tentativas e tempo de correção manual.

Comece por aqui: teste gpt-6-luna primeiro na maioria das tarefas verificáveis automaticamente

gpt-6-luna é o melhor primeiro candidato quando o escopo está claro e testes, lint ou um script de aceitação conseguem rejeitar rapidamente um resultado ruim. O custo menor por tentativa permite criar uma linha de base barata e decidir depois se o trabalho complexo deve passar para gpt-5.6-luna.

Sua situaçãoO que fazer primeiroO que mudaria a recomendação
Correções pequenas ou mudanças em lote com testes automáticosComece com gpt-6-lunaEle falha repetidamente ou a correção manual elimina a vantagem de preço
Recursos entre arquivos, refatorações ou mudanças de interfacesRode testes pareados com os dois modelosUse gpt-5.6-luna nessa classe se reduzir claramente tentativas e correção
A entrada está perto ou acima de 272KRemova arquivos irrelevantes, reduza o histórico ou divida a tarefaSe não puder reduzir o contexto, compare com tarifas de contexto longo
Você usa franquia de plano ChatGPT ou CodexConsulte o painel do plano e as regras de Credit, não a tabela de APIAplique os preços por token apenas ao usar API Key ou custom provider

As informações públicas ainda não trazem resultados pareados na mesma versão do Codex, repositório e reasoning effort. O preço pode definir a ordem do teste, mas seus próprios dados devem definir o modelo padrão.

Os limites de interface são parecidos e não preveem a qualidade do código

Os dois modelos têm interfaces principais e limites de contexto parecidos, portanto a ficha técnica não mostra qual será mais confiável no seu código. Ambos aceitam texto e imagem, retornam texto, suportam Responses API, reasoning tokens e reasoning effort de none a max; ambos têm contexto de 1,050,000 tokens, máximo de 922,000 tokens de entrada e 128,000 de saída.

Itemgpt-6-lunagpt-5.6-luna
Posicionamento oficialModelo eficiente para tarefas focadas e de alto volumeModelo para cargas de alto volume sensíveis a custo
Data de corte do conhecimento2026-05-182026-02-16
Janela de contexto1,050,000 tokens1,050,000 tokens
Reasoning effort padrãomediummedium

Essas especificações não provam que um modelo terá maior taxa de aceitação, concluirá mais rápido ou exigirá menos tentativas no seu código. O resultado do Codex também depende do tipo de tarefa, qualidade do contexto, permissões das ferramentas, versão do cliente, reasoning effort e critérios de aceitação.

Até 272K, gpt-6-luna tem tarifas por token menores

Com contexto completo de entrada de até 272K, gpt-6-luna custa metade em entrada, leitura e escrita de cache, enquanto a saída custa cerca de 41.7% de gpt-5.6-luna. A tabela foi verificada em 2026-09-25, usa USD por 1 milhão de tokens e compara apenas OpenAI Standard com cobrança de API da BetterToken, sem franquias de planos ChatGPT ou Codex nem cobrança por Credit.

Até 272K: calcule diretamente com esta tabela

Use esta faixa diretamente quando o contexto completo de entrada de cada solicitação ficar em 272K ou menos; não aplique os multiplicadores de contexto longo.

Model IDProvedorEntradaLeitura de cacheEscrita de cacheSaída
gpt-6-lunaOpenAI Standard$0.10$0.01$0.125$0.50
gpt-6-lunaBetterToken$0.068$0.0068$0.085$0.34
gpt-5.6-lunaOpenAI Standard$0.20$0.02$0.25$1.20
gpt-5.6-lunaBetterToken$0.136$0.0136$0.17$0.816

Os preços da BetterToken são dinâmicos. Portanto, consulte os preços atuais no dia da publicação ou compra e use os valores exibidos naquele momento. A BetterToken não é um produto da OpenAI. As tarifas acima são do grupo GPT usado via API, Codex e ferramentas que aceitam Base URL personalizado; elas não são franquias de assinatura do ChatGPT ou Codex.

OpenAI Batch e Flex custam 50% do Standard para esses modelos, portanto ficam abaixo das tarifas da BetterToken mostradas aqui. Eles não fazem parte desta comparação. A tabela não deve ser interpretada como afirmação de que a BetterToken é mais barata que toda modalidade de processamento da OpenAI.

Acima de 272K: reduza a entrada primeiro e use tarifas longas se necessário

Se puder dividir a tarefa, remova arquivos irrelevantes, encurte o histórico ou separe o trabalho antes do limite, porque toda a solicitação fica mais cara. O limite usa o contexto completo de entrada, inclusive partes em cache; acima de 272K, entrada, leitura e escrita de cache custam 2 vezes a tarifa curta e a saída custa 1.5 vez:

Model IDProvedorEntradaLeitura de cacheEscrita de cacheSaída
gpt-6-lunaOpenAI Standard$0.20$0.02$0.25$0.75
gpt-6-lunaBetterToken$0.136$0.0136$0.17$0.51
gpt-5.6-lunaOpenAI Standard$0.40$0.04$0.50$1.80
gpt-5.6-lunaBetterToken$0.272$0.0272$0.34$1.224

Separe quatro categorias de tokens para reproduzir o custo de uma tentativa

Para calcular uma tentativa do Codex, separe entrada sem cache, leitura de cache, escrita de cache e saída. O perfil hipotético comum abaixo demonstra o método; substitua os números pelos seus dados de cobrança para obter o custo real por tentativa:

  • 32,000 tokens de entrada sem cache;
  • 160,000 tokens lidos do cache;
  • 16,000 tokens escritos no cache;
  • 8,000 tokens de saída;
  • contexto completo de entrada de até 272K em cada solicitação, portanto com tarifas de contexto curto.

A fórmula é:

Custo da tarefa = entrada sem cache / 1,000,000 × preço de entrada
                 + leitura de cache / 1,000,000 × preço de leitura
                 + escrita de cache / 1,000,000 × preço de escrita
                 + saída / 1,000,000 × preço de saída
Model IDProvedorCusto de entradaCusto de leitura de cacheCusto de escrita de cacheCusto de saídaTotal por tentativa
gpt-6-lunaOpenAI Standard$0.003200$0.001600$0.002000$0.004000$0.010800
gpt-6-lunaBetterToken$0.002176$0.001088$0.001360$0.002720$0.007344
gpt-5.6-lunaOpenAI Standard$0.006400$0.003200$0.004000$0.009600$0.023200
gpt-5.6-lunaBetterToken$0.004352$0.002176$0.002720$0.006528$0.015776

Com essa estrutura hipotética, uma tentativa de gpt-6-luna custa cerca de 46.6% de uma tentativa de gpt-5.6-luna. A BetterToken aplica o mesmo multiplicador de preço aos dois modelos, então a proporção entre eles é idêntica nos dois provedores. Ainda assim, esse é o custo por tentativa, não o custo por tarefa concluída com sucesso.

Calcule a leitura de cache à parte para não superestimar nem subestimar o custo

Não cobre leitura de cache como entrada comum nem a exclua da conta. O Codex relê contexto do repositório, histórico e resultados das ferramentas; tokens em cache costumam ser mais baratos, mas podem ser numerosos, então uma única cifra de “entrada” produz o cálculo errado.

Em cada execução, preserve separadamente input, cached input, cache write e output. Se uma camada de acesso mostrar apenas o valor final e não as quatro categorias, fica muito mais difícil explicar por que um modelo ou uma tarefa custou mais.

Escolha o modelo padrão pelo custo por tarefa aceita

Uma chamada barata não garante uma tarefa concluída barata; inclua o custo API de falhas, reversões e novas tentativas. A métrica mais útil é:

Custo por tarefa aceita = custo total de API de todas as tentativas / tarefas aceitas

Registre ao menos estas dimensões:

  • Taxa de aceitação: proporção de tarefas que atendem aos critérios definidos sem o desenvolvedor reescrever a solução;
  • Novas tentativas: prompts repetidos, reversões ou novas execuções do modelo para a mesma tarefa;
  • Tempo total: do início até um diff aceitável, não apenas a latência do primeiro token;
  • Correção manual: se o desenvolvedor precisou alterar o código gerado e por quanto tempo;
  • Combinação de tokens: entrada sem cache, leituras de cache, escritas de cache e saída.

Com os custos hipotéticos do OpenAI Standard, a relação por tentativa é 0.010800 / 0.023200 ≈ 46.6%. Se o perfil de tokens permanecesse idêntico, gpt-6-luna ainda teria menor custo esperado de API sempre que sua taxa de aceitação fosse superior a aproximadamente 46.6% da taxa de gpt-5.6-luna. Isso é apenas uma relação de equilíbrio derivada de preços hipotéticos, não uma conclusão medida de qualidade. O limite muda quando tokens, tentativas ou tipos de tarefa mudam.

Fixe cinco condições antes de confiar na comparação

Executar cada modelo uma vez não é uma comparação válida; ambos precisam partir do mesmo estado, receber tarefas comparáveis e usar os mesmos critérios de aceitação. Estes cinco passos reduzem o viés de cache, ordem e julgamento humano.

1. Congele o ambiente

Use a mesma versão do Codex, commit inicial do Git, configuração, permissões das ferramentas, reasoning effort, prompt e comando de aceitação para os dois modelos. Não execute um via OpenAI Standard e o outro por um caminho diferente para depois atribuir toda diferença de latência ou falha ao modelo.

2. Separe as categorias de tarefa

Mantenha pelo menos três classes distintas:

Classe de tarefaExemploCritério de aceitação sugerido
Correção pequenaDefeito bem definido em um ou poucos arquivosTestes específicos passam; arquivos não relacionados permanecem intactos
Alteração entre arquivosRecurso, refatoração ou mudança coordenada de interfacesTodos os testes e lint passam; o comportamento solicitado está presente
Revisão e diagnósticoEncontrar um bug, explicar o risco e sugerir correçãoEncontra o problema conhecido e aponta evidência concreta no código

Não reúna as três classes em uma única média. Dois modelos podem ser quase iguais em correções pequenas e diferir bastante na taxa de novas tentativas em mudanças entre arquivos.

3. Defina a aceitação antes de executar o modelo

Fixe de antemão os testes obrigatórios, diretórios permitidos, política de dependências e condições de falha. Reduzir o padrão após ver a saída torna a taxa de aceitação sem sentido.

4. Alterne a ordem dos modelos

Não execute sempre o mesmo modelo primeiro. Alterne a ordem ou use tarefas independentes equivalentes quando possível, para que cache da primeira execução, reparos de ambiente e familiaridade do operador não favoreçam sistematicamente um lado.

5. Preserve os registros por tarefa

Uma linha útil contém: ID, classe da tarefa, Model ID, provedor, camada de processamento, reasoning effort, hora inicial e final, as quatro categorias de tokens, número de tentativas, resultado, motivo da falha, minutos de correção manual e custo final. Guarde as linhas brutas antes de agregar por classe.

Quando manter gpt-6-luna e quando trocar para gpt-5.6-luna

Mantenha gpt-6-luna como candidato padrão enquanto a taxa de aceitação preservar a vantagem de preço e o tempo de correção manual for parecido. Se o resultado variar por classe de tarefa, faça roteamento em vez de impor um único modelo global.

O que você observaAção recomendada
A aceitação de gpt-6-luna supera cerca de 46.6% da aceitação de gpt-5.6-luna, com perfis de tokens e correção semelhantesMantenha gpt-6-luna; o custo esperado de API é menor
gpt-6-luna fica abaixo do ponto de equilíbrio, ou tentativas e correção tornam o total maiorPasse essa classe de tarefas para gpt-5.6-luna
gpt-6-luna ganha em correções pequenas, mas gpt-5.6-luna reduz retrabalho em mudanças entre arquivosFaça roteamento por classe, sem escolher um default universal
A diferença vem principalmente de latência, erros ou limites do provedorRepita pela mesma rota de acesso antes de atribuir a diferença ao modelo
A entrada passa frequentemente de 272KOtimize o contexto e teste novamente; não confunda salto de tarifa com qualidade

O limite de 46.6% vale apenas para o perfil hipotético acima. Se comprimento da saída, cache ou número de tentativas mudarem, recalcule o ponto de equilíbrio com o custo real por tentativa de cada modelo.

Recomendação: crie a linha de base com gpt-6-luna e decida pelo custo de sucesso

Se precisar escolher um hoje, comece tarefas claras e verificáveis automaticamente com gpt-6-luna. Separe uma amostra representativa de tarefas complexas para rodar gpt-5.6-luna nas mesmas condições; não pare na comparação do preço de uma chamada.

Depois de um lote de tarefas comparáveis, calcule taxa de aceitação, média de tentativas, tempo de correção manual e custo por tarefa aceita. Mantenha gpt-6-luna como padrão se continuar mais barato; se gpt-5.6-luna eliminar retrabalho suficiente para cobrir sua tarifa maior em uma classe, encaminhe apenas essa classe para ele.

Referências oficiais

Use estas três páginas oficiais para conferir novamente as especificações e os preços da OpenAI.

Quer otimizar seu fluxo de trabalho com LLMs?

Conecte modelos por uma única API, gerencie chaves e controle os gastos com IA.

Começar grátis