GPT-6 Luna frente a GPT-5.6 Luna: cómo calcular el coste real de una tarea aceptada en Codex
GPT-6 Luna tiene tarifas por token mucho más bajas que GPT-5.6 Luna, pero en Codex conviene elegir por el coste de cada tarea aceptada, no solo por el precio de lista. Esta guía usa precios de OpenAI Standard y BetterToken verificados el 2026-09-25, una misma mezcla hipotética de tokens y un método reproducible que mide aceptación, reintentos, tiempo y coste total.
Índice

No necesitas decidir qué generación de Luna parece más nueva, sino qué modelo debe ejecutar el próximo lote de tareas de Codex y cuándo cambiar tras un fallo. Al terminar, podrás elegir el primer candidato por coste de intento y después calcular el coste real de cada tarea aceptada con tasa de aceptación, reintentos y tiempo de corrección manual.
Empieza aquí: prueba primero gpt-6-luna en la mayoría de tareas verificables automáticamente
gpt-6-luna es el mejor primer candidato cuando el alcance está claro y las pruebas, el lint o un script de aceptación pueden rechazar rápido un resultado incorrecto. Su menor coste por intento permite crear una línea base barata y decidir después si el trabajo complejo debe pasar a gpt-5.6-luna.
| Tu situación | Qué hacer primero | Qué cambiaría la recomendación |
|---|---|---|
| Correcciones pequeñas o cambios por lotes con pruebas automáticas | Empieza por gpt-6-luna | Falla repetidamente o la corrección manual elimina la ventaja de precio |
| Funciones entre archivos, refactorizaciones o cambios de interfaces | Ejecuta pruebas pareadas con ambos modelos | Usa gpt-5.6-luna para esta clase si reduce claramente reintentos y corrección |
| La entrada se acerca o supera 272K | Elimina archivos irrelevantes, acorta el historial o divide la tarea | Si no puedes reducir el contexto, compara con tarifas de contexto largo |
| Usas cuotas de un plan ChatGPT o Codex | Consulta el panel del plan y las reglas de Credit, no la tabla API | Aplica los precios por tokens solo al usar API Key o custom provider |
La información pública todavía no ofrece resultados pareados con la misma versión de Codex, repositorio y reasoning effort. El precio puede fijar el orden de prueba, pero tus propios datos deben decidir el modelo predeterminado.
Los límites de interfaz son parecidos y no predicen la calidad del código
Los dos modelos tienen interfaces principales y límites de contexto parecidos, por lo que la ficha técnica no indica cuál será más fiable en tu código. Ambos admiten texto e imágenes como entrada, texto como salida, Responses API, reasoning tokens y reasoning effort de none a max; ambos ofrecen 1,050,000 tokens de contexto, un máximo de 922,000 tokens de entrada y 128,000 de salida.
| Elemento | gpt-6-luna | gpt-5.6-luna |
|---|---|---|
| Posicionamiento oficial | Modelo eficiente para tareas enfocadas y de gran volumen | Modelo para cargas de gran volumen sensibles al coste |
| Fecha de corte del conocimiento | 2026-05-18 | 2026-02-16 |
| Ventana de contexto | 1,050,000 tokens | 1,050,000 tokens |
| Reasoning effort predeterminado | medium | medium |
Estas especificaciones no prueban que uno tenga mayor tasa de aceptación, termine antes o necesite menos reintentos en tu base de código. El resultado de Codex también depende del tipo de tarea, la calidad del contexto, los permisos de herramientas, la versión del cliente, el reasoning effort y los criterios de aceptación.
Hasta 272K, gpt-6-luna tiene tarifas por token más bajas
Con un contexto de entrada completo de hasta 272K, gpt-6-luna cuesta la mitad en entrada, lectura y escritura de caché, mientras que su salida cuesta aproximadamente el 41.7% de gpt-5.6-luna. La tabla se verificó el 2026-09-25, usa USD por 1 millón de tokens y compara únicamente OpenAI Standard con la facturación API de BetterToken, sin cuotas de planes ChatGPT o Codex ni facturación por Credit.
Hasta 272K: calcula directamente con esta tabla
Usa este nivel directamente cuando el contexto de entrada completo de cada solicitud sea de 272K o menos; no apliques los multiplicadores de contexto largo.
| Model ID | Proveedor | Entrada | Lectura de caché | Escritura de caché | Salida |
|---|---|---|---|---|---|
gpt-6-luna | OpenAI Standard | $0.10 | $0.01 | $0.125 | $0.50 |
gpt-6-luna | BetterToken | $0.068 | $0.0068 | $0.085 | $0.34 |
gpt-5.6-luna | OpenAI Standard | $0.20 | $0.02 | $0.25 | $1.20 |
gpt-5.6-luna | BetterToken | $0.136 | $0.0136 | $0.17 | $0.816 |
Los precios de BetterToken son dinámicos, así que conviene consultar el precio actual el día de publicar o comprar y utilizar los valores mostrados entonces. BetterToken no es un producto de OpenAI. Las tarifas anteriores corresponden a su grupo GPT para API, Codex y herramientas que admiten un Base URL personalizado; no son cuotas de suscripción de ChatGPT o Codex.
OpenAI Batch y Flex cuestan el 50% de Standard para estos modelos, por lo que están por debajo de las tarifas de BetterToken mostradas aquí. Quedan fuera de esta comparación. La tabla no debe interpretarse como una afirmación de que BetterToken sea más barato que todas las modalidades de procesamiento de OpenAI.
Por encima de 272K: reduce primero la entrada y usa tarifas largas si hace falta
Si puedes dividir la tarea, elimina archivos irrelevantes, acorta el historial o separa el trabajo antes de cruzar el umbral, porque se encarece toda la solicitud. El umbral usa el contexto de entrada completo, incluidas las partes en caché; por encima de 272K, entrada, lectura y escritura de caché cuestan 2 veces la tarifa corta y la salida 1.5 veces:
| Model ID | Proveedor | Entrada | Lectura de caché | Escritura de caché | Salida |
|---|---|---|---|---|---|
gpt-6-luna | OpenAI Standard | $0.20 | $0.02 | $0.25 | $0.75 |
gpt-6-luna | BetterToken | $0.136 | $0.0136 | $0.17 | $0.51 |
gpt-5.6-luna | OpenAI Standard | $0.40 | $0.04 | $0.50 | $1.80 |
gpt-5.6-luna | BetterToken | $0.272 | $0.0272 | $0.34 | $1.224 |
Separa cuatro categorías de tokens para reproducir el coste de un intento
Para calcular un intento de Codex, separa entrada sin caché, lectura de caché, escritura de caché y salida. El perfil hipotético común de abajo muestra el método; sustituye estas cifras por tu facturación para obtener el coste real por intento:
- 32,000 tokens de entrada sin caché;
- 160,000 tokens leídos de caché;
- 16,000 tokens escritos en caché;
- 8,000 tokens de salida;
- un contexto de entrada completo de 272K o menos en cada solicitud, por lo que se aplican las tarifas de contexto corto.
La fórmula es:
Coste de la tarea = entrada sin caché / 1,000,000 × precio de entrada
+ lectura de caché / 1,000,000 × precio de lectura
+ escritura de caché / 1,000,000 × precio de escritura
+ salida / 1,000,000 × precio de salida
| Model ID | Proveedor | Coste de entrada | Coste de lectura de caché | Coste de escritura de caché | Coste de salida | Total por intento |
|---|---|---|---|---|---|---|
gpt-6-luna | OpenAI Standard | $0.003200 | $0.001600 | $0.002000 | $0.004000 | $0.010800 |
gpt-6-luna | BetterToken | $0.002176 | $0.001088 | $0.001360 | $0.002720 | $0.007344 |
gpt-5.6-luna | OpenAI Standard | $0.006400 | $0.003200 | $0.004000 | $0.009600 | $0.023200 |
gpt-5.6-luna | BetterToken | $0.004352 | $0.002176 | $0.002720 | $0.006528 | $0.015776 |
Con esta estructura hipotética, un intento con gpt-6-luna cuesta alrededor del 46.6% de uno con gpt-5.6-luna. BetterToken aplica el mismo multiplicador de precio a ambos modelos, por lo que la proporción entre ellos es idéntica en los dos proveedores. Sigue siendo coste por intento, no coste por tarea completada con éxito.
Cuenta la lectura de caché aparte o sobrestimarás o subestimarás el coste
No cobres la lectura de caché como entrada ordinaria ni la omitas de la factura. Codex vuelve a leer el contexto del repositorio, el historial y los resultados de herramientas; los tokens en caché suelen ser más baratos, pero pueden ser numerosos, de modo que una sola cifra de “entrada” da un resultado incorrecto.
En cada ejecución, conserva por separado input, cached input, cache write y output. Si una capa de acceso solo muestra el importe final y no las cuatro categorías, resulta mucho más difícil explicar por qué un modelo o una tarea cuesta más.
Elige el modelo predeterminado por coste de tarea aceptada
Una llamada barata no garantiza una tarea terminada barata; incluye el coste API de fallos, reversiones y reintentos. La métrica más útil es:
Coste por tarea aceptada = coste API total de todos los intentos / tareas aceptadas
Registra al menos estas dimensiones:
- Tasa de aceptación: proporción de tareas que cumplen los criterios definidos sin que un desarrollador reescriba la solución;
- Reintentos: nuevos prompts, reversiones o nuevas ejecuciones para la misma tarea;
- Tiempo total: desde el inicio hasta obtener un diff aceptable, no solo la latencia del primer token;
- Corrección manual: si un desarrollador tuvo que modificar el código generado y durante cuánto tiempo;
- Mezcla de tokens: entrada sin caché, lecturas de caché, escrituras de caché y salida.
Con los costes hipotéticos de OpenAI Standard, la relación por intento es 0.010800 / 0.023200 ≈ 46.6%. Si el perfil de tokens permaneciera igual, gpt-6-luna seguiría teniendo menor coste API esperado siempre que su tasa de aceptación superara aproximadamente el 46.6% de la tasa de gpt-5.6-luna. Es solo una relación de equilibrio derivada de precios hipotéticos, no una conclusión medida sobre calidad. El umbral cambia al variar los tokens, los reintentos o la mezcla de tareas.
Fija cinco condiciones antes de confiar en la comparación
Ejecutar una vez cada modelo no constituye una comparación válida; ambos deben partir del mismo estado, recibir tareas comparables y usar los mismos criterios de aceptación. Estos cinco pasos reducen el sesgo de la caché, el orden y el juicio humano.
1. Fija el entorno
Usa la misma versión de Codex, commit inicial de Git, configuración, permisos de herramientas, reasoning effort, prompt y comando de aceptación para ambos modelos. No llames a uno mediante OpenAI Standard y al otro por una ruta distinta para después atribuir toda diferencia de latencia o fallo al modelo.
2. Separa las categorías de tareas
Como mínimo, mantén tres clases distintas:
| Clase de tarea | Ejemplo | Criterio de aceptación sugerido |
|---|---|---|
| Corrección pequeña | Defecto bien definido en uno o pocos archivos | Pasan las pruebas objetivo; no se modifican archivos ajenos |
| Cambio entre archivos | Función, refactorización o cambio coordinado de interfaces | Pasan todas las pruebas y lint; aparece el comportamiento solicitado |
| Revisión y diagnóstico | Encontrar un bug, explicar el riesgo y proponer una solución | Encuentra el problema conocido y señala evidencia concreta en el código |
No combines las tres en un único promedio. Dos modelos pueden rendir casi igual en correcciones pequeñas y diferir de forma importante en la tasa de reintentos para cambios entre archivos.
3. Define la aceptación antes de ejecutar el modelo
Fija de antemano las pruebas obligatorias, los directorios permitidos, la política de dependencias y las condiciones de fallo. Rebajar el criterio después de ver una salida vuelve inútil la tasa de aceptación.
4. Alterna el orden de los modelos
No ejecutes siempre el mismo modelo primero. Alterna el orden o usa tareas independientes equivalentes cuando sea posible, para que la caché de la primera ejecución, la reparación del entorno y la familiaridad del operador no favorezcan siempre al mismo modelo.
5. Conserva los registros por tarea
Una fila útil contiene: ID de tarea, clase, Model ID, proveedor, nivel de procesamiento, reasoning effort, hora de inicio y fin, las cuatro categorías de tokens, número de intentos, resultado, motivo del fallo, minutos de corrección manual y coste final. Conserva las filas brutas antes de agregar por categoría.
Cuándo mantener gpt-6-luna y cuándo cambiar a gpt-5.6-luna
Mantén gpt-6-luna como candidato predeterminado mientras su tasa de aceptación conserve la ventaja de precio y el tiempo de corrección manual sea parecido. Si los resultados cambian según la clase de tarea, enruta el trabajo en vez de imponer un único modelo global.
| Lo que observas | Acción recomendada |
|---|---|
La aceptación de gpt-6-luna supera aproximadamente el 46.6% de la de gpt-5.6-luna, con perfiles de tokens y corrección similares | Mantén gpt-6-luna; el coste API esperado es menor |
gpt-6-luna cae por debajo del punto de equilibrio, o reintentos y corrección elevan el coste total | Pasa esa clase de tareas a gpt-5.6-luna |
gpt-6-luna gana en arreglos pequeños, pero gpt-5.6-luna reduce el retrabajo en cambios entre archivos | Enruta por clase de tarea, no elijas un default universal |
| La diferencia procede sobre todo de latencia, errores o límites del proveedor | Repite por la misma ruta de acceso antes de atribuirla al modelo |
| La entrada supera a menudo 272K | Optimiza el contexto y vuelve a probar; no confundas el salto de tarifa con calidad |
El 46.6% solo corresponde al perfil hipotético anterior. Si cambian la longitud de salida, la caché o los reintentos, recalcula el punto de equilibrio con el coste real por intento de cada modelo.
Recomendación: crea la línea base con gpt-6-luna y decide por coste de éxito
Si hoy debes elegir uno, empieza las tareas claras y verificables automáticamente con gpt-6-luna. Conserva una muestra representativa de tareas complejas para ejecutar gpt-5.6-luna en las mismas condiciones; no te quedes en el precio de una llamada.
Tras un lote de tareas comparables, calcula tasa de aceptación, reintentos medios, tiempo de corrección manual y coste por tarea aceptada. Mantén gpt-6-luna como predeterminado si sigue siendo más barato; si gpt-5.6-luna elimina suficiente retrabajo para cubrir su mayor tarifa en una clase concreta, enruta solo esa clase hacia él.
Fuentes oficiales
Usa estas tres páginas oficiales para volver a comprobar especificaciones y precios de OpenAI.