Calculadora de costes de API: tokens, caché y volumen de solicitudes
Usa una fórmula y una calculadora Python para estimar costes de input, output, cache write y cache read en tres escenarios de volumen.
Una calculadora de costes de API multiplica cada categoría de uso por su tarifa actual y por el número de llamadas. Calcula input, output, cache write y cache read por separado, con todas las tarifas en una misma moneda por 1.000.000 de tokens. No sustituyas silenciosamente un valor desconocido por cero. Define primero la solicitud base y después el volumen y la tasa de cache hit.
¿Qué datos necesita la calculadora?
Para la API de texto prepara siete entradas:
¿Quieres contrastar la previsión con una llamada real? Crea una cuenta BetterToken y una API Key, toma las tarifas actuales de la página de precios y realiza una solicitud controlada. Después compara modelo, estado, input, output, cache tokens aplicables y consumo en el Dashboard para ver qué supuestos debes corregir.
El caching depende del modelo y del protocolo. Antes de rellenar los campos, consulta la referencia API de BetterToken, OpenAI Prompt Caching o Anthropic Prompt Caching.
Fórmula universal
Símbolos:
Coste de una llamada:
Cextra incluye unidades cobradas por separado: búsqueda web, imágenes, audio, almacenamiento, tools u otras operaciones. Si no las hay, el valor es cero. Si no sabes si hay un cargo adicional, deja el campo como desconocido y revisa la documentación; usar cero crearía una precisión falsa.
El error más habitual es olvidar dividir entre un millón. Si el precio es por 1.000.000 de tokens, divide primero los tokens entre 1_000_000 y después multiplica por la tarifa.
Calculadora Python para copiar
El script no contiene precios ni API Key. Pide los datos y calcula un escenario. El resultado usa la misma moneda que las tarifas introducidas.
Guarda el código como api_cost_calculator.py y ejecútalo:
No introduzcas tokens reales en los campos cache write/read si el endpoint actual no separa esas categorías. Convierte antes el uso en grupos mutuamente excluyentes para no contar el mismo token dos veces.
Cómo tener en cuenta la tasa de cache hit
Para una serie de consultas conviene separar cache hits y misses:
Resultado:
Para planificar, redondea Nhits hacia abajo y Nmiss hacia arriba. En un registro real usa el número efectivo de llamadas de cada tipo.
Tres escenarios en lugar de un número
Escenario base
Usa el input y output medianos de tareas recientes, el número esperado de llamadas y la tasa de cache hit observada. Si aún no hay historial, etiqueta los valores como supuestos.
Escenario favorable
Prefijo largo estable, alta tasa de cache hit, output limitado y sin errores repetidos. Muestra un límite inferior, pero no debe convertirse en una promesa de presupuesto.
Peor caso
Añade cache misses, output largo, un retry limitado y tools cobrados aparte. No aumentes todos los parámetros arbitrariamente: cada supuesto debe corresponder a un riesgo real del proceso.
Registra los resultados en una hoja sencilla:
Cómo evaluar un workflow de agent
Una ejecución visible de un agent no siempre equivale a una llamada de modelo. Puede incluir planificación, tool call, tool result, retry y respuesta final. Por ello:
- realiza una tarea de prueba segura;
- cuenta las llamadas API reales;
- agrúpalas por modelo y categoría de uso;
- aplica la fórmula a cada grupo;
- añade por separado las unidades de tool o búsqueda;
- compara el importe con el Dashboard.
No multipliques el coste de una llamada cualquiera por el número de usuarios si la longitud de las solicitudes varía mucho. Es mejor usar varias clases de tarea: pregunta corta, revisión de archivo y tarea de agent.
Cómo contrastar una previsión con el hecho
Tras la llamada de prueba, compara:
- hora y request status;
- Model ID;
- tokens de input y output;
- categoría de caché;
- número de retries;
- consumo real;
- moneda y fecha del precio.
La diferencia suele indicar tarifa incorrecta, doble conteo de cached tokens, retry oculto o una transacción facturable adicional. Para BetterToken usa la página de precios actual y comprueba la entrada real del Dashboard; no copies precios de una captura o artículo antiguo.
Límites de la calculadora
La fórmula solo cubre categorías conocidas. No predice cambios de tarifa, precios futuros, routing dinámico ni el número de pasos de agent. Imágenes, audio, búsqueda web, almacenamiento y algunas tools pueden tener unidades propias.
Tampoco evalúa la calidad de la respuesta. Una llamada más barata que haya que repetir manualmente puede elevar el coste de la tarea completa; eso se mide con un experimento separado, no añadiendo un coeficiente inventado.
FAQ
¿Qué introduzco si no se usa caché?
Pon cache write y cache read a cero solo si el endpoint no usó realmente caché. Si el valor es desconocido, revisa primero el uso.
¿En qué moneda estará el resultado?
El resultado usa la moneda de las tarifas y de extra_per_call introducidas. No mezcles dólares y rublos sin un tipo de cambio explícito y una fecha.
¿Los cached tokens están incluidos en los input tokens?
Depende de la forma de uso de la API concreta. Consulta la documentación y convierte los campos en categorías mutuamente excluyentes para evitar el doble conteo.
¿Cómo calculo el coste de un mes?
Calcula primero el coste de una clase de tarea y multiplícalo después por el número real o previsto de llamadas. Crea líneas independientes para distintos modelos y tareas, y suma el total.
¿Por qué el cargo real es mayor que la estimación?
Comprueba output, retries, pasos de agent, cache misses y tools adicionales. Relaciona cada línea de uso con el Dashboard, no solo el total.