DeepSeek V4 Flash para programación: precio, benchmarks e integración con herramientas
ID de modelo, precios, modos de benchmark, configuración, problemas de compatibilidad y un método de prueba justo para DeepSeek V4 Flash.
DeepSeek V4 Flash merece una prueba como modelo de bajo coste para llamadas de programación frecuentes, subagentes y tareas con una definición clara de terminado. El precio bajo por token no elimina el coste de razonamientos largos, errores del cliente ni reintentos. Para trabajo arquitectónico pesado, compare Flash con Pro en el mismo repositorio; no lo trate como una «copia barata» del buque insignia.
¿Quiere probar Flash con un presupuesto pequeño? En el catálogo de BetterToken, el 13 de agosto de 2026 deepseek-v4-flash-0731 costaba aproximadamente 0.191 por millón de salida. Cree su propia clave API, ejecute una prueba segura y revise el ID del modelo y el uso en Workspace. Vuelva a consultar el catálogo antes de la siguiente ejecución: los ID y precios dependen del proveedor seleccionado y pueden cambiar.
¿De qué DeepSeek V4 Flash hablamos?
El anuncio oficial del 24 de abril presentó V4 Preview. El 13 de agosto, la página de modelos de DeepSeek mostraba dos ID de API estables: deepseek-v4-flash y deepseek-v4-pro; sus MODEL VERSION eran DeepSeek-V4-Flash-0731 y DeepSeek-V4-Pro-0813.
La versión y el ID tienen funciones distintas. La versión indica el build que DeepSeek sirve ahora, mientras que el ID estable sigue siendo la cadena de la API oficial. Otro proveedor puede usar nombres distintos: BetterToken listaba el 13 de agosto deepseek-v4-flash-0731 y deepseek-v4-pro, pero no deepseek-v4-pro-0813. Abra el catálogo del endpoint elegido y copie el nombre allí; no añada 0813 automáticamente a la configuración.
Los números 0731 y 0813 reflejan la antigüedad del build servido, no un alias universal. Según la documentación y la ficha oficial, Flash tiene 284 mil millones de parámetros totales y 13 mil millones activos, contexto de un millón de tokens y salida máxima de 384K. Hay modos Thinking y Non-Thinking, con niveles High y Max para comparar razonamiento.
Un millón de tokens es un techo técnico, no una promesa de calidad idéntica para cualquier volumen de código. Pruebe si el modelo recupera información del centro del contexto y conserva las reglas del proyecto tras un historial largo de herramientas.
Coste de una ejecución de agente
Los precios oficiales de la API DeepSeek son 0.14 de entrada sin caché y 0.14 + 0.02 × 0.0336`. Si toda la entrada acierta en caché, serían $0.00616; es un caso teórico, porque un agente real modifica historial, resultados de herramientas y archivos, de modo que parte del prefijo deja de coincidir.
Con las tarifas del catálogo BetterToken, el mismo volumen sin contabilidad separada de caché cuesta 0.2 × $0.095 + 0.02 × $0.191 = $0.02282. Ese total no debe ocultar el consumo de razonamiento: un max_tokens grande puede gastar una parte sustancial del presupuesto antes de una respuesta útil. Para comparar coste, registre tokens por tarea terminada, no solo precio por millón.
Non-Think, High y Max
La ficha oficial compara tres modos:
- LiveCodeBench: 55.2 en Non-Think, 88.4 en High y 91.6 en Max.
- Terminal Bench 2.0: 49.1, 56.6 y 56.9.
- SWE Verified: 73.7, 78.6 y 79.0.
- SWE Pro: 49.1, 52.3 y 52.6.
- MRCR 1M: 37.5, 76.9 y 78.7.
Son resultados del proveedor o de la ficha del modelo, no un benchmark independiente de producción. Desactivar Thinking reduce mucho algunas pruebas de código y contexto largo; pasar de High a Max añade bastante menos que pasar de Non-Think a High.
- Non-Think: formato, extracción o una edición local obvia después de validarla con sus ejemplos.
- High: candidato principal para correcciones de bugs, revisión y varios archivos relacionados.
- Max: depuración difícil, plan de agente largo o tareas donde un error cuesta más que tokens adicionales.
No convierta Max en el valor predeterminado solo por tener el número mayor de la tabla.
Cargas donde Flash parece razonable
Flash es interesante cuando hay muchas solicitudes y cada paso se verifica automáticamente: un subagente localiza archivos y reúne hechos, CI explica un fallo de prueba concreto, una revisión por lotes comprueba una regla, un agente genera pruebas para una interfaz definida o una migración se divide en lotes cortos e idénticos.
Es menos evidente para arquitectura nueva sin restricciones claras, requisitos contradictorios o trabajo donde el modelo debe tomar decisiones de producto por sí solo durante horas. Los reintentos pueden borrar la ventaja de precio y Pro u otro modelo puede costar menos por resultado aceptado.
Conectar con Claude Code
DeepSeek ofrece un endpoint compatible con Anthropic. Su ejemplo oficial divide funciones: Pro es el agente principal y Flash sirve como Haiku y subagente.
La división es útil: el modelo más caro toma decisiones arquitectónicas y Flash resuelve subtareas acotadas. Si prueba Flash como agente principal, cree un perfil separado y compare el resultado; no lo presente como configuración oficial recomendada. Tras iniciar, compruebe la Base URL, el modelo real del subagente y una llamada a herramienta. Una respuesta de texto por sí sola no basta: los problemas de compatibilidad suelen aparecer con la primera herramienta.
Conectar con OpenCode
La guía oficial exige OpenCode 1.14.24 o posterior:
En la interfaz ejecute /connect, seleccione DeepSeek y pegue la clave en el diálogo. Después abra la lista de modelos. La guía muestra Pro; elija Flash solo si deepseek-v4-flash aparece realmente en el proveedor oficial. BetterToken usaba deepseek-v4-flash-0731 al verificarlo. No intercambie esos nombres sin comprobar el catálogo del endpoint concreto.
La prueba debe tener varios pasos: pida leer un archivo, llamar a una herramienta y continuar razonando tras el resultado. Ese segundo turno revela problemas de reasoning_content.
Por qué aparece el error reasoning_content
En modo Thinking, DeepSeek exige devolver reasoning_content en el historial de solicitudes posteriores. La issue #24130 de OpenCode describe un cliente que perdió ese campo y falló después de una herramienta; la corrección relacionada se discutió en la PR #24146. La guía actual de DeepSeek exige además OpenCode 1.14.24 o posterior. No infiera una versión arreglada solo a partir de una issue o una PR.
Si el error persiste:
- actualice OpenCode;
- confirme que usa el proveedor DeepSeek actual;
- no elimine campos de razonamiento al normalizar mensajes manualmente;
- repita una prueba de dos turnos con una herramienta;
- solo entonces revise ID del modelo y red.
Un JSON escrito a mano desde un comentario aleatorio puede ayudar temporalmente, pero el proveedor oficial es más seguro porque se actualiza junto al contrato del cliente.
De dónde sale el límite de 32K
La issue #29363 de OpenCode informó una configuración de cliente que limitaba la salida a 32K aunque el modelo documenta 384K. Son capas diferentes: el límite del modelo y el que la aplicación envía en la solicitud. No solicite 384K automáticamente; un techo alto aumenta coste y tiempo potenciales. Si una respuesta termina con length, compruebe el max_tokens efectivo, el adaptador del proveedor y el modo de razonamiento antes de concluir que Flash no puede producir respuestas largas.
Qué dicen los informes individuales
En una discusión práctica de programación, usuarios describieron auditorías de repositorio y migraciones cortas logradas, además de requisitos omitidos, planes que requirieron corrección y errores repetidos en una tarea pequeña. Esas historias no comparten prompt, commit, harness ni verificación independiente. Sirven como escenarios para su propia prueba de aceptación, no como medida media de rendimiento.
Una issue #1483 separada informa respuestas que cambian a chino en algunas solicitudes V4 Flash. Es un informe individual, no una tasa de defecto conocida. Añada comprobaciones explícitas del idioma de respuestas y comentarios, de reglas del proyecto y de recuperación tras una llamada de herramienta fallida.
Cómo probar sin engañarse
Compare Non-Think, High y Max en diez tareas idénticas. Congele el commit y no cambie el prompt entre modos. Mida la proporción que pasa las pruebas, el tiempo hasta un diff terminado, tokens de entrada, salida y razonamiento, reintentos, infracciones de reglas e idioma y coste por tarea aceptada.
Si High completa nueve de diez y Max las mismas nueve con el doble de consumo, Max no compensa. Si solo Max resuelve un bug difícil, su coste mayor se justifica para esa clase de tarea.
Fuentes
- Anuncio oficial de V4 Preview
- Precios y límites actuales de la API DeepSeek
- DeepSeek en agentes de programación
- DeepSeek V4 Flash: ficha oficial del modelo
- Issue OpenCode #24130: reasoning_content
- PR OpenCode #24146: corrección relacionada
- Issue OpenCode #29363: límite de salida
- Issue #1483: señal individual de cambio de idioma
- Informes de usuarios mixtos sobre programación