Qwen3.8-Max para programación: precio, benchmarks y configuración de herramientas

Cómo evaluar Qwen3.8-Max para programación: precio API, benchmarks, configuración de Qwen Code y Claude Code, y diferencia entre Model ID alojado y pesos abiertos.

La versión estable de Qwen3.8-Max llegó el 3 de agosto de 2026 con el Model ID alojado qwen3.8-max. El 13 de agosto, Qwen también publicó los pesos Qwen3.8-2.4T-A95B. Son nombres para rutas de despliegue diferentes: el primero se usa en el campo de modelo de un proveedor API; el segundo apunta al repositorio de pesos para inferencia propia.

¿Quieres probar el modelo alojado sin operar infraestructura GPU propia? El 13 de agosto, el catálogo de BetterToken mostraba qwen3.8-max a 1.84pormilloˊndetokensdeentraday1.84 por millón de tokens de entrada y 5.52 por millón de tokens de salida. Crea tu propia API Key, ejecuta una solicitud corta y comprueba el Model ID y el uso en Workspace. Es una captura de precio fechada: consulta el catálogo de nuevo antes de usarlo en producción.

Qué cambió después de la preview

El repositorio oficial de Qwen publica los pesos y la configuración del modelo postentrenado Qwen3.8-2.4T-A95B: 2,4 billones de parámetros totales, 95 mil millones activos, 262.144 tokens de contexto nativo y posibilidad de ampliarlo a 1.010.000. El repositorio es compatible con vLLM, SGLang y TokenSpeed.

El modelo alojado qwen3.8-max se basa en esas escalas, pero Qwen describe por separado entradas vision, non-thinking, un conjunto oficial de tools y un contexto predeterminado de un millón de tokens. Por eso no debes poner Qwen3.8-2.4T-A95B en la configuración API en lugar de qwen3.8-max, ni asumir que la inferencia local es idéntica a la API alojada.

ElecciónNombreDónde indicarloQué obtienes
API alojadaqwen3.8-maxCampo Model ID del directorio del proveedor APIInferencia gestionada y capacidades alojadas adicionales
Inferencia propiaQwen3.8-2.4T-A95BRepositorio y configuración del motor de inferenciaPesos bajo Qwen3.8-Max License y control de la infraestructura
Preview anteriorqwen3.8-max-previewNo usar para una configuración estable nuevaVariante API histórica con otro contrato

La preview aparecía en Token Plan y configuraciones tempranas como qwen3.8-max-preview. Se documentaron restricciones de thinking que no forman parte del contrato estable. La migración práctica es sustituir el Model ID, comprobar tipo de clave y endpoint, y volver a ejecutar la consulta mínima. Cambiar solo la cadena del modelo sin comprobar la región puede terminar en 401, 404 o en un modelo ausente.

¿Se pueden ejecutar los pesos abiertos localmente?

Sí, en sentido formal: el repositorio contiene pesos y configuración para inferencia propia. En la práctica es un proyecto de servidor, no un modelo para cargar en la GPU de una estación de trabajo común. En MoE se activan 95 mil millones de parámetros en cada paso, pero hay que almacenar, distribuir y cargar muchos más datos; se suman KV cache, precisión, cuantización y memoria del motor de inferencia.

No dimensionas el hardware solo por los parámetros activos. Elige primero motor, precisión, longitud de contexto y velocidad aceptable, consulta su guía de hardware y haz una estimación de memoria aparte. Para una prueba de programación puntual, la API alojada suele requerir menos preparación. La opción local tiene sentido cuando el equipo puede mantener sharding, actualizaciones y monitorización.

Los pesos usan una Qwen3.8-Max License independiente, no Apache 2.0. Permite uso y modificación, pero añade condiciones para productos comerciales grandes, Model as a Service y AI Work Assistant. Revisa la licencia completa para tu escenario antes de un despliegue público o comercial.

Cuánto cuesta Qwen3.8-Max

Alibaba Model Studio publica precios por región. Deben calcularse en la moneda original, sin presentar una conversión como tarifa oficial.

  • Beijing / Global: CNY 12 por millón de tokens de entrada y CNY 36 por millón de tokens de salida.
  • Singapore: CNY 14.988 por millón de tokens de entrada y CNY 44.965 por millón de tokens de salida.

Para 200.000 tokens de entrada y 20.000 de salida, el cálculo de Beijing es:

0.2 × 12 + 0.02 × 36 = CNY 3.12.

Para Singapore, el mismo volumen es CNY 3.8969. Es un cálculo pay-as-you-go de Model Studio. Token Plan, suscripción y gateway de terceros tienen unidades de facturación distintas y no deben aparecer en la misma fila de comparación.

Con la tarjeta BetterToken, el mismo perfil costaba en la captura fechada:

0.2 × $1.84 + 0.02 × $5.52 = $0.4784.

No puedes comparar directamente los importes finales: una tabla está en CNY y otra en USD, y además cambian condiciones de cache y acceso. La conclusión útil es otra: primero elige proveedor y región concretos; luego calcula para cada uno el mismo perfil de tokens. Precio, disponibilidad de modelo y grupos de claves son hechos dinámicos que hay que volver a verificar antes del uso.

Cómo leer la tabla oficial de benchmarks

El lanzamiento de Qwen presenta estos resultados de programación:

  • Terminal-Bench 2.1: 86.6.
  • SWE-bench Pro: 67.7.
  • DeepSWE 1.1: 56.6.
  • FrontierSWE: 73.5.
  • PaperBench: 93.0.
  • QwenSWEBench: 80.7.

Son datos comunicados por el proveedor. Para Terminal-Bench 2.1, Qwen indica Claude Code, avg@10, timeout de cinco horas y max_tokens=131072. Para SWE-bench Pro indica Claude Code, temperature=1.0, top_p=0.95 y contexto 256K; esa nota no declara un timeout separado. En varias filas de competidores se usó su mejor resultado publicado. Parte de los conjuntos pertenece a Qwen y no tiene reproducción externa.

No puede derivarse una clasificación única de esos números. Un 93.0 en PaperBench no significa que el modelo resuelva automáticamente mejor un issue en tu repositorio real. Mira primero qué capacidad mide la prueba, y después el harness, el esfuerzo, el número de intentos y el método de evaluación.

Qué mostró una prueba independiente

Trilogy AI comparó Qwen preview y Kimi K3 en la misma tarea de análisis arquitectónico: repositorio congelado de 269 archivos, el mismo límite de tiempo y el mismo tipo de resultado. El resultado StackPerf fue 80 frente a 83 a favor de Kimi. Qwen hizo 44 tool calls sin error y Kimi 53 con dos errores recuperados.

Es una fotografía útil del proceso, pero solo una ejecución de una tarea. Muestra que una diferencia pequeña de puntuación puede coincidir con comportamiento distinto de tools. No demuestra que un modelo sea mejor en todos los escenarios de programación.

Cuándo conviene probar Qwen3.8-Max

Incluye el modelo en la prueba si la tarea requiere:

  • recorrer muchos archivos y formar una visión arquitectónica;
  • ejecutar un plan de varios pasos con tools;
  • trabajar con texto, imágenes o documentos en un mismo contexto;
  • preparar un diff y comprobar varias condiciones de preparación;
  • mantener reglas de negocio junto con el código durante mucho tiempo.

Para cambios pequeños, compara reasoning bajo y más alto. Si la mejora de calidad no compensa latencia y tokens de salida, el modo pesado no debe ser el valor predeterminado.

Configurar Qwen Code

Primero elige una región en la consola Model Studio, abre la página API-KEY y crea una clave pay-as-you-go normal para esa región. Una clave Token Plan se crea en otra sección y no es intercambiable con un endpoint pay-as-you-go. Copia la clave nueva inmediatamente y guárdala como variable de entorno:

export DASHSCOPE_API_KEY="YOUR_API_KEY"

Qwen Code admite modelProviders y un provider OpenAI-compatible. Para configurar todos los proyectos, abre ~/.qwen/settings.json; para un único repositorio usa .qwen/settings.json en su raíz. En el JSON indica el nombre de la variable, no la clave:

{ "modelProviders": { "openai": [ { "id": "qwen3.8-max", "name": "Qwen3.8-Max", "baseUrl": "https://dashscope-us.aliyuncs.com/compatible-mode/v1", "envKey": "DASHSCOPE_API_KEY" } ] } }

El endpoint anterior es el ejemplo oficial de la región US. Para Beijing, Singapore, Tokyo o Frankfurt, toma la dirección de la tabla de Model Studio y utiliza la clave de esa misma región. El archivo de proyecto sobrescribe el archivo de usuario; si aparece un modelo inesperado, revisa ambos niveles.

La documentación de Qwen Code trata la configuración del provider como atómica: generationConfig anidada y otros campos se reemplazan enteros, no se fusionan clave a clave. Guarda los registros existentes de provider y revisa el diff antes de cambiar nada, para no borrar el ajuste funcional de otro modelo.

Guarda el archivo, reinicia Qwen Code, selecciona qwen3.8-max, envía una petición de lectura de un archivo y comprueba el nombre de modelo en la respuesta o los metadatos. Solo después permite cambios.

Configurar Claude Code

Model Studio ofrece un endpoint Anthropic-compatible. Para la región US, el ejemplo mínimo es:

export ANTHROPIC_BASE_URL="https://dashscope-us.aliyuncs.com/apps/anthropic" export ANTHROPIC_AUTH_TOKEN="YOUR_API_KEY" export ANTHROPIC_MODEL="qwen3.8-max"

Para otra región, sustituye Base URL por la dirección regional oficial y usa la clave correspondiente. Tras reiniciar, asigna una tarea corta sin cambiar archivos y comprueba el Model ID real. No mezcles una clave Token Plan con un endpoint pay-as-you-go.

Anthropic-compatible significa compatibilidad de protocolo. Qwen no se convierte en un modelo Anthropic ni su comportamiento pasa a ser idéntico en Claude Code. Debes comprobar tool call, escritura de archivos, recuperación de errores y usage en el cliente concreto.

Cómo clasificar errores ya documentados

El issue Qwen Code #7332 se refiere a la preview: una petición interna envió enable_thinking=false a un modelo que entonces solo aceptaba thinking y recibió 400. Es una señal útil para la migración, pero no describe la API estable actual.

En el issue Qwen3 #1883, un usuario del endpoint Anthropic-compatible comunicó que el agente intentaba escribir una ruta relativa directamente en /tmp; una ruta absoluta funcionaba como solución temporal. En el issue Qwen Code #7489, VS Code Companion insertaba un enlace al nombre de una imagen, pero no transfería la imagen. Ambos casos dependen de versión de cliente y harness.

Separa cuatro capas al analizar estos problemas:

  1. La API acepta Model ID y clave.
  2. El cliente transmite correctamente thinking y tools.
  3. El harness resuelve correctamente ruta y adjunto.
  4. El modelo sigue la instrucción.

Llamar de inmediato a todo «error del modelo» hace más difícil corregir la configuración.

Probar el modelo con tu propia tarea

Toma tres repositorios o tres issues de tipos distintos. Congela commit, tools, límite de tiempo y criterios PASS. En cada ejecución guarda:

  • modo de reasoning;
  • tokens de entrada y salida;
  • tiempo hasta el primer cambio útil;
  • número de tool calls y errores;
  • resultado de pruebas;
  • número de correcciones manuales.

Esta prueba es más útil que un leaderboard general. Mide no solo la capacidad de escribir código, sino el precio de una tarea terminada: eso es lo que paga el equipo.

¿Quieres optimizar tu flujo de trabajo con LLM?

Conecta modelos mediante una API, gestiona claves y controla el gasto en IA.