Qwen3.8-Max para programação: preço, benchmarks e configuração de ferramentas
Como avaliar o Qwen3.8-Max para programação: preço de API, benchmarks, configuração do Qwen Code e Claude Code e diferença entre Model ID hospedado e pesos abertos.
A versão estável do Qwen3.8-Max chegou em 3 de agosto de 2026 com o Model ID hospedado qwen3.8-max. Em 13 de agosto, a Qwen também publicou os pesos Qwen3.8-2.4T-A95B. São nomes para caminhos de implantação diferentes: o primeiro entra no campo de modelo de um provedor de API; o segundo identifica o repositório de pesos para inferência própria.
Quer testar o modelo hospedado sem operar infraestrutura de GPU própria? Em 13 de agosto, o catálogo BetterToken listava qwen3.8-max por 5.52 a cada milhão de tokens de saída. Crie sua própria API Key, faça uma solicitação curta e confira o Model ID e o consumo no Workspace. Esta é uma captura de preço datada; consulte o catálogo novamente antes de usar em produção.
O que mudou depois da preview
O repositório oficial da Qwen publicou os pesos e a configuração do modelo pós-treinado Qwen3.8-2.4T-A95B: 2,4 trilhões de parâmetros no total, 95 bilhões ativos, 262.144 tokens de contexto nativo e possibilidade de expansão para 1.010.000. O repositório é compatível com vLLM, SGLang e TokenSpeed.
O modelo hospedado qwen3.8-max se baseia nessas escalas, mas a Qwen descreve separadamente entradas vision, non-thinking, um conjunto oficial de tools e contexto padrão de um milhão de tokens. Portanto, não coloque Qwen3.8-2.4T-A95B na configuração de API no lugar de qwen3.8-max, nem trate a inferência local como idêntica à API hospedada.
A preview aparecia no Token Plan e em configurações iniciais como qwen3.8-max-preview. Havia restrições de thinking documentadas que não fazem parte do contrato estável. A migração prática é substituir o Model ID, conferir o tipo de chave e o endpoint e então repetir a consulta mínima. Trocar apenas a string do modelo sem conferir a região pode resultar em 401, 404 ou modelo ausente.
É possível rodar os pesos abertos localmente?
Formalmente, sim: o repositório contém pesos e configuração para inferência própria. Na prática, é um projeto de servidor, não um modelo para carregar na GPU de uma estação comum. No MoE, 95 bilhões de parâmetros ficam ativos a cada etapa, mas é preciso armazenar, distribuir e carregar muito mais dados; também entram KV cache, precisão, quantização e memória do motor de inferência.
Não dimensione hardware apenas pelo número de parâmetros ativos. Primeiro escolha o motor, a precisão, o tamanho de contexto e a velocidade aceitável, consulte o guia de hardware e faça uma estimativa de memória separada. Para um teste pontual de programação, uma API hospedada geralmente exige menos preparação. A opção local faz sentido quando a equipe consegue operar sharding, atualizações e monitoramento.
Os pesos usam uma Qwen3.8-Max License própria, e não Apache 2.0. Ela permite uso e modificação, mas inclui condições adicionais para grandes produtos comerciais, Model as a Service e AI Work Assistant. Leia a licença completa para seu cenário antes de qualquer implantação pública ou comercial.
Quanto custa o Qwen3.8-Max?
O Alibaba Model Studio publica preços por região. Calcule-os na moeda original; não apresente conversão como tarifa oficial.
- Beijing / Global: CNY 12 por milhão de tokens de entrada e CNY 36 por milhão de tokens de saída.
- Singapore: CNY 14.988 por milhão de tokens de entrada e CNY 44.965 por milhão de tokens de saída.
Para 200.000 tokens de entrada e 20.000 de saída, o cálculo de Beijing é:
0.2 × 12 + 0.02 × 36 = CNY 3.12.
Para Singapore, o mesmo volume custa CNY 3.8969. Este é um cálculo pay-as-you-go do Model Studio. Token Plan, assinatura e gateway de terceiros têm unidades de cobrança diferentes e não devem aparecer na mesma linha de comparação.
Com o cartão BetterToken, o mesmo perfil custava na captura datada:
0.2 × $1.84 + 0.02 × $5.52 = $0.4784.
Os totais não são diretamente comparáveis: uma tabela usa CNY e a outra USD, e as condições de cache e acesso também são diferentes. A conclusão útil é outra: primeiro escolha provedor e região específicos; depois calcule o mesmo perfil de tokens para cada um. Preço, disponibilidade de modelo e grupos de chave são fatos dinâmicos que precisam ser conferidos antes do uso.
Como ler a tabela oficial de benchmarks
O lançamento da Qwen apresenta estes resultados de programação:
- Terminal-Bench 2.1: 86.6.
- SWE-bench Pro: 67.7.
- DeepSWE 1.1: 56.6.
- FrontierSWE: 73.5.
- PaperBench: 93.0.
- QwenSWEBench: 80.7.
São dados relatados pelo fornecedor. Para Terminal-Bench 2.1, a Qwen informa Claude Code, avg@10, timeout de cinco horas e max_tokens=131072. Para SWE-bench Pro, informa Claude Code, temperature=1.0, top_p=0.95 e contexto 256K; a nota não declara timeout separado. Em várias linhas de concorrentes, foi usado o melhor resultado publicado por eles. Parte dos conjuntos pertence à Qwen e não tem reprodução externa.
Não é possível extrair desses números uma classificação única. Um 93.0 no PaperBench não significa que o modelo resolverá automaticamente melhor um issue no seu repositório real. Veja primeiro qual capacidade o teste mede; depois, harness, esforço, número de tentativas e método de avaliação.
O que mostrou um teste independente
A Trilogy AI comparou Qwen preview e Kimi K3 na mesma tarefa de análise arquitetural: repositório congelado com 269 arquivos, mesmo limite de tempo e mesmo tipo de resultado. O resultado StackPerf foi 80 contra 83 em favor do Kimi. Qwen fez 44 tool calls sem erro; Kimi fez 53 com duas falhas recuperadas.
Isso é uma fotografia útil do processo, mas apenas uma execução de uma tarefa. Mostra que uma diferença pequena de pontuação pode vir acompanhada de comportamento diferente de tools. Não prova que um modelo seja melhor em todos os cenários de programação.
Quando vale testar o Qwen3.8-Max
Inclua o modelo no teste quando a tarefa exigir:
- percorrer muitos arquivos e montar um retrato arquitetural;
- executar um plano de várias etapas com tools;
- trabalhar com texto, imagens ou documentos no mesmo contexto;
- preparar um diff e verificar diversas condições de prontidão;
- manter regras de negócio junto com código por muito tempo.
Para pequenas alterações, compare reasoning baixo e alto. Se o ganho de qualidade não compensar latência e tokens de saída, o modo pesado não deve ser o padrão.
Configurando o Qwen Code
Primeiro escolha uma região no console do Model Studio, abra a página API-KEY e crie uma chave pay-as-you-go normal para essa região. Uma chave Token Plan é criada em outra seção e não é intercambiável com endpoint pay-as-you-go. Copie a nova chave logo após criá-la e guarde-a em uma variável de ambiente:
O Qwen Code suporta modelProviders e provider OpenAI-compatible. Para configurar todos os projetos, abra ~/.qwen/settings.json; para um único repositório, use .qwen/settings.json na raiz. No JSON, informe o nome da variável, e não a chave:
O endpoint acima é o exemplo oficial da região US. Para Beijing, Singapore, Tokyo ou Frankfurt, use o endereço da tabela do Model Studio e a chave da mesma região. O arquivo do projeto sobrepõe o arquivo do usuário; se surgir um modelo inesperado, verifique os dois níveis.
A documentação do Qwen Code trata a configuração de provider como atômica: generationConfig aninhado e outros campos são substituídos por inteiro, não mesclados chave a chave. Salve os registros de provider existentes e confira o diff antes de mudar algo, para não apagar uma configuração funcional de outro modelo.
Salve o arquivo, reinicie o Qwen Code, selecione qwen3.8-max, envie uma solicitação de leitura de um arquivo e confira o nome do modelo na resposta ou nos metadados. Só então permita alterações.
Configurando o Claude Code
O Model Studio fornece um endpoint Anthropic-compatible. Para a região US, o exemplo mínimo é:
Para outra região, substitua Base URL pelo endereço regional oficial e use a chave correspondente. Após reiniciar, dê uma tarefa curta sem alterar arquivos e confira o Model ID realmente usado. Não misture chave Token Plan com endpoint pay-as-you-go.
Anthropic-compatible significa compatibilidade de protocolo. Qwen não se torna um modelo Anthropic, nem passa a ter comportamento idêntico no Claude Code. É preciso verificar tool call, escrita de arquivos, recuperação de erros e usage no cliente em questão.
Como classificar erros já documentados
O issue Qwen Code #7332 se refere à preview: uma solicitação interna enviava enable_thinking=false a um modelo que, naquele momento, aceitava apenas thinking e recebia 400. É um sinal útil para migração, mas não descreve a API estável atual.
No issue Qwen3 #1883, um usuário do endpoint Anthropic-compatible relatou que o agente tentava escrever um caminho relativo diretamente em /tmp; usar caminho absoluto era o contorno. No issue Qwen Code #7489, o VS Code Companion inseria um link para o nome da imagem, mas não transferia a imagem. Ambos os casos dependem da versão do cliente e do harness.
Separe quatro camadas ao investigar esses problemas:
- A API aceita o Model ID e a chave.
- O cliente transmite thinking e tools corretamente.
- O harness resolve caminho e anexo corretamente.
- O modelo segue a instrução.
Chamar tudo imediatamente de “erro do modelo” torna a correção da configuração mais difícil.
Testando o modelo na sua própria tarefa
Use três repositórios ou três issues de tipos diferentes. Congele commit, tools, limite de tempo e critérios PASS. Para cada execução, registre:
- modo de reasoning;
- tokens de entrada e saída;
- tempo até a primeira alteração útil;
- número de tool calls e erros;
- resultado dos testes;
- número de correções manuais.
Esse teste é mais útil que um leaderboard geral. Ele mostra não apenas a capacidade de escrever código, mas o preço de uma tarefa concluída: é isso que a equipe paga.
Fontes
- Lançamento oficial do Qwen3.8-Max
- Pesos abertos Qwen3.8-2.4T-A95B
- Qwen3.8-Max License
- Modelos e endpoints regionais do Model Studio
- Preços oficiais do Model Studio
- Model Studio: criar API Key
- Qwen Code: local de settings.json
- Qwen Code: model providers
- Issue #7332: preview e enable_thinking
- Issue #1883: caminhos relativos
- Issue #7489: imagem no VS Code Companion
- Execução StackPerf independente