Claude no Cherry Studio pensa, mas não responde: como configurar o Max tokens
Analisamos a causa das respostas vazias do Claude no Cherry Studio quando o thinking está ativado: por que o modelo esgota o limite de tokens durante a fase de raciocínio e como configurar corretamente o Max tokens no nível do assistente.
Conteúdo

Em 15 de setembro, um usuário entrou em contato com o suporte da BetterToken relatando um problema no cliente Cherry Studio: em perguntas simples, o Claude respondia normalmente, mas em tarefas analíticas extensas o texto final não aparecia. O bloco de raciocínio (thinking) se expandia, os tokens eram consumidos e o aplicativo não exibia nenhuma mensagem de erro.
Alternar o streaming (Stream) não resolveu. Ao analisar os registros de requisições no console da BetterToken, surgiu um detalhe em comum: várias respostas longas em diferentes canais terminaram exatamente em 8192 tokens de saída.
Como o status de finalização (stop_reason) não foi registrado nos logs, não é possível confirmar com certeza o motivo do encerramento. No entanto, o valor recorrente de 8192 levou à hipótese de que o limite de saída foi atingido: é provável que o teto de tokens tenha se esgotado ainda na etapa de raciocínio, sem deixar margem para a resposta final.
Como o atendimento evoluiu
O teor das mensagens do usuário resumia-se ao seguinte:
Primeira mensagem do usuário (paráfrase): Em solicitações curtas, as respostas chegam normalmente. Em tarefas complexas, o modelo passa bastante tempo raciocinando, os tokens são consumidos, mas não há texto final — o campo de resposta permanece vazio.
Recomendamos ativar e aumentar o parâmetro Max tokens nas configurações desse assistente, respeitando os limites do provedor.
Segunda mensagem do usuário (paráfrase): Após alterar o limite nas configurações do assistente, o problema foi resolvido; o usuário também perguntou se é necessário configurar esse parâmetro separadamente para cada assistente.
No Cherry Studio, essa configuração é definida de forma individual para cada assistente.
Por que a resposta desaparece: o funcionamento do thinking
Nos modelos Claude compatíveis com raciocínio encadeado, o processo de reflexão faz parte do limite geral de geração.
De acordo com a documentação da Anthropic sobre direcionamento de pensamento e custos, o parâmetro max_tokens estabelece um teto rígido por requisição. Esse limite inclui tanto os tokens ocultos de raciocínio (thinking) quanto o texto visível da resposta. O parâmetro effort atua como uma diretriz flexível para a profundidade da análise, mas não amplia o limite total. Se o raciocínio consumir todo o volume disponível, a geração é interrompida. Quando a parada ocorre por limite excedido, a documentação recomenda diminuir o effort ou aumentar o max_tokens, desde que o modelo e a interface utilizada permitam esse valor.
Configuração passo a passo no Cherry Studio
Segundo a documentação do Cherry Studio sobre chat, as definições afetam todas as conversas do assistente selecionado. Altere o Max tokens no assistente com o qual você está trabalhando. A configuração é aplicada a ele e não modifica os parâmetros dos demais assistentes.
Antes de fazer a alteração, confirme o identificador exato do modelo e os limites do seu provedor de API para o tamanho máximo de saída.
Passo 1. Abra as configurações do assistente
No painel esquerdo com a lista de assistentes, localize o perfil desejado, clique no ícone de três pontos (ou clique com o botão direito) e selecione a opção «Edit Assistant».
Ilustração do caso real: abertura da janela de edição do assistente pelo item de menu Edit Assistant.
Passo 2. Ative e aumente o Max tokens
Acesse a aba «Model» e localize a opção «Max tokens».
- Ative a chave ao lado do parâmetro.
- Defina um novo valor superior ao limite anterior, respeitando as especificações do seu modelo no provedor.
Ilustração do caso real: parâmetro Max tokens ativado com o valor 128000 na aba Model.
No caso analisado, o usuário definiu o valor em 128000, e as respostas longas passaram a ser geradas normalmente. No entanto, considere alguns pontos práticos:
- O valor 128000 exibido na captura de tela foi a configuração usada nesse caso específico, não uma regra universal.
- Esse número define o teto do comprimento da mensagem de saída, e não a janela de contexto total (context window).
- Nem todo modelo suporta a geração de um volume tão grande de texto em uma única requisição.
- Um limite de tokens mais alto permite que o modelo elabore pensamentos mais longos, o que pode aumentar o tempo de espera pela resposta e o consumo de tokens.
Passo 3. Verifique os parâmetros personalizados
Role a aba «Model» para baixo até a seção «Custom parameters».
No Cherry Studio, os parâmetros personalizados têm prioridade sobre as opções da interface gráfica. Se o parâmetro max_tokens já estiver definido nessa lista com um valor antigo, remova-o ou atualize-o para o novo número; caso contrário, o cliente continuará enviando o limite anterior.
Como verificar o resultado
Não teste a configuração com frases curtas: perguntas simples cabem no limite padrão e não refletem o comportamento real.
- Crie um novo tópico no mesmo assistente para limpar o contexto da conversa interrompida.
- Envie uma tarefa analítica extensa, similar àquela em que ocorreu a interrupção.
- Observe os sinais de funcionamento correto:
- Abaixo do bloco de thinking surge o texto visível completo.
- O raciocínio é concluído de forma lógica, sem frases cortadas no meio.
- Se as estatísticas de tokens de saída (output tokens) estiverem visíveis, compare-as com o limite anterior e confira se a geração não parou novamente na marca de 8192. Uma resposta bem-sucedida não precisa necessariamente ultrapassar esse valor — ela pode terminar perfeitamente com menos tokens. Nunca compare o limite de saída com o consumo total da requisição.
E se a resposta ainda não aparecer?
O problema pode ter diferentes origens. Se você ajustou o parâmetro e a resposta ainda não for exibida:
- Verifique o assistente ativo. Certifique-se de que a mensagem foi enviada pelo assistente correto em que a chave foi ativada e de que o Max tokens permanece ligado.
- Confira o limite aceito pelo provedor. Se você informar um número maior do que o suportado pelo modelo no provedor, a requisição retornará um erro de validação de parâmetros.
- Analise a contagem de tokens de saída. No painel da BetterToken, confira os dados da requisição com atenção voltada aos tokens de saída (output tokens), e não ao total geral. Se a geração foi interrompida bem abaixo do limite configurado, vale checar a exibição do fluxo (Stream), a estabilidade da conexão ou a chamada de ferramentas externas (servidores MCP e functions), embora o impacto de
max_tokenstambém não deva ser totalmente descartado.
Ao entrar em contato com o suporte, compartilhe apenas informações técnicas seguras: identificador da requisição (Request ID), horário exato, nome do modelo e quantidade de tokens consumidos. Nunca envie chaves de API secretas nem o conteúdo confidencial das suas mensagens.