Claude piensa pero no responde en Cherry Studio: cómo configurar Max tokens
Analizamos la causa de las respuestas vacías de Claude en Cherry Studio con la función thinking activada: por qué el modelo agota el límite de tokens durante el razonamiento y cómo configurar correctamente Max tokens en cada asistente.
Índice

El 15 de septiembre, un usuario acudió al soporte técnico de BetterToken con una incidencia en el cliente Cherry Studio: en preguntas sencillas, Claude respondía con total normalidad, pero en tareas analíticas complejas o extensas no aparecía el texto final. El bloque de razonamiento (thinking) se desplegaba, los tokens se consumían y la aplicación no arrojaba ningún error.
Alternar la transmisión en tiempo real (Stream) no solucionó el problema. Al revisar el registro de peticiones en la consola de BetterToken, se identificó un patrón común: varias respuestas largas en distintos canales terminaban exactamente en 8192 tokens de salida.
Dado que el estado de detención (stop_reason) no quedó registrado en los registros de depuración, no es posible confirmar con certeza absoluta el motivo del corte. Sin embargo, la repetición constante del valor 8192 sugirió la activación de un límite en el volumen de salida: es muy probable que el cupo de tokens se agotara durante la propia fase de razonamiento, dejando al modelo sin margen para generar la respuesta final.
Cómo se desarrolló la consulta de soporte
La esencia de los mensajes del usuario se resumía en lo siguiente:
Primer mensaje del usuario (paráfrasis): En consultas breves las respuestas llegan con normalidad. Ante tareas complejas, el modelo razona durante un buen rato y los tokens se consumen, pero no aparece el texto final: el campo de respuesta se queda en blanco.
Recomendamos activar e incrementar el parámetro Max tokens dentro de las propiedades de dicho asistente, siempre dentro de los límites admitidos por el proveedor de la API.
Segundo mensaje del usuario (paráfrasis): Tras modificar el límite en las propiedades del asistente, el problema se resolvió; el usuario también consultó si era necesario configurar este parámetro de forma independiente para cada asistente.
En Cherry Studio, esta configuración se ajusta de manera individual para cada asistente.
Por qué desaparece la respuesta: mecánica de thinking
En los modelos Claude compatibles con cadenas de razonamiento, el proceso de pensamiento computacional forma parte del límite general de generación.
De acuerdo con la documentación de Anthropic sobre control de razonamiento y costes, el parámetro max_tokens define un tope estricto y total por cada solicitud. Dentro de este límite se incluyen tanto los tokens ocultos de razonamiento (thinking) como el texto visible de la respuesta. El parámetro effort actúa como una guía orientativa sobre la profundidad del análisis, pero no amplía el límite total. Si el razonamiento consume todo el cupo disponible, la generación se interrumpe. En caso de detención por límite de tokens, la documentación oficial recomienda reducir el parámetro effort o aumentar max_tokens, siempre que el modelo y la interfaz empleada admitan dicho valor.
Configuración paso a paso en Cherry Studio
Según la documentación de Cherry Studio sobre el chat, los ajustes se aplican a todas las conversaciones del asistente seleccionado. Modifica Max tokens en el asistente con el que estés trabajando; el cambio afectará a dicho perfil sin alterar la configuración de los demás.
Antes de realizar cambios, verifica el identificador exacto del modelo y los límites de salida máxima que impone tu proveedor de API.
Paso 1. Abre la configuración del asistente
En el panel lateral izquierdo con la lista de asistentes, localiza el perfil correspondiente, haz clic en el icono de tres puntos (o pulsa con el botón derecho) y selecciona la opción «Edit Assistant» («Editar asistente»).
Ilustración del caso analizado: apertura de la ventana de edición del asistente mediante la opción Edit Assistant.
Paso 2. Activa e incrementa Max tokens
Accede a la pestaña «Model» («Modelo») y busca la opción «Max tokens» («Límite de tokens»).
- Activa el interruptor situado junto al parámetro.
- Introduce un valor superior al límite previo, asegurándote de que no sobrepase las especificaciones de tu modelo en el proveedor de API.
Ilustración del caso analizado: parámetro Max tokens activado con el valor 128000 en la pestaña Model.
En el caso expuesto, el usuario configuró el valor en 128000, tras lo cual las respuestas extensas comenzaron a generarse con total normalidad. Sin embargo, conviene tener presentes varias precisiones técnicas:
- El valor de 128000 que figura en la captura corresponde a la configuración de este incidente puntual y no constituye una regla universal ni una recomendación general.
- Dicha cifra establece el tope de longitud del mensaje de salida generado, no la ventana de contexto global (context window).
- No todos los modelos admiten la generación de semejante volumen de texto en una sola petición.
- Un límite de tokens más holgado permite que el modelo razone durante más tiempo, lo que puede prolongar los tiempos de espera e incrementar el consumo de tokens.
Paso 3. Comprueba los parámetros personalizados
Desplázate hacia abajo en la pestaña «Model» hasta la sección «Custom parameters» («Parámetros personalizados»).
En Cherry Studio, los parámetros personalizados prevalecen sobre los controles e interruptores de la interfaz gráfica. Si en este listado ya existe un parámetro max_tokens con un valor antiguo, elimínalo o actualízalo a la nueva cifra; de lo contrario, el cliente seguirá enviando el límite anterior.
Cómo verificar el resultado
Evita probar el ajuste con frases cortas: las preguntas sencillas caben holgadamente dentro del límite básico y no reflejan el comportamiento real del sistema.
- Inicia un nuevo tema dentro del mismo asistente para limpiar el contexto de la conversación interrumpida.
- Envía una tarea analítica compleja o extensa, similar a aquella en la que se produjo el corte.
- Comprueba los indicios de un funcionamiento correcto:
- Debajo del bloque thinking aparece el texto visible completo.
- La respuesta concluye de forma lógica y la frase no queda cortada a mitad de redacción.
- Si tienes acceso a las estadísticas de tokens de salida (output tokens), compáralas con el umbral previo y confirma que la generación no se ha detenido de nuevo en la cota de 8192. Con todo, una respuesta exitosa no tiene por qué superar dicho límite: puede completarse correctamente con una cantidad menor de tokens. Nunca confundas ni compares con el límite de salida el consumo total acumulado de la petición.
Qué hacer si la respuesta sigue sin aparecer
Una incidencia de este tipo puede obedecer a distintos factores. Si has modificado la configuración y el texto final continúa sin mostrarse:
- Comprueba el asistente activo. Asegúrate de enviar la consulta desde el asistente exacto donde activaste la opción y verifica que el interruptor de Max tokens continúe habilitado.
- Verifica el límite admitido por el proveedor. Si indicas una cifra superior a la que admite el modelo en el proveedor del servicio, la petición fallará por error de validación de parámetros.
- Revisa la cantidad de tokens de salida. En el panel de control de BetterToken, examina los registros de la solicitud y fíjate específicamente en los tokens de salida (output tokens), no en el cómputo total de la llamada. Si la generación se detuvo en un valor considerablemente inferior al límite establecido, conviene revisar el flujo en tiempo real (Stream), la estabilidad de la conexión o las llamadas a herramientas externas (servidores MCP y funciones), sin descartar por completo la incidencia de
max_tokens.
Al ponerte en contacto con el servicio de soporte, facilita únicamente datos técnicos seguros: el identificador de la petición (Request ID), la hora exacta, el nombre del modelo y el número de tokens consumidos. No compartas jamás claves de API secretas ni contenido confidencial de tus consultas.