Claude réfléchit sans répondre dans Cherry Studio : comment régler Max tokens
Analyse de la cause des réponses vides de Claude dans Cherry Studio lorsque le mode thinking est activé : pourquoi le modèle épuise sa limite de tokens lors de la phase de réflexion et comment configurer correctement Max tokens au niveau de l'assistant.
Sommaire

Le 15 septembre, un utilisateur a contacté le support client de BetterToken à propos d’un problème survenu dans le client Cherry Studio : Claude répondait normalement aux questions simples, mais lors de tâches analytiques volumineuses, aucun texte final n’apparaissait. Le bloc de réflexion (thinking) se déroulait, les tokens étaient bien débités et l’application n’affichait aucun message d’erreur.
Basculer le mode de diffusion en continu (Stream) n’a rien changé. Dans les journaux de requêtes de la console BetterToken, un détail récurrent est apparu : plusieurs réponses longues passant par différents canaux s’étaient arrêtées exactement à 8192 tokens de sortie (output tokens).
Le statut d’interruption (stop_reason) n’ayant pas été conservé dans les journaux, il est impossible de confirmer avec certitude la cause de l’arrêt. Néanmoins, la répétition de cette valeur 8192 laissait supposer qu’un plafond de sortie s’était déclenché : il est probable que la limite de tokens ait été totalement consommée dès la phase de réflexion, ne laissant plus aucun token pour la réponse finale elle-même.
Déroulement de l’échange avec le support
Voici en substance les messages de l’utilisateur :
Premier message de l’utilisateur (paraphrase) : Pour les requêtes courtes, les réponses arrivent normalement. Pour les tâches complexes, le modèle réfléchit longuement, les tokens sont débités, mais le texte final n’apparaît pas — le champ de réponse reste vide.
Nous lui avons conseillé d’activer et d’augmenter le paramètre Max tokens dans les paramètres de cet assistant, tout en restant dans les limites autorisées par le fournisseur.
Second message de l’utilisateur (paraphrase) : Après avoir modifié la limite dans les paramètres de l’assistant, le problème a été résolu ; l’utilisateur a également demandé s’il fallait ajuster ce paramètre séparément pour chaque assistant.
Dans Cherry Studio, cette configuration se règle en effet individuellement pour chaque assistant.
Pourquoi la réponse disparaît : le mécanisme du thinking
Sur les modèles Claude prenant en charge la chaîne de réflexion, le processus de pensée est inclus dans la limite globale de génération.
Selon la documentation d’Anthropic sur le contrôle de la réflexion et des coûts, le paramètre max_tokens fixe un plafond strict pour l’ensemble d’une requête. Cette limite englobe à la fois les tokens invisibles de réflexion (thinking) et le texte visible de la réponse. Le paramètre effort sert d’orientation indicative pour la profondeur d’analyse, mais n’augmente en rien le plafond global. Si la réflexion consomme la totalité du volume alloué, la génération s’interrompt. En cas d’arrêt dû à la limite, la documentation préconise soit de réduire l’effort, soit d’augmenter max_tokens, à condition que le modèle et l’interface utilisée acceptent une valeur supérieure.
Configuration étape par étape dans Cherry Studio
D’après la documentation de Cherry Studio sur le chat, les paramètres s’appliquent à l’ensemble des conversations de l’assistant sélectionné. Modifiez Max tokens pour l’assistant que vous utilisez. Le réglage lui est propre et ne modifie pas les paramètres des autres assistants.
Avant toute modification, vérifiez l’identifiant exact du modèle ainsi que les limites de votre fournisseur d’API concernant la taille maximale de sortie.
Étape 1. Ouvrez les paramètres de l’assistant
Dans le panneau latéral gauche listant les assistants, repérez le profil concerné, cliquez sur l’icône à trois points (ou faites un clic droit) et sélectionnez l’option « Edit Assistant » (Modifier l’assistant).
Illustration issue du cas client : ouverture de la fenêtre de modification de l’assistant via l’option Edit Assistant.
Étape 2. Activez et augmentez Max tokens
Rendez-vous dans l’onglet « Model » (Modèle) et localisez l’option « Max tokens » (Limite de longueur du message).
- Activez le bouton bascule situé à côté du paramètre.
- Indiquez une nouvelle valeur supérieure à la limite précédente, sans dépasser les spécifications du modèle chez votre fournisseur.
Illustration issue du cas client : paramètre Max tokens activé avec la valeur 128000 dans l’onglet Model.
Dans le cas présent, l’utilisateur a défini une valeur de 128000, ce qui a permis aux réponses longues de s’afficher normalement. Gardez toutefois à l’esprit ces nuances pratiques :
- La valeur de 128000 visible sur la capture d’écran correspond à la configuration adoptée pour cet incident particulier, et non à une règle universelle.
- Ce nombre définit le plafond de longueur du message de sortie, et non la fenêtre de contexte totale (context window).
- Tous les modèles ne prennent pas en charge la génération d’un tel volume de texte en une seule fois.
- Une limite de tokens plus élevée permet au modèle de réfléchir plus longtemps, ce qui peut augmenter le temps d’attente avant la réponse ainsi que la consommation de tokens.
Étape 3. Vérifiez les paramètres personnalisés
Faites défiler l’onglet « Model » vers le bas jusqu’à la section « Custom parameters » (Paramètres personnalisés).
Dans Cherry Studio, les paramètres personnalisés prévalent sur les boutons bascules de l’interface. Si le paramètre max_tokens figure déjà dans cette liste avec une ancienne valeur, supprimez-le ou ajustez-le avec le nouveau chiffre ; sinon, le client continuera d’envoyer l’ancienne limite.
Comment vérifier le résultat
Ne testez pas cette modification avec des phrases courtes : les requêtes simples restent dans les limites standards et ne révèlent pas la réalité du comportement.
- Créez un nouveau fil de discussion avec ce même assistant afin de réinitialiser le contexte de la conversation interrompue.
- Envoyez une tâche analytique complexe, similaire à celle ayant rencontré l’interruption.
- Vérifiez les signes d’un fonctionnement normal :
- Un texte visible complet apparaît sous le bloc thinking.
- La réflexion est logiquement achevée et aucune phrase n’est coupée en plein milieu.
- Si les statistiques des tokens de sortie (output tokens) sont accessibles, comparez-les avec l’ancien seuil et assurez-vous que la génération ne s’est pas arrêtée de nouveau pile à 8192. Cela dit, une réponse réussie n’a pas nécessairement besoin de dépasser ce seuil : elle peut très bien se conclure correctement avec moins de tokens. Veillez à ne pas comparer la consommation totale de la requête avec la limite de sortie.
Si la réponse n’apparaît toujours pas
Le problème peut avoir plusieurs origines. Si vous avez modifié le paramètre mais que la réponse n’apparaît toujours pas :
- Vérifiez l’assistant actif. Assurez-vous que la requête est bien envoyée depuis l’assistant pour lequel l’option a été activée et que le bouton bascule Max tokens est toujours enclenché.
- Vérifiez le plafond accepté par le fournisseur. Si vous indiquez une valeur supérieure à ce que le modèle supporte auprès du fournisseur, la requête échouera avec une erreur de validation des paramètres.
- Vérifiez le nombre de tokens de sortie. Dans la console BetterToken, comparez les données de la requête en prêtant attention spécifiquement aux tokens de sortie (output tokens), et non au total global. Si la génération s’est arrêtée nettement en dessous de la limite définie, vérifiez l’affichage du flux (Stream), la stabilité de la connexion réseau ou d’éventuels appels à des outils externes (serveurs MCP et fonctions), sans pour autant écarter l’impact potentiel de
max_tokens.
Lorsque vous contactez le support technique, ne transmettez que des informations techniques sécurisées : identifiant de requête (Request ID), horodatage précis, nom du modèle et nombre de tokens débités. Ne communiquez jamais vos clés d’API secrètes ni le contenu confidentiel de vos requêtes.