Бонусы за приглашения

Как работают бонусы за приглашения

Поделитесь ссылкой. Когда друг зарегистрируется по ней и пополнит баланс, вы получите указанный бонус за его последующие пополнения.

Claude в Cherry Studio думает, но не выводит ответ: как настроить Max tokens

Разбираем причину пустых ответов Claude в Cherry Studio при включенном thinking: почему модель исчерпывает лимит токенов на этапе рассуждений и как правильно настроить Max tokens на уровне ассистента.

Содержание
Claude в Cherry Studio думает, но не выводит ответ: как настроить Max tokens

15 сентября в службу поддержки BetterToken обратился пользователь с проблемой в клиенте Cherry Studio: на простых вопросах Claude отвечал штатно, но на объемных аналитических задачах итоговый текст не появлялся. Блок рассуждений (thinking) раскрывался, токены списывались, а приложение не выдавало ошибок.

Переключение потоковой передачи (Stream) не помогло. В записях запросов в консоли BetterToken обнаружилась общая деталь: несколько длинных ответов через разные каналы завершились ровно на 8192 выходных токенах.

Поскольку статус остановки (stop_reason) в логах не сохранился, однозначно подтвердить причину завершения нельзя. Однако повторяющееся значение 8192 позволило предположить, что сработало ограничение на объем вывода: возможно, лимит токенов исчерпался еще на этапе рассуждений, и на сам ответ их уже не хватило.

Как развивалось обращение

Суть сообщений пользователя сводилась к следующему:

Первое сообщение пользователя (пересказ): На коротких запросах ответы приходят штатно. При сложных задачах модель долго рассуждает, токены списываются, но итогового текста нет — поле ответа остается пустым.

Мы порекомендовали включить и увеличить параметр Max tokens в свойствах этого ассистента в пределах лимитов провайдера.

Повторное сообщение пользователя (пересказ): После изменения лимита в свойствах ассистента проблема решилась; пользователь также уточнил, нужно ли настраивать этот параметр отдельно для каждого ассистента.

В Cherry Studio эта конфигурация настраивается для каждого ассистента индивидуально.

Почему исчезает ответ: механика thinking

В моделях Claude с поддержкой цепочки рассуждений процесс мышления входит в общий лимит генерации.

Согласно документации Anthropic по управлению мышлением и расходами, параметр max_tokens задает жесткий суммарный потолок на один запрос. В этот лимит входят и скрытые токены рассуждений (thinking), и видимый текст ответа. Параметр effort служит мягким ориентиром для глубины анализа, но он не расширяет общий лимит. Если рассуждения заняли весь доступный объем, генерация прерывается. При остановке по лимиту документация рекомендует либо снизить effort, либо увеличить max_tokens, если модель и используемый интерфейс поддерживают такое значение.

Пошаговая настройка в Cherry Studio

Согласно документации Cherry Studio по чату, настройки действуют на все диалоги выбранного ассистента. Измените Max tokens у того ассистента, с которым вы работаете. Настройка применяется к нему и не меняет параметры других ассистентов.

Перед изменением проверьте точный идентификатор модели и ограничения вашего поставщика API на максимальный размер вывода.

Шаг 1. Откройте параметры ассистента

В левой панели со списком ассистентов найдите нужный профиль, нажмите на значок с тремя точками (или кликните правой кнопкой мыши) и выберите пункт «Edit Assistant» («Редактировать ассистента»).

Контекстное меню ассистента в Cherry Studio: кнопка с тремя точками и пункт Edit Assistant Иллюстрация из материалов кейса: открытие окна редактирования ассистента через пункт меню Edit Assistant.

Шаг 2. Включите и увеличьте Max tokens

Перейдите на вкладку «Model» («Модель») и найдите пункт «Max tokens» («Ограничение длины сообщения»).

  1. Включите тумблер рядом с параметром.
  2. Укажите новое значение, превышающее прежний лимит, но не выходящее за рамки спецификаций вашей модели у провайдера.

Вкладка Model в Cherry Studio с включенным переключателем Max tokens и значением 128000 Иллюстрация из материалов кейса: включенный параметр Max tokens со значением 128000 на вкладке Model.

В рассмотренном случае пользователь установил значение 128000, после чего длинные ответы начали формироваться штатно. Однако учитывайте практические нюансы:

  • Значение 128000 из скриншота — это настройка конкретного инцидента, а не универсальное правило.
  • Это число задает предел длины выходного сообщения, а не общее контекстное окно (context window).
  • Не каждая модель поддерживает генерацию такого объема текста за один раз.
  • Более высокий лимит токенов позволяет модели размышлять дольше, что может увеличить время ожидания ответа и списание токенов.

Шаг 3. Проверьте пользовательские параметры

Прокрутите вкладку «Model» вниз до раздела «Custom parameters» («Пользовательские параметры»).

В Cherry Studio пользовательские параметры имеют приоритет над переключателями интерфейса. Если в этом списке уже задан параметр max_tokens со старым значением, удалите его или измените на новое число, иначе клиент продолжит отправлять прежний лимит.

Как проверить результат

Не тестируйте настройку на коротких фразах: простые запросы укладываются в базовый лимит и не показывают реальной картины.

  1. Создайте новую тему в том же ассистенте, чтобы очистить контекст прерванного диалога.
  2. Отправьте объемную аналитическую задачу, похожую на ту, где произошел обрыв.
  3. Проверьте признаки корректной работы:
    • Под блоком thinking появился полноценный видимый текст.
    • Мысль завершена логически, предложение не обрывается на полуслове.
    • Если доступна статистика выходных токенов (output tokens), сопоставьте ее с прежним порогом и убедитесь, что генерация не оборвалась снова на отметке 8192. При этом успешный ответ не обязан превышать этот лимит — он может корректно завершиться и с меньшим числом токенов. Не сравнивайте с лимитом вывода суммарный расход всего запроса.

Если ответ все равно не появляется

У проблемы могут быть разные причины. Если вы изменили настройку, а ответ не появляется:

  1. Проверьте активного ассистента. Убедитесь, что запрос отправлен именно из того ассистента, где был включен переключатель, и что тумблер Max tokens остался активным.
  2. Проверьте допустимый предел у провайдера. Если указать число больше, чем поддерживает модель у поставщика, запрос завершится ошибкой валидации параметров.
  3. Проверьте количество выходных токенов. В панели BetterToken сопоставьте данные запроса и обратите внимание именно на выходные токены (output tokens), а не на суммарный счет. Если генерация остановилась заметно ниже установленного лимита, стоит проверить отображение потока (Stream), стабильность сети или вызовы внешних инструментов (MCP-серверов и функций), хотя и влияние max_tokens полностью исключать не следует.

При обращении в службу поддержки передавайте только безопасные технические данные: идентификатор запроса (Request ID), точное время, имя модели и количество списанных токенов. Никогда не отправляйте секретные ключи API и конфиденциальный текст запросов.

Готовы оптимизировать LLM workflow?

Подключите единый API, управляйте ключами и контролируйте расходы на AI-модели в BetterToken.

Начать бесплатно