Бонусы за приглашения

Как работают бонусы за приглашения

Поделитесь ссылкой. Когда друг зарегистрируется по ней и пополнит баланс, вы получите указанный бонус за его последующие пополнения.

GLM 5.3 vs DeepSeek V4 Pro: результат, время и цена задачи

Сравнение GLM 5.3 и V4 Pro-0813 по завершённым задачам, времени и расходам — с учётом запланированного отключения Pro.

Содержание
GLM 5.3 vs DeepSeek V4 Pro: результат, время и цена задачи

GLM 5.3 стоит первым проверить на сложных задачах, где дополнительный принятый результат оправдывает больший расход. DeepSeek V4 Pro-0813 заслуживает сравнения там, где особенно чувствительна стоимость серии запусков. В одном опубликованном тесте GLM завершил больше задач и показал меньшее медианное время среди успешных запусков; Pro обошёлся дешевле. Универсального победителя эти данные не определяют.

У выбора есть близкий срок: DeepSeek планирует отключить V4 Pro 14 сентября 2026 года в 12:00 по Пекину — 04:00 UTC, 07:00 по Москве. Согласно уведомлению в официальной платформе, запросы Pro после переключения будут направляться на V4.1 Flash и оплачиваться по её тарифу. Уведомление доступно после входа. Для нового долгосрочного подключения к официальному API не стоит рассчитывать на сохранение Pro-0813 за прежним именем.

Ниже сравниваются GLM 5.3 и Pro-0813, а не GLM 5.3 Flash или V4.1 Flash. Результаты старого Pro пригодятся как исходный уровень для проверки замены; они не описывают модель, которая будет отвечать через его имя после отключения.

Что показали 30 многошаговых задач

27 августа Composio опубликовала сравнение пяти моделей на 30 многошаговых задачах для агентов. Из него можно выделить нужную пару:

Показатель в тесте ComposioGLM 5.3DeepSeek V4 Pro-0813
Завершённые задачи22 из 3019 из 30
Расход на весь набор из 30 задач$5.31$1.23
Расход на одну успешную задачу, по данным автора$0.24$0.065
Медианное время среди завершённых задач2 мин 54 с4 мин 41 с
Число тайм-аутов13

Источники отдельных показателей: завершение, общий расход, стоимость успешной задачи, время, тайм-ауты.

В этом наборе GLM дал на три завершённых задачи больше. Pro потребовал примерно в 3,7 раза меньше денег на один успех: $0.24 / $0.065. Это исторические расходы конкретного теста, без оценки человеческой доработки. Они не являются действующим тарифом API.

Медианы рассчитаны по успешным задачам, а наборы успешных задач у моделей различаются. По ним нельзя заключить, что GLM быстрее Pro на каждой одинаковой задаче или что вся рабочая сессия закончится на столько же раньше. Тайм-ауты и неудачные попытки тоже занимают время.

Это результат Composio, не наш собственный запуск. Без полного набора параметров, окружения запуска и повторных прогонов разница 22 против 19 не даёт надёжной оценки вероятности успеха на вашем проекте. В частности, многошаговая работа с внешними инструментами не равна исправлению ошибки в репозитории.

Кодовые тесты дают более смешанную картину

В официальной карточке GLM 5.3 есть сравнение с DeepSeek V4 Pro-0813:

Тест в таблице Z.aiGLM 5.3Pro-0813
Terminal Bench 2.188.287.9
DeepSWE v1.166.962.7
NL2Repo58.061.1
Toolathlon Verified73.074.1

GLM выше в первых двух строках, Pro — в следующих двух. Это опубликованные Z.ai результаты с оговорёнными в карточке условиями оценки; они не заменяют независимый прогон обеих моделей в вашем клиенте. Складывать строки в единый «процент качества» нельзя: задания и способы оценки разные.

Настройки тоже влияют на сравнение. У GLM 5.3 параметр reasoning_effort по умолчанию равен max. В текущем руководстве DeepSeek V4 thinking включён по умолчанию, а уровень усилия — high. Два запуска «без дополнительных настроек» уже отличаются по выбранному режиму. При этом одинаковое название уровня у разных моделей не означает одинаковый вычислительный бюджет.

Для воспроизведения опубликованного benchmark используйте его условия. Для выбора рабочей модели задайте допустимую стоимость и время своей задачи, затем проверьте подходящие настройки каждой модели в этих пределах.

Считайте все попытки до принятого результата

Заранее определите, что считается успехом. Для исправления ошибки это может быть проходивший ранее падающий тест и отсутствие регрессий. Для агента, работающего с несколькими системами, — корректное конечное состояние во всех нужных системах, без лишних записей и повторных действий.

Расход на один принятый результат удобно считать так:

cost_per_accepted_task = total_api_cost_of_all_attempts / accepted_tasks

В числитель входят и неудачные попытки, и повторные запросы, и запуск резервной модели. Если принятых задач нет, показатель не определён: запишите «0 успешных задач» и полный расход, а не нулевую стоимость успеха.

Отдельно фиксируйте время человека на проверку и исправления. Если хотите выразить его в деньгах, используйте собственную стоимость рабочего часа и покажите расчёт отдельно от API. Модель с меньшим счётом может оказаться дороже, если её результат требует длительной доработки; это нужно измерить на своих задачах.

В Dashboard BetterToken можно сверить модель, время запроса, входные, выходные и кешированные токены, а также соответствующий расход. Решение о том, принята ли задача, и время ручной работы нужно записывать отдельно. Имя модели в записи запроса также не доказывает, какие именно веса обслуживал внешний провайдер.

Как выбрать на своих задачах

Возьмите небольшой набор повторяющихся рабочих задач. Каждой модели дайте одинаковое исходное состояние проекта, инструкции, права на инструменты и критерии приёмки. Для задач с внешними действиями используйте тестовые данные, чтобы повторный запуск не создал реальные дубликаты.

Записывайте версию модели и клиента, провайдера, режим reasoning, лимит времени и повторов. Сохраняйте стоимость и итог каждого запуска, включая неудачи. Сравните не только общий счёт, но и то, какие конкретно задачи одна модель решила, а другая — нет.

Практическая отправная точка:

  • Сложная правка, где ручное исправление дорого: начните с GLM 5.3 и проверьте, превращается ли преимущество в некоторых тестах в большее число принятых изменений у вас.
  • Серия хорошо проверяемых задач с жёстким бюджетом: исторический результат Pro-0813 показывает, почему имеет смысл сравнивать стоимость успеха. До отключения можно сопоставить его со своей текущей моделью; для дальнейшей работы нужен подтверждённо доступный вариант.
  • Длительный процесс с несколькими инструментами: задайте предел времени на всю задачу, включая повторные попытки. Медиана успешных запусков не показывает, сколько времени потеряно на незавершённые.

После 14 сентября новый запрос к официальному deepseek-v4-pro уже нельзя автоматически считать проверкой Pro-0813. Сначала выясните фактическую маршрутизацию. Если ответ приходит от V4.1 Flash, это новая пара для сравнения с GLM 5.3, и результаты нужно собрать заново. У стороннего провайдера сроки и доступность проверяются отдельно.

Готовы оптимизировать LLM workflow?

Подключите единый API, управляйте ключами и контролируйте расходы на AI-модели в BetterToken.

Начать бесплатно