Бонусы за приглашения

Как работают бонусы за приглашения

Поделитесь ссылкой. Когда друг зарегистрируется по ней и пополнит баланс, вы получите указанный бонус за его последующие пополнения.

Qwen3.8-Max для coding: цена, benchmark и подключение к инструментам

Разбор Qwen3.8-Max для coding: API-цена, benchmark, настройка Qwen Code и Claude Code, а также отличие hosted Model ID от открытых весов Qwen3.8-2.4T-A95B.

Содержание

Стабильный Qwen3.8-Max использует hosted Model ID qwen3.8-max; отдельно Qwen открыл веса Qwen3.8-2.4T-A95B. Это два разных имени для разных способов запуска: первое указывают в поле модели у API-провайдера, второе ведёт в репозиторий весов для собственного inference.

Для hosted-теста сначала откройте каталог выбранного провайдера, скопируйте доступный вашему ключу Model ID и зафиксируйте текущие ставки. Затем выполните короткий запрос и проверьте фактический расход: старые цены и имена из обзоров не должны попадать в рабочую конфигурацию.

Что изменилось после preview

В официальном репозитории Qwen уже опубликованы веса и конфигурация post-trained модели Qwen3.8-2.4T-A95B: 2.4 трлн параметров всего, 95 млрд активных, 262 144 Token нативного контекста с возможностью расширения до 1 010 000. Репозиторий совместим с vLLM, SGLang и TokenSpeed.

Hosted-модель qwen3.8-max основана на этих весах, но Qwen отдельно указывает для неё vision input, non-thinking, официальный набор tools и контекст 1 млн Token по умолчанию. Поэтому нельзя вставлять Qwen3.8-2.4T-A95B в API-конфигурацию вместо qwen3.8-max или считать локальный inference полностью идентичным hosted API.

Что выбираетеИмяКуда его указыватьЧто вы получаете
Hosted APIqwen3.8-maxПоле Model ID в каталоге API-провайдераУправляемый inference и дополнительные hosted-возможности
Собственный inferenceQwen3.8-2.4T-A95BРепозиторий и конфигурация inference engineВеса под Qwen3.8-Max License и контроль над своей инфраструктурой
Старый previewqwen3.8-max-previewНе использовать для новой стабильной конфигурацииИсторический API-вариант с другим контрактом

Preview встречался в Token Plan и ранних конфигурациях как qwen3.8-max-preview. Для него фиксировались ограничения thinking, которых нет в стабильном контракте. Самая практичная миграция — заменить Model ID, проверить тип ключа и endpoint, затем заново выполнить минимальный запрос. Простая смена строки модели без сверки региона может закончиться 401, 404 или отсутствием модели.

Можно ли запустить открытые веса локально

Формально да: репозиторий содержит веса и конфигурацию для собственного inference. Практически это серверный проект, а не загрузка модели на обычную рабочую видеокарту. В MoE на каждом шаге активны 95 млрд параметров, но хранить, распределять и загружать нужно значительно больше данных; к ним добавляются KV cache, выбранная точность, quantization и служебная память inference engine.

Не рассчитывайте оборудование только по числу активных параметров. Сначала выберите движок, точность, длину контекста и допустимую скорость, затем проверьте его hardware guide и составьте отдельную оценку памяти. Для разового coding-теста hosted API обычно требует меньше подготовки; локальный вариант имеет смысл, когда команда готова обслуживать шардирование, обновления и мониторинг.

Весам присвоена отдельная Qwen3.8-Max License, а не Apache 2.0. Она разрешает использование и модификацию, но содержит дополнительные условия для крупных коммерческих продуктов, Model as a Service и AI Work Assistant. Перед публичным или коммерческим развёртыванием проверьте полный текст лицензии применительно к своему сценарию.

Сколько стоит Qwen3.8-Max

Проверьте цену и Model ID перед тестом. В каталоге BetterToken доступны текущие условия для моделей, которые есть в выбранном API-каталоге. Открыть актуальные цены BetterToken

Alibaba Model Studio публикует цены по регионам. Их нужно считать в исходной валюте, не выдавая конвертацию за официальный тариф.

  • Beijing / Global: CNY 12 за 1 млн входных и CNY 36 за 1 млн выходных Token.
  • Singapore: CNY 14.988 за 1 млн входных и CNY 44.965 за 1 млн выходных Token.

Для 200 000 входных и 20 000 выходных Token расчёт Beijing составляет:

0.2 × 12 + 0.02 × 36 = CNY 3.12.

Для Singapore тот же объём — CNY 3.8969. Это pay-as-you-go расчёт Model Studio. Token Plan, подписка и сторонний gateway имеют другую единицу биллинга и не должны появляться в одной строке сравнения.

Сумму в одной валюте нельзя напрямую сравнивать с тарифом другого провайдера в другой валюте: различаются также условия кэша и доступа. Сначала выберите конкретного провайдера и регион, затем рассчитайте для него один и тот же профиль Token по текущим ставкам.

Как читать официальную benchmark-таблицу

В релизе Qwen указаны такие coding-результаты:

  • Terminal-Bench 2.1: 86.6.
  • SWE-bench Pro: 67.7.
  • DeepSWE 1.1: 56.6.
  • FrontierSWE: 73.5.
  • PaperBench: 93.0.
  • QwenSWEBench: 80.7.

Это vendor-reported данные. Для Terminal-Bench 2.1 Qwen указывает Claude Code, avg@10, пятичасовой timeout и max_tokens=131072. Для SWE-bench Pro указаны Claude Code, temperature=1.0, top_p=0.95 и контекст 256K; отдельный timeout в этой сноске не заявлен. Для конкурентов в ряде строк использовался их лучший опубликованный результат. Часть наборов принадлежит Qwen и не имеет внешнего воспроизведения.

Отсюда нельзя вывести единый рейтинг. Например, 93.0 на PaperBench не означает, что модель автоматически лучше на исправлении issue в реальном репозитории. Сначала смотрите, какую способность измеряет тест, затем — harness, effort, количество попыток и способ оценки.

Что показал один независимый тест

Trilogy AI сравнивала Qwen preview и Kimi K3 на одной задаче архитектурного анализа: замороженный репозиторий из 269 файлов, одинаковый лимит времени и один тип результата. Итог StackPerf — 80 против 83 в пользу Kimi. Qwen сделал 44 tool call без ошибки, а Kimi — 53 с двумя восстановленными сбоями.

Это полезная процессная фотография, но всего один запуск одного задания. Она показывает, что небольшой разрыв по баллам может сопровождаться разным поведением tools. Она не доказывает, что одна модель сильнее во всех coding-сценариях.

Где Qwen3.8-Max выглядит уместно

Модель стоит включить в тест, если задача требует:

  • пройти по большому числу файлов и собрать архитектурную картину;
  • выполнить многошаговый план с tools;
  • работать с текстом, изображениями или документами в одном контексте;
  • подготовить diff и проверить несколько условий готовности;
  • долго удерживать бизнес-правила вместе с кодом.

Для мелких правок разумно сравнить low и более высокий reasoning. Если улучшение качества не окупает задержку и выходные Token, тяжёлый режим не должен быть значением по умолчанию.

Настройка Qwen Code

Сначала в консоли Model Studio выберите регион, откройте страницу API-KEY и создайте обычный pay-as-you-go ключ для этого региона. Ключ Token Plan создаётся в отдельном разделе и с pay-as-you-go endpoint не взаимозаменяем. Скопируйте новый ключ сразу после создания и сохраните его в переменной окружения:

export DASHSCOPE_API_KEY="YOUR_API_KEY"

Qwen Code поддерживает modelProviders и OpenAI-compatible provider. Для настройки во всех проектах откройте ~/.qwen/settings.json; только для одного репозитория используйте .qwen/settings.json в его корне. В JSON указывайте имя переменной, а не сам ключ:

{
  "modelProviders": {
    "openai": [
      {
        "id": "qwen3.8-max",
        "name": "Qwen3.8-Max",
        "baseUrl": "https://dashscope-us.aliyuncs.com/compatible-mode/v1",
        "envKey": "DASHSCOPE_API_KEY"
      }
    ]
  }
}

Endpoint выше относится к US-региону и приведён как официальный пример. Для Beijing, Singapore, Tokyo или Frankfurt берите адрес из таблицы Model Studio и используйте ключ того же региона. Проектный файл перекрывает пользовательский, поэтому при неожиданной модели проверьте оба уровня.

В документации Qwen Code provider-конфигурация описана как атомарная: вложенные generationConfig и другие поля заменяются целиком, а не сливаются по одному ключу. Перед изменением сохраните существующие provider-записи и проверьте diff, чтобы не удалить рабочую настройку другой модели.

Сохраните файл, перезапустите Qwen Code, выберите qwen3.8-max, отправьте запрос на чтение одного файла и проверьте имя модели в ответе или metadata. Только затем разрешайте изменения.

Настройка Claude Code

Model Studio предоставляет Anthropic-compatible endpoint. Для US-региона минимальный пример выглядит так:

export ANTHROPIC_BASE_URL="https://dashscope-us.aliyuncs.com/apps/anthropic"
export ANTHROPIC_AUTH_TOKEN="YOUR_API_KEY"
export ANTHROPIC_MODEL="qwen3.8-max"

Для другого региона замените Base URL официальным региональным адресом и используйте соответствующий ключ. После перезапуска дайте короткую задачу без изменения файлов и проверьте фактический Model ID. Не смешивайте Token Plan key с pay-as-you-go endpoint.

Anthropic-compatible означает совместимость протокола, а не то, что Qwen становится моделью Anthropic или получает идентичное поведение Claude Code. Проверять нужно tool call, запись файла, восстановление после ошибки и usage.

Какие ошибки уже воспроизводили

Issue Qwen Code #7332 относится к preview: внутренний запрос отправлял enable_thinking=false модели, которая тогда принимала только thinking, и получал 400. Этот сигнал полезен для миграции, но не описывает текущий стабильный API.

В Qwen3 issue #1883 пользователь Anthropic-compatible endpoint сообщал, что агент пытался записать относительный путь непосредственно в /tmp; обходом стал абсолютный путь. В Qwen Code issue #7489 VS Code Companion вставлял ссылку на имя изображения, но не передавал само изображение. Оба случая зависят от версии клиента и harness.

При разборе подобных проблем разделяйте четыре слоя:

  1. API принял Model ID и ключ.
  2. Клиент правильно передал thinking и tools.
  3. Harness корректно разрешил путь и вложение.
  4. Модель выполнила инструкцию.

Если сразу назвать всё “ошибкой модели”, исправить конфигурацию будет трудно.

Как проверить модель на своей задаче

Возьмите три репозитория или три issue разного типа. Заморозьте commit, tools, time limit и критерии PASS. Для каждого запуска сохраните:

  • режим reasoning;
  • входные и выходные Token;
  • время до первого полезного изменения;
  • число tool call и ошибок;
  • итог тестов;
  • количество ручных поправок.

Такой тест полезнее общего leaderboard. Он покажет не только способность написать код, но и цену завершённой задачи — именно её оплачивает команда.

Источники

Готовы оптимизировать LLM workflow?

Подключите единый API, управляйте ключами и контролируйте расходы на AI-модели в BetterToken.

Начать бесплатно