Kimi K3 для coding: цена, benchmark и подключение к инструментам
Инженерный разбор Kimi K3: API-цена, coding benchmark с оговорками, подключение к Claude Code, Codex CLI и OpenCode, а также реальные сигналы о расходе Token.
Содержание
Kimi K3 стоит тестировать для длинных агентных задач, работы с большим репозиторием и сценариев, где к коду добавляются изображения. Но модель не стоит выбирать по одному месту в таблице: её результаты зависят от harness, максимального reasoning, endpoint и самого задания, а постоянное размышление может сделать короткий цикл медленным и дорогим.
Текущий способ доступа к модели сверяйте на странице Kimi K3 API. Для сравнения задайте короткую проверяемую задачу и сначала ограничьте бюджет одним запуском: так вы оцените стоимость своего рабочего сценария, а не рекламную цифру.
| Если ваш сценарий | Что проверить у Kimi K3 | Когда выбрать другую модель |
|---|---|---|
| Длинная агентная задача в большом репозитории | Удерживает ли модель границы задачи и завершает ли проверку | Если агент уходит в лишние действия или требует постоянного вмешательства |
| Короткие частые правки | Время ответа и стоимость выходных Token с reasoning | Если более лёгкая модель даёт тот же результат быстрее и дешевле |
| Работа с кодом, изображениями и видео | Помогает ли multimodal-вход именно на ваших данных и поддерживает ли его выбранный клиент | Если визуальные данные не влияют на критерий готовности |
Что именно выпустила Moonshot AI
По официальному репозиторию Kimi K3 — разреженная MoE-модель с 2.8 трлн параметров, из которых на Token активируются 104 млрд. Контекст — 1 048 576 Token. API модели поддерживает текст, изображения и видео, а reasoning включён постоянно; в опубликованной конфигурации benchmark использовался максимальный effort. Конкретный CLI может поддерживать не все эти типы входа: например, Codex принимает текст и изображения, но не передаёт видео напрямую.
Эти цифры описывают ёмкость и режим модели, но не гарантируют, что миллион Token кода будет одинаково полезен. Чем больше контекст, тем важнее проверить поиск нужных файлов, соблюдение границ задачи и способность завершить длинную цепочку инструментов.
Сколько стоит один запуск
Ставки и доступность модели меняются, поэтому перед расчётом сверяйте их в каталоге выбранного провайдера в день теста. Для оценки одного запуска умножьте фактические входные и выходные Token на соответствующие текущие ставки. Если отдельно указана ставка для cache hit, применяйте её только к подтверждённому объёму cached Token и не переносите скидку между провайдерами.
Для своего расчёта используйте текущие ставки, а не старое сравнение. Открыть текущие цены BetterToken
И в официальном API, и у совместимого провайдера итоговый расход определяется не только входом: длинное reasoning оплачивается как выход и может стать главной статьёй затрат.
Что показывают coding benchmark
В официальной таблице Moonshot опубликованы, среди прочего, такие результаты:
- Terminal-Bench 2.1: 88.3.
- DeepSWE: 67.5.
- ProgramBench: 77.8.
- FrontierSWE: 81.2.
- SWE-Marathon: 42.0.
- Kimi Code Bench 2.0: 72.9.
Это vendor-reported результаты. Для Kimi часто использовался Kimi Code harness, а для части конкурентов — их лучший опубликованный harness. В сносках также указаны максимальный effort и фиксированные параметры генерации. Поэтому разница в несколько пунктов не отвечает на вопрос, какая модель лучше с вашим CLI, набором tools и правилами проекта.
Полезная единица сравнения выглядит так:
model + harness + effort + endpoint + task.
Если хотя бы один элемент меняется, прежний балл становится лишь ориентиром. Независимый тест полезнее, когда он фиксирует один репозиторий, одинаковый лимит времени, одинаковые tools и один критерий приёмки.
Для каких задач Kimi K3 выглядит уместно
Сильный кандидат — задача, где модель должна долго удерживать архитектуру, переходить между файлами и сама проверять результат. Например:
- разобрать большой репозиторий и составить карту зависимостей;
- исправить ошибку, которая проходит через несколько модулей;
- сравнить макет или скриншот с реализацией интерфейса;
- выполнить длинный план с тестами и повторной проверкой;
- исследовать несколько вариантов перед изменением кода.
Слабее выглядит короткий интерактивный цикл: переименовать функцию, исправить одну проверку, объяснить небольшой diff. Always-on thinking добавляет задержку и выходные Token даже там, где длинное рассуждение не нужно. Для таких задач сначала сравните K3 с более лёгкой моделью на одинаковых пяти примерах.
Подключение к Claude Code
Moonshot предоставляет Anthropic-compatible endpoint. Минимальная конфигурация текущей международной платформы выглядит так:
export ANTHROPIC_BASE_URL="https://api.moonshot.ai/anthropic"
export ANTHROPIC_AUTH_TOKEN="YOUR_API_KEY"
export ANTHROPIC_MODEL="kimi-k3[1m]"
export ANTHROPIC_DEFAULT_HAIKU_MODEL="kimi-k3[1m]"
export CLAUDE_CODE_SUBAGENT_MODEL="kimi-k3[1m]"
После запуска выполните /status. В ответе должны совпасть Base URL и Model ID. Проверка через меню /model недостаточна: интерфейс может показывать собственные алиасы Claude Code, а не фактическую модель совместимого endpoint.
Не смешивайте ключи Moonshot Open Platform и Kimi Code с чужим Base URL. У платформ разные домены и типы ключей; 401 в такой конфигурации не говорит о качестве модели.
Подключение к Codex CLI
Moonshot поддерживает Responses API, поэтому Codex подключается к Kimi K3 напрямую, без локального proxy и преобразования протокола. Сохраните ключ в переменной окружения KIMI_API_KEY, а не в config.toml. Затем добавьте в ~/.codex/config.toml:
model = "kimi-k3"
model_provider = "kimi"
model_context_window = 1048576
[model_providers.kimi]
name = "Kimi"
base_url = "https://api.moonshot.ai/v1"
env_key = "KIMI_API_KEY"
wire_api = "responses"
Полностью перезапустите Codex, убедитесь, что текущей моделью указана kimi-k3, и сначала отправьте короткий запрос без изменения файлов. Codex Desktop и CLI читают один пользовательский config. Встроенного канала видео у Codex нет: для видео используйте прямой Kimi API по официальной инструкции, а не ручное извлечение кадров как скрытую замену исходному входу.
Подключение к OpenCode
Официальный путь короче:
opencode auth login
Выберите Moonshot AI, вставьте ключ через защищённый диалог, затем используйте /models для выбора Kimi K3 и /variants для проверки effort. Тест должен заставить модель прочитать пару файлов и вернуть их имена, но не менять проект. После ответа сверяйте выбранную модель и расход Token в кабинете провайдера.
Какие проблемы уже описали пользователи
В issue MoonshotAI/kimi-code #1911 пользователь описал зависание, слабую реакцию на остановку и выход за границы задания: вместо отчёта агент начал длинную цепочку shell-команд. В #2031 автор сообщил о сеансе с 18.3 млн входных Token.
Это два отдельных пользовательских сообщения, а не независимое воспроизведение или статистика всей модели. Их полезно превратить в проверки для собственного запуска:
- задавать явные границы файлов и запрет на побочные изменения;
- ограничивать число итераций и subagent;
- останавливать запуск, если несколько шагов не приближают к критерию готовности;
- измерять вход, выход, reasoning и время, а не только цену за миллион;
- начинать с отдельной ветки или тестового репозитория.
Как провести свой короткий тест
- Подготовьте пять задач из своей работы: один локальный bug, одно изменение в нескольких файлах, один тест, один поиск по репозиторию и один сценарий с изображением.
- Для каждой модели зафиксируйте одинаковые правила, лимит времени и критерий PASS.
- Сохраняйте четыре числа: общие входные Token, выходные Token, длительность и число ручных вмешательств.
- Проверьте результат, отдельно отметьте нарушения границ и сравните расход Token с базовым сценарием. После пяти запусков решите, подходит ли Kimi K3 как основной агент, модель для сложных задач или только резервный вариант.