Бонусы за приглашения

Как работают бонусы за приглашения

Поделитесь ссылкой. Когда друг зарегистрируется по ней и пополнит баланс, вы получите указанный бонус за его последующие пополнения.

Нейросетевой синтез речи на русском: как выбрать TTS по произношению, паузам и цене

Методика выбора русскоязычного TTS без опоры на рекламные демо: единый тестовый текст, слепая оценка произношения и стабильности, проверка форматов и расчет цены принятой минуты.

Содержание
Нейросетевой синтез речи на русском: как выбрать TTS по произношению, паузам и цене

Вы могли уже прослушать несколько сервисов русского TTS: в демо всё звучит гладко, но на ваших фамилиях, суммах, сокращениях и длинных фразах быстро проявляются ошибки в ударениях и паузах. После этой статьи вы сможете выбрать первую пару моделей для теста, провести слепую оценку одного сценария и посчитать стоимость принятой минуты с учётом повторов и брака.

Начните так: для длинной озвучки сравните gemini-3.8-flash-tts с ElevenLabs Multilingual v2; для массовых коротких фраз — gemini-3.8-flash-lite-tts с ElevenLabs Flash/Turbo; для телефонии и IVR — Gemini и ElevenLabs, потому что обе платформы заявляют прямой вывод μ-law и A-law. Добавляйте gpt-4o-mini-tts, если у вас уже есть интеграция с OpenAI Audio или нужны его потоковая передача и форматы, но обязательно пропустите модель через русский тест: встроенные голоса оптимизированы прежде всего для английского.

В открытой документации нет независимого прослушивания одного и того же русского сценария у этих сервисов. Поэтому официальные возможности и цены ниже нужны для первого отбора, а решение должны принять ваш текст, слепое прослушивание и фактический счёт; модели, форматы и цены проверены 24 сентября 2026 года, перед производством их нужно проверить снова.

Сначала отфильтруйте кандидатов по языку, управлению, формату и тарификации

Не тратьте время на прослушивание варианта, который не проходит хотя бы один из четырёх фильтров.

  1. Русский язык действительно указан в документации. Поддержка языка — лишь допуск к тесту, а не доказательство правильных ударений или естественной интонации.
  2. Способ управления подходит вашему сценарию. Важно понять, где задаются темп, тон и паузы и не будут ли служебные инструкции прочитаны вслух.
  3. Формат вывода совместим с вашим конвейером. Для видеомонтажа может хватить WAV или MP3, для потокового воспроизведения нужен PCM, а для телефонии — μ-law или A-law.
  4. Понятна единица тарификации. Сервис может считать символы, текстовые токены, аудиотокены или готовые секунды. Рекламное «от X долларов за минуту» нельзя переносить в бюджет без проверки повторных генераций и брака.

По таблице выберите первую пару для теста

Все три сервиса можно включить в русский тест, но у них разные способы управления, форматы и единицы тарификации. Таблица помогает выбрать первый раунд, но не определяет победителя по качеству голоса.

ПоставщикМодели и русский языкУправление подачейВыгрузкаЧто известно о цене на 24.09.2026
Google Geminigemini-3.8-flash-tts и gemini-3.8-flash-lite-tts; русский указан для обеих моделейДлительный стиль — в speech_metadata.style, точечные паузы и вокальные события — в тегах вроде <short pause>Обычный запрос: WAV 24 кГц, mono, 16-bit; поток: raw PCM; также μ-law и A-lawДля Standard до 31.12.2026 выход стоит $9 или $6 за 1 млн аудиотокенов; 25 аудиотокенов в секунду
OpenAIgpt-4o-mini-tts; также tts-1 и tts-1-hd; русский входит в список поддерживаемых языковИнструкциями можно задавать акцент, темп, интонацию, эмоциональный диапазон, тон и шепотMP3, Opus, AAC, FLAC, WAV и raw PCM 24 кГц; есть потоковая выдачаВ официальном руководстве TTS нет текущей ставки; в день теста запишите цену со страницы тарифов или фактического счёта
ElevenLabsEleven v3, v3 Conversational, Multilingual v2, Flash/Turbo; русский указан для Multilingual v2 и Flash v2.5Контекст текста, Stability и Similarity; для повторяемости есть seed; длинный текст можно связывать через previous_text / next_textMP3, PCM, μ-law, A-law и Opus$0.10 за 1 000 символов для v3 и Multilingual; $0.05 для v3 Conversational и Flash/Turbo; налоги не включены

Фразы поставщиков о «студийном звучании», «стабильности длинного текста» или «наилучшем качестве» подходят только для первичного отбора. Оставляйте сервис в списке лишь после того, как ваш русский сценарий прочитан без критичных ошибок, три прогона достаточно стабильны, а исправления не делают результат слишком дорогим.

Тестовый сценарий должен повторять вашу реальную задачу

Лучший тест — не случайный абзац и не рекламная фраза поставщика, а уменьшенная копия вашего реального материала. Если вы озвучиваете курсы, добавьте термины и длинные объяснения; для магазина — артикулы, суммы и адреса; для IVR — короткие команды, имена и номера.

Первый вариант должен быть нейтральным: без специфичных для одного API тегов и без ручного монтажа. Например:

Добрый вечер! Заказ № 1847 готов к выдаче 5 октября в 18:30.
Сумма — 1 250 рублей 50 копеек. Код подтверждения: А-7-Б-9.
В письме указаны адреса example.ru/support и support@example.ru.
Сначала откройте за́мок, затем осмотрите старинный замо́к.
Компания ООО «Северный ветер» выпустила API для CRM и IoT.
Анна сказала: «Подождите… Я проверю данные и перезвоню через две минуты».

Такой фрагмент проверяет сразу несколько проблемных зон:

  • дату, время, сумму, дробные числа и последовательность символов;
  • аббревиатуры, латиницу, адрес сайта и email;
  • разные ударения в одинаково написанном слове;
  • короткую и длинную паузу;
  • прямую речь и переход между нейтральной фразой и репликой;
  • русские имена и название организации.

Добавьте пять–десять слов, критичных именно для вашего продукта: фамилии экспертов, названия городов, бренды, медицинские или технические термины. Рядом с тестом сохраните эталон: как должны читаться ударения, числа и сокращения. Без такого ключа оценка быстро превращается в спор о вкусе.

Сделайте три прогона без настройки, чтобы увидеть разброс

Для каждого кандидата зафиксируйте модель, голос, скорость, формат и остальные параметры. Сначала сгенерируйте один и тот же исходный текст без исправлений. Затем сделайте еще два прогона с теми же настройками. Три записи нужны не для выбора «самой удачной», а для проверки разброса результата.

Назовите файлы A1, A2, A3, B1 и так далее, чтобы слушатели не знали поставщика. Два носителя русского языка должны оценить их независимо. Если озвучка предназначена для узкой аудитории — например, врачей или операторов кол-центра, — хотя бы один слушатель должен знать эту лексику.

Используйте простую шкалу:

Критерий0 баллов1 балл2 балла
Произношение и ударенияЕсть ошибка, меняющая смысл или требующая перезаписиЕсть заметная, но исправимая неточностьВсе критичные слова прочитаны правильно
Числа, даты и сокращенияПропущены или искажены данныеНужна ручная правка записи текстаПрочитаны без исправлений
Паузы и границы фразСмысловые части сливаютсяРитм приемлем, но нужен монтажПаузы совпадают с замыслом
Стабильность трех прогоновСущественно меняются слова, тембр или ритмЕсть небольшие различияРезультат предсказуем
АртефактыЕсть щелчки, повторы, обрывы или явный бракЕсть мелкие дефектыБрака не слышно
Готовность к использованиюНужна перегенерация и монтажНужна одна из этих операцийФайл можно принять сразу

До подсчета суммы задайте стоп-условия. Для банковского IVR ошибочная сумма может быть безусловным отказом, даже если голос приятный. Для аудиокниги единичная ошибка в редком имени может быть исправима, зато нестабильный тембр между главами — нет.

Во втором раунде исправляйте критичные ошибки, а не настраивайте бесконечно

Базовая запись показывает, что сервис делает без помощи. Второй раунд должен показать, сколько работы требуется для исправления.

Google Gemini TTS

В Gemini 3.8 текст считается дословным сценарием. Постоянные указания вроде «спокойно, медленно, уверенно» нужно помещать в speech_metadata.style, чтобы модель не произнесла их. Точечную паузу можно поставить тегом <short pause> непосредственно в тексте. В официальной документации также рекомендуется использовать английские названия inline-тегов даже для неанглийского сценария.

Обычный запрос возвращает готовый WAV-файл с RIFF-заголовком: 24 кГц, mono, 16-bit signed little-endian PCM. Потоковый запрос по умолчанию возвращает raw audio/l16 с теми же базовыми параметрами, но без заголовка. Для телефонии можно запросить audio/mulaw или audio/alaw и нужную частоту дискретизации.

Обе модели используют одну схему API. Google позиционирует gemini-3.8-flash-tts для более сложной выразительной и длинной озвучки, а gemini-3.8-flash-lite-tts — для массовой, быстрой и более дешевой генерации. Это позиционирование поставщика; окончательный выбор все равно должен пройти ваш русский тест.

OpenAI Speech API

В gpt-4o-mini-tts инструкциями можно управлять акцентом, скоростью, интонацией, эмоциональным диапазоном, тоном и шепотом. Русский язык входит в перечень поддерживаемых, но документация отдельно предупреждает, что встроенные голоса оптимизированы для английского. Поэтому русский нельзя принимать только по флажку поддержки — особенно если важны региональный акцент и редкие фамилии.

API возвращает MP3 по умолчанию и также поддерживает Opus, AAC, FLAC, WAV и raw PCM 24 кГц. Для быстрого старта документация рекомендует WAV или PCM; потоковая передача позволяет начать воспроизведение до завершения всего файла.

Для пользовательского продукта учтите еще одно требование: OpenAI требует ясно сообщать слушателю, что голос сгенерирован ИИ, а не принадлежит человеку.

ElevenLabs

Для русского в официальном руководстве указаны Multilingual v2 и Flash v2.5. Поставщик рекомендует выбирать голос с акцентом, соответствующим языку и региону. Текстовые подсказки вроде «сказала взволнованно» влияют на подачу, но будут произнесены вслух; если использовать такой прием, этот фрагмент придется вырезать или переписать.

Выход может быть MP3, PCM, μ-law, A-law или Opus. Модели недетерминированы: seed повышает повторяемость, но не гарантирует идентичный результат. Для длинной озвучки документация советует делить текст и передавать previous_text / next_text либо идентификаторы соседних запросов, чтобы сохранить связность просодии.

До двух бесплатных регенераций доступны только для точно того же текста, голоса и параметров. Любое исправление текста или настройки считается новой оплачиваемой генерацией. Коммерческие права на результат заявлены только для платных планов.

Включите повторы и брак в стоимость принятой минуты

Цена первого запроса почти всегда занижает реальную себестоимость. Сложите все расходы на генерацию одного материала и разделите их на длительность аудио, которое действительно приняли.

Стоимость принятой минуты = все расходы на генерацию данного материала ÷ длительность принятого аудио в минутах.

В числитель входят оплаченные варианты, повторы после правки текста и забракованные дубли. Время редактора и монтажёра учитывайте отдельно, чтобы видеть и тариф API, и полную стоимость производства.

Пример для Google Gemini

Google указывает 25 аудиотокенов на секунду. Одна сгенерированная минута — 1 500 аудиотокенов. При тарифе Standard, действующем до 31 декабря 2026 года:

  • gemini-3.8-flash-tts: $9 за 1 млн аудиотокенов, то есть $0.0135 за сгенерированную минуту плюс входной текст;
  • gemini-3.8-flash-lite-tts: $6 за 1 млн аудиотокенов, то есть $0.009 за сгенерированную минуту плюс входной текст.

Для Batch/Flex выходная минута составляет примерно $0.00675 и $0.0045 соответственно; для Priority — $0.0243 и $0.0162. С 1 января 2027 года перечисленные ставки в официальной таблице удваиваются.

Если вы сделали три минутных дубля Flash-Lite и приняли только один, выходная часть затрат на принятую минуту — уже около $0.027, а не $0.009. Входные токены и налоги нужно добавить по фактическому счету.

Пример для ElevenLabs

ElevenLabs тарифицирует TTS по символам, а не по длительности. По странице API-цен:

  • v3 и Multilingual: $0.10 за 1 000 символов;
  • v3 Conversational и Flash/Turbo: $0.05 за 1 000 символов.

Текст на 1 200 символов стоит $0.12 или $0.06 за один прогон. Если для финального одноминутного файла потребовалось три оплаченных прогона, стоимость принятой минуты составит $0.36 или $0.18. Но если этот текст звучит 50 или 90 секунд, расчет нужно делать по фактической длине принятого файла. Указанные на странице примерные «доллары за минуту» основаны на усреднении и не заменяют ваш замер русского темпа.

Что делать с OpenAI

В официальном руководстве OpenAI TTS перечислены модели, способы управления и форматы, но нет текущей ставки. В день теста перенесите фактическое потребление и сумму с действующей страницы цен или из счёта в ту же таблицу; старая ставка или цена другого аудиопродукта даст ложную точность.

Выбирайте первую пару моделей по сценарию

В первом раунде не нужно проверять все сервисы. Выберите две модели по длине контента, выходному формату и допустимому объёму правок; расширяйте список только тогда, когда обе не проходят тест.

Длинные курсы, подкасты и аудиокниги: сначала Gemini Flash и Multilingual v2

Для длинной русской озвучки сначала сравните gemini-3.8-flash-tts и ElevenLabs Multilingual v2. Gemini даёт дословный сценарий, структурированное управление стилем и точечные паузы; ElevenLabs позиционирует Multilingual v2 для длинного материала и позволяет связывать части через previous_text / next_text.

Если важнее точный текст, WAV/raw PCM или структурированный диалог двух голосов, начните с Gemini. Если важнее выбор голосов и связность частей, начните с ElevenLabs; меняйте основного кандидата при дрейфе тембра между главами, ошибках в ключевых словах или частых повторных генерациях.

Массовые короткие фразы: сначала Gemini Flash-Lite и ElevenLabs Flash/Turbo

Для карточек, уведомлений и интерфейсных подсказок сначала сравните gemini-3.8-flash-lite-tts и ElevenLabs Flash/Turbo. Обе линейки позиционируются как более дешёвые или производительные, поэтому выбирайте по стоимости принятой минуты, а не по рекламной ставке.

При стабильной длине текста и удобной посимвольной тарификации бюджет ElevenLabs проще прогнозировать. Если нужны raw PCM, μ-law, A-law или единый учёт аудиотокенов, Gemini проще включить в поток; когда повторы и ручные исправления съедают разницу в цене, оставляйте вариант с меньшим числом ошибок.

Потоковая выдача: первый тест определяет ваш декодер

Если продукт уже использует OpenAI Speech API, сначала проверьте gpt-4o-mini-tts: он поддерживает chunked streaming и вывод WAV или PCM. Если важнее дословное чтение, структурированные настройки подачи и raw PCM 24 кГц, начните с Gemini.

ElevenLabs Flash стоит ставить первым, когда приоритетны низкая задержка и широкий выбор голосов. Рекомендация меняется, если ошибки в русских ударениях или постобработка увеличивают общую задержку и стоимость, даже при быстром первом звуке.

Телефония и IVR: сначала Gemini и ElevenLabs

Для телефонии и IVR сначала тестируйте Gemini и ElevenLabs: обе платформы могут сразу выдавать μ-law или A-law, поэтому не требуется лишнее преобразование. Ошибка в сумме, дате, имени или коде подтверждения должна быть безусловным отказом — приятный тембр не исправляет неверную информацию.

OpenAI имеет смысл добавить, только если у вас уже есть надёжное преобразование PCM. Иначе знакомый API может создать больше работы с форматами и диагностикой, чем сэкономить.

Два или несколько голосов: Gemini для двух, Eleven v3 для большего числа

Для двух фиксированных ролей сначала тестируйте Gemini 3.8; для большего числа говорящих или более драматичного диалога — Eleven v3. Меняйте выбор, если русские голоса не подходят ролям, реплики смешиваются или длинные фрагменты теряют связность.

Фирменный или клонированный голос: сначала права, потом звучание

Сначала исключите решения, которые не отвечают требованиям к согласию, хранению и коммерческому использованию, и только затем проверяйте длинный текст. Убедительный технический клон ещё не означает разрешение на публикацию, хранение или монетизацию.

Переходите к пилоту только после шести проверок

Если хотя бы один пункт не выполнен, исправьте проблему или смените кандидата, а не переносите известный риск в производство.

  • критичные русские слова, фамилии, суммы и сокращения читаются правильно;
  • паузы и темп управляются без служебного текста в записи;
  • три одинаковых запроса дают приемлемо стабильный результат;
  • формат и частота дискретизации подходят монтажу, стримингу или телефонии;
  • понятны права на коммерческое использование и требования к раскрытию синтетического голоса;
  • стоимость рассчитана по всем дублям и делится на принятую длительность;
  • цена и модель повторно проверены перед производственным запуском.

Сузьте первый раунд до двух моделей и проведите три слепых прогона одного сценария. Для длинного текста начните с Gemini Flash и ElevenLabs Multilingual v2, для массовых коротких фраз — с Flash-Lite и Flash/Turbo, для телефонии — с Gemini и ElevenLabs; оставьте только решение, которое правильно читает критичные данные, работает достаточно стабильно и даёт управляемую стоимость принятой минуты.

Официальные источники

Проверены 24 сентября 2026 года:

Готовы оптимизировать LLM workflow?

Подключите единый API, управляйте ключами и контролируйте расходы на AI-модели в BetterToken.

Начать бесплатно