Нейросетевой синтез речи на русском: как выбрать TTS по произношению, паузам и цене
Методика выбора русскоязычного TTS без опоры на рекламные демо: единый тестовый текст, слепая оценка произношения и стабильности, проверка форматов и расчет цены принятой минуты.
Содержание

Вы могли уже прослушать несколько сервисов русского TTS: в демо всё звучит гладко, но на ваших фамилиях, суммах, сокращениях и длинных фразах быстро проявляются ошибки в ударениях и паузах. После этой статьи вы сможете выбрать первую пару моделей для теста, провести слепую оценку одного сценария и посчитать стоимость принятой минуты с учётом повторов и брака.
Начните так: для длинной озвучки сравните gemini-3.8-flash-tts с ElevenLabs Multilingual v2; для массовых коротких фраз — gemini-3.8-flash-lite-tts с ElevenLabs Flash/Turbo; для телефонии и IVR — Gemini и ElevenLabs, потому что обе платформы заявляют прямой вывод μ-law и A-law. Добавляйте gpt-4o-mini-tts, если у вас уже есть интеграция с OpenAI Audio или нужны его потоковая передача и форматы, но обязательно пропустите модель через русский тест: встроенные голоса оптимизированы прежде всего для английского.
В открытой документации нет независимого прослушивания одного и того же русского сценария у этих сервисов. Поэтому официальные возможности и цены ниже нужны для первого отбора, а решение должны принять ваш текст, слепое прослушивание и фактический счёт; модели, форматы и цены проверены 24 сентября 2026 года, перед производством их нужно проверить снова.
Сначала отфильтруйте кандидатов по языку, управлению, формату и тарификации
Не тратьте время на прослушивание варианта, который не проходит хотя бы один из четырёх фильтров.
- Русский язык действительно указан в документации. Поддержка языка — лишь допуск к тесту, а не доказательство правильных ударений или естественной интонации.
- Способ управления подходит вашему сценарию. Важно понять, где задаются темп, тон и паузы и не будут ли служебные инструкции прочитаны вслух.
- Формат вывода совместим с вашим конвейером. Для видеомонтажа может хватить WAV или MP3, для потокового воспроизведения нужен PCM, а для телефонии — μ-law или A-law.
- Понятна единица тарификации. Сервис может считать символы, текстовые токены, аудиотокены или готовые секунды. Рекламное «от X долларов за минуту» нельзя переносить в бюджет без проверки повторных генераций и брака.
По таблице выберите первую пару для теста
Все три сервиса можно включить в русский тест, но у них разные способы управления, форматы и единицы тарификации. Таблица помогает выбрать первый раунд, но не определяет победителя по качеству голоса.
| Поставщик | Модели и русский язык | Управление подачей | Выгрузка | Что известно о цене на 24.09.2026 |
|---|---|---|---|---|
| Google Gemini | gemini-3.8-flash-tts и gemini-3.8-flash-lite-tts; русский указан для обеих моделей | Длительный стиль — в speech_metadata.style, точечные паузы и вокальные события — в тегах вроде <short pause> | Обычный запрос: WAV 24 кГц, mono, 16-bit; поток: raw PCM; также μ-law и A-law | Для Standard до 31.12.2026 выход стоит $9 или $6 за 1 млн аудиотокенов; 25 аудиотокенов в секунду |
| OpenAI | gpt-4o-mini-tts; также tts-1 и tts-1-hd; русский входит в список поддерживаемых языков | Инструкциями можно задавать акцент, темп, интонацию, эмоциональный диапазон, тон и шепот | MP3, Opus, AAC, FLAC, WAV и raw PCM 24 кГц; есть потоковая выдача | В официальном руководстве TTS нет текущей ставки; в день теста запишите цену со страницы тарифов или фактического счёта |
| ElevenLabs | Eleven v3, v3 Conversational, Multilingual v2, Flash/Turbo; русский указан для Multilingual v2 и Flash v2.5 | Контекст текста, Stability и Similarity; для повторяемости есть seed; длинный текст можно связывать через previous_text / next_text | MP3, PCM, μ-law, A-law и Opus | $0.10 за 1 000 символов для v3 и Multilingual; $0.05 для v3 Conversational и Flash/Turbo; налоги не включены |
Фразы поставщиков о «студийном звучании», «стабильности длинного текста» или «наилучшем качестве» подходят только для первичного отбора. Оставляйте сервис в списке лишь после того, как ваш русский сценарий прочитан без критичных ошибок, три прогона достаточно стабильны, а исправления не делают результат слишком дорогим.
Тестовый сценарий должен повторять вашу реальную задачу
Лучший тест — не случайный абзац и не рекламная фраза поставщика, а уменьшенная копия вашего реального материала. Если вы озвучиваете курсы, добавьте термины и длинные объяснения; для магазина — артикулы, суммы и адреса; для IVR — короткие команды, имена и номера.
Первый вариант должен быть нейтральным: без специфичных для одного API тегов и без ручного монтажа. Например:
Добрый вечер! Заказ № 1847 готов к выдаче 5 октября в 18:30.
Сумма — 1 250 рублей 50 копеек. Код подтверждения: А-7-Б-9.
В письме указаны адреса example.ru/support и support@example.ru.
Сначала откройте за́мок, затем осмотрите старинный замо́к.
Компания ООО «Северный ветер» выпустила API для CRM и IoT.
Анна сказала: «Подождите… Я проверю данные и перезвоню через две минуты».
Такой фрагмент проверяет сразу несколько проблемных зон:
- дату, время, сумму, дробные числа и последовательность символов;
- аббревиатуры, латиницу, адрес сайта и email;
- разные ударения в одинаково написанном слове;
- короткую и длинную паузу;
- прямую речь и переход между нейтральной фразой и репликой;
- русские имена и название организации.
Добавьте пять–десять слов, критичных именно для вашего продукта: фамилии экспертов, названия городов, бренды, медицинские или технические термины. Рядом с тестом сохраните эталон: как должны читаться ударения, числа и сокращения. Без такого ключа оценка быстро превращается в спор о вкусе.
Сделайте три прогона без настройки, чтобы увидеть разброс
Для каждого кандидата зафиксируйте модель, голос, скорость, формат и остальные параметры. Сначала сгенерируйте один и тот же исходный текст без исправлений. Затем сделайте еще два прогона с теми же настройками. Три записи нужны не для выбора «самой удачной», а для проверки разброса результата.
Назовите файлы A1, A2, A3, B1 и так далее, чтобы слушатели не знали поставщика. Два носителя русского языка должны оценить их независимо. Если озвучка предназначена для узкой аудитории — например, врачей или операторов кол-центра, — хотя бы один слушатель должен знать эту лексику.
Используйте простую шкалу:
| Критерий | 0 баллов | 1 балл | 2 балла |
|---|---|---|---|
| Произношение и ударения | Есть ошибка, меняющая смысл или требующая перезаписи | Есть заметная, но исправимая неточность | Все критичные слова прочитаны правильно |
| Числа, даты и сокращения | Пропущены или искажены данные | Нужна ручная правка записи текста | Прочитаны без исправлений |
| Паузы и границы фраз | Смысловые части сливаются | Ритм приемлем, но нужен монтаж | Паузы совпадают с замыслом |
| Стабильность трех прогонов | Существенно меняются слова, тембр или ритм | Есть небольшие различия | Результат предсказуем |
| Артефакты | Есть щелчки, повторы, обрывы или явный брак | Есть мелкие дефекты | Брака не слышно |
| Готовность к использованию | Нужна перегенерация и монтаж | Нужна одна из этих операций | Файл можно принять сразу |
До подсчета суммы задайте стоп-условия. Для банковского IVR ошибочная сумма может быть безусловным отказом, даже если голос приятный. Для аудиокниги единичная ошибка в редком имени может быть исправима, зато нестабильный тембр между главами — нет.
Во втором раунде исправляйте критичные ошибки, а не настраивайте бесконечно
Базовая запись показывает, что сервис делает без помощи. Второй раунд должен показать, сколько работы требуется для исправления.
Google Gemini TTS
В Gemini 3.8 текст считается дословным сценарием. Постоянные указания вроде «спокойно, медленно, уверенно» нужно помещать в speech_metadata.style, чтобы модель не произнесла их. Точечную паузу можно поставить тегом <short pause> непосредственно в тексте. В официальной документации также рекомендуется использовать английские названия inline-тегов даже для неанглийского сценария.
Обычный запрос возвращает готовый WAV-файл с RIFF-заголовком: 24 кГц, mono, 16-bit signed little-endian PCM. Потоковый запрос по умолчанию возвращает raw audio/l16 с теми же базовыми параметрами, но без заголовка. Для телефонии можно запросить audio/mulaw или audio/alaw и нужную частоту дискретизации.
Обе модели используют одну схему API. Google позиционирует gemini-3.8-flash-tts для более сложной выразительной и длинной озвучки, а gemini-3.8-flash-lite-tts — для массовой, быстрой и более дешевой генерации. Это позиционирование поставщика; окончательный выбор все равно должен пройти ваш русский тест.
OpenAI Speech API
В gpt-4o-mini-tts инструкциями можно управлять акцентом, скоростью, интонацией, эмоциональным диапазоном, тоном и шепотом. Русский язык входит в перечень поддерживаемых, но документация отдельно предупреждает, что встроенные голоса оптимизированы для английского. Поэтому русский нельзя принимать только по флажку поддержки — особенно если важны региональный акцент и редкие фамилии.
API возвращает MP3 по умолчанию и также поддерживает Opus, AAC, FLAC, WAV и raw PCM 24 кГц. Для быстрого старта документация рекомендует WAV или PCM; потоковая передача позволяет начать воспроизведение до завершения всего файла.
Для пользовательского продукта учтите еще одно требование: OpenAI требует ясно сообщать слушателю, что голос сгенерирован ИИ, а не принадлежит человеку.
ElevenLabs
Для русского в официальном руководстве указаны Multilingual v2 и Flash v2.5. Поставщик рекомендует выбирать голос с акцентом, соответствующим языку и региону. Текстовые подсказки вроде «сказала взволнованно» влияют на подачу, но будут произнесены вслух; если использовать такой прием, этот фрагмент придется вырезать или переписать.
Выход может быть MP3, PCM, μ-law, A-law или Opus. Модели недетерминированы: seed повышает повторяемость, но не гарантирует идентичный результат. Для длинной озвучки документация советует делить текст и передавать previous_text / next_text либо идентификаторы соседних запросов, чтобы сохранить связность просодии.
До двух бесплатных регенераций доступны только для точно того же текста, голоса и параметров. Любое исправление текста или настройки считается новой оплачиваемой генерацией. Коммерческие права на результат заявлены только для платных планов.
Включите повторы и брак в стоимость принятой минуты
Цена первого запроса почти всегда занижает реальную себестоимость. Сложите все расходы на генерацию одного материала и разделите их на длительность аудио, которое действительно приняли.
Стоимость принятой минуты = все расходы на генерацию данного материала ÷ длительность принятого аудио в минутах.
В числитель входят оплаченные варианты, повторы после правки текста и забракованные дубли. Время редактора и монтажёра учитывайте отдельно, чтобы видеть и тариф API, и полную стоимость производства.
Пример для Google Gemini
Google указывает 25 аудиотокенов на секунду. Одна сгенерированная минута — 1 500 аудиотокенов. При тарифе Standard, действующем до 31 декабря 2026 года:
gemini-3.8-flash-tts: $9 за 1 млн аудиотокенов, то есть $0.0135 за сгенерированную минуту плюс входной текст;gemini-3.8-flash-lite-tts: $6 за 1 млн аудиотокенов, то есть $0.009 за сгенерированную минуту плюс входной текст.
Для Batch/Flex выходная минута составляет примерно $0.00675 и $0.0045 соответственно; для Priority — $0.0243 и $0.0162. С 1 января 2027 года перечисленные ставки в официальной таблице удваиваются.
Если вы сделали три минутных дубля Flash-Lite и приняли только один, выходная часть затрат на принятую минуту — уже около $0.027, а не $0.009. Входные токены и налоги нужно добавить по фактическому счету.
Пример для ElevenLabs
ElevenLabs тарифицирует TTS по символам, а не по длительности. По странице API-цен:
- v3 и Multilingual: $0.10 за 1 000 символов;
- v3 Conversational и Flash/Turbo: $0.05 за 1 000 символов.
Текст на 1 200 символов стоит $0.12 или $0.06 за один прогон. Если для финального одноминутного файла потребовалось три оплаченных прогона, стоимость принятой минуты составит $0.36 или $0.18. Но если этот текст звучит 50 или 90 секунд, расчет нужно делать по фактической длине принятого файла. Указанные на странице примерные «доллары за минуту» основаны на усреднении и не заменяют ваш замер русского темпа.
Что делать с OpenAI
В официальном руководстве OpenAI TTS перечислены модели, способы управления и форматы, но нет текущей ставки. В день теста перенесите фактическое потребление и сумму с действующей страницы цен или из счёта в ту же таблицу; старая ставка или цена другого аудиопродукта даст ложную точность.
Выбирайте первую пару моделей по сценарию
В первом раунде не нужно проверять все сервисы. Выберите две модели по длине контента, выходному формату и допустимому объёму правок; расширяйте список только тогда, когда обе не проходят тест.
Длинные курсы, подкасты и аудиокниги: сначала Gemini Flash и Multilingual v2
Для длинной русской озвучки сначала сравните gemini-3.8-flash-tts и ElevenLabs Multilingual v2. Gemini даёт дословный сценарий, структурированное управление стилем и точечные паузы; ElevenLabs позиционирует Multilingual v2 для длинного материала и позволяет связывать части через previous_text / next_text.
Если важнее точный текст, WAV/raw PCM или структурированный диалог двух голосов, начните с Gemini. Если важнее выбор голосов и связность частей, начните с ElevenLabs; меняйте основного кандидата при дрейфе тембра между главами, ошибках в ключевых словах или частых повторных генерациях.
Массовые короткие фразы: сначала Gemini Flash-Lite и ElevenLabs Flash/Turbo
Для карточек, уведомлений и интерфейсных подсказок сначала сравните gemini-3.8-flash-lite-tts и ElevenLabs Flash/Turbo. Обе линейки позиционируются как более дешёвые или производительные, поэтому выбирайте по стоимости принятой минуты, а не по рекламной ставке.
При стабильной длине текста и удобной посимвольной тарификации бюджет ElevenLabs проще прогнозировать. Если нужны raw PCM, μ-law, A-law или единый учёт аудиотокенов, Gemini проще включить в поток; когда повторы и ручные исправления съедают разницу в цене, оставляйте вариант с меньшим числом ошибок.
Потоковая выдача: первый тест определяет ваш декодер
Если продукт уже использует OpenAI Speech API, сначала проверьте gpt-4o-mini-tts: он поддерживает chunked streaming и вывод WAV или PCM. Если важнее дословное чтение, структурированные настройки подачи и raw PCM 24 кГц, начните с Gemini.
ElevenLabs Flash стоит ставить первым, когда приоритетны низкая задержка и широкий выбор голосов. Рекомендация меняется, если ошибки в русских ударениях или постобработка увеличивают общую задержку и стоимость, даже при быстром первом звуке.
Телефония и IVR: сначала Gemini и ElevenLabs
Для телефонии и IVR сначала тестируйте Gemini и ElevenLabs: обе платформы могут сразу выдавать μ-law или A-law, поэтому не требуется лишнее преобразование. Ошибка в сумме, дате, имени или коде подтверждения должна быть безусловным отказом — приятный тембр не исправляет неверную информацию.
OpenAI имеет смысл добавить, только если у вас уже есть надёжное преобразование PCM. Иначе знакомый API может создать больше работы с форматами и диагностикой, чем сэкономить.
Два или несколько голосов: Gemini для двух, Eleven v3 для большего числа
Для двух фиксированных ролей сначала тестируйте Gemini 3.8; для большего числа говорящих или более драматичного диалога — Eleven v3. Меняйте выбор, если русские голоса не подходят ролям, реплики смешиваются или длинные фрагменты теряют связность.
Фирменный или клонированный голос: сначала права, потом звучание
Сначала исключите решения, которые не отвечают требованиям к согласию, хранению и коммерческому использованию, и только затем проверяйте длинный текст. Убедительный технический клон ещё не означает разрешение на публикацию, хранение или монетизацию.
Переходите к пилоту только после шести проверок
Если хотя бы один пункт не выполнен, исправьте проблему или смените кандидата, а не переносите известный риск в производство.
- критичные русские слова, фамилии, суммы и сокращения читаются правильно;
- паузы и темп управляются без служебного текста в записи;
- три одинаковых запроса дают приемлемо стабильный результат;
- формат и частота дискретизации подходят монтажу, стримингу или телефонии;
- понятны права на коммерческое использование и требования к раскрытию синтетического голоса;
- стоимость рассчитана по всем дублям и делится на принятую длительность;
- цена и модель повторно проверены перед производственным запуском.
Сузьте первый раунд до двух моделей и проведите три слепых прогона одного сценария. Для длинного текста начните с Gemini Flash и ElevenLabs Multilingual v2, для массовых коротких фраз — с Flash-Lite и Flash/Turbo, для телефонии — с Gemini и ElevenLabs; оставьте только решение, которое правильно читает критичные данные, работает достаточно стабильно и даёт управляемую стоимость принятой минуты.
Официальные источники
Проверены 24 сентября 2026 года: