Convide e ganhe

Como funcionam as recompensas

Compartilhe seu link. Quando um amigo se cadastrar por ele e adicionar saldo, você receberá a recompensa exibida nas recargas posteriores.

Síntese de voz neural em russo: como escolher TTS por pronúncia, pausas e custo

Método neutro para escolher TTS em russo: roteiro realista, escuta às cegas, verificação de formatos, controles documentados e custo por minuto aceito.

Conteúdo
Síntese de voz neural em russo: como escolher TTS por pronúncia, pausas e custo

Você talvez já tenha ouvido várias demos de TTS em russo: todas parecem bem produzidas, mas seus próprios sobrenomes, valores, siglas e frases longas podem revelar erros de acento e pausa. Ao terminar este guia, você saberá qual dupla testar primeiro, como avaliar às cegas o mesmo roteiro e como incluir novas tentativas e versões descartadas no custo de cada minuto aceito.

Comece assim: para áudio russo longo, compare gemini-3.8-flash-tts com ElevenLabs Multilingual v2; para frases curtas em grande volume, gemini-3.8-flash-lite-tts com ElevenLabs Flash/Turbo; para telefonia e IVR, comece por Gemini e ElevenLabs porque ambos documentam saída direta em μ-law e A-law. Adicione gpt-4o-mini-tts quando você já usa a pilha de áudio da OpenAI ou precisa dos formatos e streaming dela, mas faça o modelo passar pelo seu roteiro russo porque as vozes integradas são otimizadas para inglês.

A documentação pública não oferece uma comparação independente do mesmo roteiro russo nesses serviços. Use recursos e preços oficiais para escolher a primeira rodada e deixe seu roteiro, a escuta às cegas e a fatura real decidirem; modelos, formatos e preços foram conferidos em 24 de setembro de 2026 e devem ser revistos antes da produção.

Filtre primeiro por russo, controle, formato e cobrança

Elimine qualquer opção que falhe em um destes quatro filtros antes de gastar tempo ouvindo.

  1. O russo aparece explicitamente na documentação. Isso habilita o modelo para o teste, mas não comprova acentuação correta nem entonação natural.
  2. A forma de controle combina com o fluxo de trabalho. É preciso saber onde definir ritmo, tom e pausas e se essas instruções podem acabar sendo narradas.
  3. O formato de saída funciona no seu pipeline. WAV ou MP3 podem servir para edição; PCM pode ser necessário em streaming; telefonia costuma exigir μ-law ou A-law.
  4. A unidade de cobrança pode ser medida. O serviço pode cobrar por caracteres, tokens de texto, tokens de áudio ou segundos. “A partir de X dólares por minuto” não é orçamento de produção enquanto novas tentativas e versões descartadas não forem incluídas.

Use a tabela para escolher a primeira dupla de teste

Os três serviços podem entrar em um teste em russo, mas diferem em controles, formatos e unidades de cobrança. A tabela serve para decidir o que testar primeiro, não para declarar um vencedor de qualidade.

FornecedorModelos e suporte a russoControle de interpretaçãoFormatos de saídaEvidência de preço em 24/09/2026
Google Geminigemini-3.8-flash-tts e gemini-3.8-flash-lite-tts; russo está listado em ambosEstilo contínuo em speech_metadata.style; pausas e eventos pontuais com tags como <short pause>Requisição comum: WAV mono de 24 kHz e 16 bits; streaming: PCM bruto; também μ-law e A-lawNo Standard até 31/12/2026, saída a $9 ou $6 por 1 milhão de tokens de áudio; 25 tokens por segundo
OpenAIgpt-4o-mini-tts, além de tts-1 e tts-1-hd; russo consta na lista de idiomasInstruções controlam sotaque, velocidade, entonação, faixa emocional, tom e sussurroMP3, Opus, AAC, FLAC, WAV e PCM bruto a 24 kHz; há streamingO guia oficial de TTS não mostra a tarifa atual; registre a página vigente ou a fatura no dia do teste
ElevenLabsEleven v3, v3 Conversational, Multilingual v2 e Flash/Turbo; russo está documentado para Multilingual v2 e Flash v2.5Contexto textual, Stability e Similarity; seed melhora repetibilidade; previous_text / next_text conectam trechosMP3, PCM, μ-law, A-law e Opus$0.10 por 1.000 caracteres em v3 e Multilingual; $0.05 em v3 Conversational e Flash/Turbo; impostos excluídos

Expressões do fornecedor como “qualidade de estúdio”, “mais estável em textos longos” ou “máxima fidelidade” servem apenas para a triagem inicial. Mantenha um candidato somente se o seu roteiro russo preservar os dados críticos, ficar estável em três tentativas e não exigir correções caras demais.

O roteiro de teste deve reproduzir seu trabalho real

Não use um parágrafo aleatório nem o texto da demonstração do fornecedor. O roteiro deve ser uma versão reduzida da carga real. Um curso deve trazer termos e explicações longas; um fluxo de e-commerce, códigos, valores e endereços; um IVR, comandos curtos, nomes e números.

A primeira versão deve ser neutra, sem tags específicas de um serviço e sem edição manual. O trecho abaixo é um bom ponto de partida. Ele permanece em russo em todas as versões do artigo porque o objetivo é medir a pronúncia russa:

Добрый вечер! Заказ № 1847 готов к выдаче 5 октября в 18:30.
Сумма — 1 250 рублей 50 копеек. Код подтверждения: А-7-Б-9.
В письме указаны адреса example.ru/support и support@example.ru.
Сначала откройте за́мок, затем осмотрите старинный замо́к.
Компания ООО «Северный ветер» выпустила API для CRM и IoT.
Анна сказала: «Подождите… Я проверю данные и перезвоню через две минуты».

Esse trecho testa ao mesmo tempo:

  • data, horário, valor, decimais e sequência de caracteres;
  • abreviações russas, letras latinas, URL e e-mail;
  • duas leituras da mesma grafia com acentos diferentes;
  • pausas curtas e longas;
  • transição da narração para a fala direta;
  • nomes próprios e o nome de uma organização russa.

Acrescente de cinco a dez termos críticos para o seu produto: sobrenomes de especialistas, cidades, marcas, vocabulário médico, jurídico ou técnico. Guarde ao lado do roteiro uma leitura de referência que indique acentos, expansão de números e tratamento das siglas. Sem essa chave, os avaliadores rapidamente passam a discutir gosto pessoal em vez de correção.

Faça três testes sem ajuste para revelar instabilidade

Para cada candidato, fixe modelo, voz, velocidade, formato e todos os demais parâmetros. Gere exatamente o mesmo texto sem correções e repita duas vezes com as mesmas configurações. As três saídas não servem para escolher a mais sortuda; elas mostram a variação do sistema.

Renomeie os arquivos como A1, A2, A3, B1 e assim por diante, de modo que os ouvintes não vejam o fornecedor. Peça a pelo menos dois falantes nativos de russo que pontuem de forma independente. Em conteúdo especializado, um deles deve conhecer o vocabulário do setor.

Uma escala de 0 a 2 é suficiente:

Critério0 ponto1 ponto2 pontos
Pronúncia e acentuaçãoO erro muda o sentido ou exige nova gravaçãoHá um problema perceptível, mas corrigívelTodas as palavras críticas estão corretas
Números, datas e siglasDados são omitidos ou distorcidosÉ preciso reescrever o textoNenhuma correção é necessária
Pausas e limites de fraseBlocos de sentido ficam coladosRitmo utilizável, mas precisa de ediçãoPausas correspondem à intenção
Estabilidade em três tentativasPalavras, timbre ou ritmo mudam de forma relevanteHá pequenas variaçõesSaída previsível
ArtefatosCliques, repetições, cortes ou falha claraPequenos defeitosNenhum defeito evidente
Prontidão para usoPrecisa regenerar e editarPrecisa de uma dessas açõesPode ser aceito imediatamente

Defina condições de reprovação antes de somar os pontos. Um valor lido errado pode invalidar um IVR bancário mesmo com voz agradável. Em um audiolivro, um nome raro talvez seja corrigível, mas deriva de timbre entre capítulos pode não ser.

Use a segunda rodada para corrigir erros críticos, não para ajustar sem fim

A linha de base mostra o que o modelo faz sem ajuda. A segunda rodada deve medir quanto trabalho é necessário para corrigir a saída, e não quanto tempo é possível ajustar até surgir uma geração excepcional por acaso.

Google Gemini TTS

O Gemini 3.8 trata o campo text como transcrição literal. Orientações contínuas como “calmo, lento e confiante” devem ir em speech_metadata.style para não serem narradas. Uma pausa pontual pode ser inserida como <short pause>. A documentação também recomenda nomes de tags em inglês mesmo quando o roteiro não está em inglês.

Uma requisição não streaming retorna um WAV completo com cabeçalho RIFF: 24 kHz, mono e PCM signed little-endian de 16 bits. Em streaming, o padrão é audio/l16 bruto, sem cabeçalho, com os mesmos parâmetros básicos. Para telefonia, podem ser solicitados audio/mulaw ou audio/alaw e uma taxa de amostragem específica.

Os dois modelos 3.8 compartilham o mesmo esquema de API. O Google posiciona gemini-3.8-flash-tts para maior fidelidade, controle expressivo, pronúncias difíceis e texto longo, e gemini-3.8-flash-lite-tts para alto volume, baixa latência e menor custo. Considere isso uma orientação do fornecedor até o seu teste em russo confirmar.

OpenAI Speech API

No gpt-4o-mini-tts, instruções podem controlar sotaque, velocidade, entonação, faixa emocional, tom e sussurro. O russo está na lista de idiomas, mas a documentação informa que as vozes integradas são otimizadas para inglês. Portanto, o teste russo é indispensável, principalmente com sotaques regionais, sobrenomes e termos especializados.

A API retorna MP3 por padrão e também aceita Opus, AAC, FLAC, WAV e PCM bruto a 24 kHz. O guia recomenda WAV ou PCM quando a velocidade de resposta importa, e o streaming permite iniciar a reprodução antes de concluir o arquivo.

Há ainda uma exigência de produto: a OpenAI requer que o usuário seja informado claramente de que a voz foi gerada por IA e não é uma voz humana.

ElevenLabs

O guia oficial lista russo para Multilingual v2 e Flash v2.5 e recomenda escolher uma voz cujo sotaque corresponda ao idioma e à região. Frases descritivas como “ela disse animada” podem influenciar a interpretação, mas também serão faladas; se esse recurso for usado, a frase deve ser removida, reescrita ou cortada.

A saída pode ser MP3, PCM, μ-law, A-law ou Opus. Os modelos são não determinísticos: seed melhora a repetibilidade, mas não garante áudio idêntico. Para textos longos, a documentação recomenda dividir o conteúdo e passar previous_text / next_text ou IDs de solicitações adjacentes para preservar a continuidade da prosódia.

Há até duas regenerações gratuitas apenas quando texto, voz e todos os parâmetros permanecem exatamente iguais. Qualquer alteração vira uma nova geração paga. A documentação também afirma que direitos de uso comercial exigem plano pago.

Inclua tentativas e descartes no custo por minuto aceito

Contar apenas a primeira requisição reduz artificialmente o custo. Divida todo o gasto de geração da peça pela duração do áudio que você realmente aceita.

Custo por minuto aceito = todo o gasto de geração da peça ÷ duração aceita em minutos.

Alternativas pagas, novas solicitações após editar o roteiro e versões descartadas entram no numerador. Registre o tempo de edição separadamente para enxergar tanto o preço da API quanto o trabalho humano.

Exemplo com Google Gemini

O Google informa 25 tokens de áudio por segundo; um minuto usa 1.500 tokens de áudio. No Standard até 31 de dezembro de 2026:

  • gemini-3.8-flash-tts: $9 por 1 milhão de tokens de saída, ou $0.0135 por minuto gerado, mais o texto de entrada;
  • gemini-3.8-flash-lite-tts: $6 por 1 milhão, ou $0.009 por minuto gerado, mais a entrada.

No Batch/Flex, a saída custa aproximadamente $0.00675 e $0.0045 por minuto; no Priority, $0.0243 e $0.0162. A tabela oficial dobra essas tarifas a partir de 1º de janeiro de 2027.

Se você gerar três versões de um minuto com Flash-Lite e aceitar apenas uma, o gasto de saída por minuto aceito já fica em cerca de $0.027, e não $0.009. Some tokens de entrada, impostos e demais itens cobrados na conta real.

Exemplo com ElevenLabs

A ElevenLabs cobra TTS por caracteres, não por duração:

  • v3 e Multilingual: $0.10 por 1.000 caracteres;
  • v3 Conversational e Flash/Turbo: $0.05 por 1.000 caracteres.

Um roteiro de 1.200 caracteres custa $0.12 ou $0.06 por geração. Se um arquivo final de um minuto exigir três gerações pagas, o custo aceito será $0.36 ou $0.18. Porém, os mesmos 1.200 caracteres russos podem durar 50 ou 90 segundos; use a duração real do arquivo aceito. Os valores aproximados “por minuto” da página são médias, e não uma medição da sua velocidade de fala em russo.

Como tratar o preço da OpenAI

O guia de TTS da OpenAI lista modelos, controles e formatos, mas não a tarifa atual. No dia do teste, copie o uso e o valor reais da página vigente ou da fatura para a mesma planilha; uma tarifa antiga ou o preço de outro produto de áudio criaria uma comparação precisa na aparência, mas errada.

Escolha a primeira dupla conforme a carga de trabalho

Você não precisa testar todos os serviços na primeira rodada. Escolha dois conforme a duração do conteúdo, a rota de saída e o volume de correção aceitável; amplie a lista apenas se ambos falharem.

Cursos, podcasts e audiolivros longos: primeiro Gemini Flash e Multilingual v2

Para áudio russo longo, compare primeiro gemini-3.8-flash-tts com ElevenLabs Multilingual v2. O Gemini oferece roteiro literal, estilo estruturado e pausas pontuais; a ElevenLabs posiciona o Multilingual v2 para textos longos e permite conectar trechos com previous_text / next_text.

Comece pelo Gemini quando pesarem mais texto exato, WAV/raw PCM ou turnos estruturados de duas vozes. Comece pela ElevenLabs quando importarem mais a escolha de voz e a continuidade entre trechos; troque o candidato principal se o timbre variar entre capítulos, palavras críticas forem lidas errado ou forem necessárias muitas regenerações.

Frases curtas em grande volume: primeiro Gemini Flash-Lite e ElevenLabs Flash/Turbo

Para catálogos, avisos e interfaces, compare primeiro gemini-3.8-flash-lite-tts com ElevenLabs Flash/Turbo. Ambos são posicionados para menor custo ou maior volume, então escolha pelo custo por minuto aceito, não pela tarifa de lista.

A ElevenLabs é mais fácil de estimar quando o tamanho do texto é estável e a cobrança por caracteres combina com seu fluxo. O Gemini é mais direto quando você precisa de raw PCM, μ-law, A-law ou registro por tokens de áudio; se novas tentativas e correções eliminarem a diferença de preço, escolha a opção com menos erros.

Streaming já existente: deixe o decodificador definir o primeiro teste

Se o produto já usa a OpenAI Speech API, teste primeiro gpt-4o-mini-tts, pois ele aceita streaming por chunks e saída WAV ou PCM. Se recitação exata, controle estruturado e raw PCM a 24 kHz forem mais importantes, teste primeiro o Gemini.

Use ElevenLabs Flash como primeiro candidato quando baixa latência e variedade de vozes forem centrais. Mude de direção se erros de acento russo ou limpeza aumentarem a latência e o custo totais, mesmo com áudio inicial rápido.

Telefonia e IVR: primeiro Gemini e ElevenLabs

Para telefonia e IVR, teste primeiro Gemini e ElevenLabs porque ambos podem devolver μ-law ou A-law diretamente e evitar uma transcodificação. Trate qualquer erro em valores, datas, nomes ou códigos como reprovação: uma voz agradável não corrige informação errada.

Adicione OpenAI somente quando já houver uma rota confiável de transcodificação PCM. Caso contrário, reutilizar uma API conhecida pode criar mais trabalho de conversão e diagnóstico do que economiza.

Duas ou mais vozes: Gemini para duas, Eleven v3 para mais

Com dois papéis fixos, teste primeiro Gemini 3.8; com mais falantes ou diálogo mais dramático, teste primeiro Eleven v3. Mude a recomendação se as vozes russas não combinarem com os papéis, os falantes se misturarem ou turnos longos perderem continuidade.

Voz de marca ou clonada: direitos primeiro, som depois

Elimine antes qualquer opção que não cumpra consentimento, retenção e uso comercial, e só então teste textos longos. Um clone tecnicamente convincente não fica automaticamente liberado para publicação, armazenamento ou monetização.

Só avance ao piloto depois de seis verificações

Um único item reprovado basta para manter o candidato fora da produção até corrigir o problema ou trocar de opção.

  • palavras russas críticas, sobrenomes, valores e siglas são lidos corretamente;
  • ritmo e pausas podem ser controlados sem instruções vazarem para o áudio;
  • três requisições idênticas são estáveis o suficiente;
  • formato e taxa de amostragem servem para edição, streaming ou telefonia;
  • direitos comerciais e deveres de avisar sobre voz sintética estão claros;
  • o custo inclui todas as gerações e é dividido pela duração aceita;
  • modelo e preço foram conferidos novamente imediatamente antes da produção.

Reduza a primeira rodada a dois candidatos e avalie às cegas três execuções do mesmo roteiro. Comece textos longos com Gemini Flash e ElevenLabs Multilingual v2, frases curtas em massa com Flash-Lite e Flash/Turbo, e telefonia com Gemini e ElevenLabs; mantenha apenas a opção que leia os dados críticos corretamente, seja estável e deixe o custo por minuto aceito sob controle.

Fontes oficiais

Verificadas em 24 de setembro de 2026:

Quer otimizar seu fluxo de trabalho com LLMs?

Conecte modelos por uma única API, gerencie chaves e controle os gastos com IA.

Começar grátis