Invita y gana

Cómo funcionan las recompensas

Comparte tu enlace. Cuando un amigo se registre con él y recargue saldo, recibirás la recompensa indicada por sus recargas posteriores.

Síntesis de voz neuronal en ruso: cómo elegir TTS por pronunciación, pausas y coste

Método neutral para elegir TTS en ruso: un guion realista, escucha a ciegas, comprobación de formatos, controles documentados y coste por minuto aceptado.

Índice
Síntesis de voz neuronal en ruso: cómo elegir TTS por pronunciación, pausas y coste

Es posible que ya hayas escuchado varias demos de TTS en ruso: todas suenan pulidas, pero tus propios apellidos, importes, siglas y frases largas pueden revelar fallos de acentuación y pausas. Al terminar esta guía sabrás qué pareja probar primero, cómo evaluar a ciegas un mismo guion y cómo incluir reintentos y tomas descartadas en el coste de cada minuto aceptado.

Empieza así: para audio ruso largo, compara gemini-3.8-flash-tts con ElevenLabs Multilingual v2; para frases cortas a gran escala, gemini-3.8-flash-lite-tts con ElevenLabs Flash/Turbo; para telefonía e IVR, empieza por Gemini y ElevenLabs porque ambos documentan salida directa μ-law y A-law. Añade gpt-4o-mini-tts cuando ya utilices el entorno de audio de OpenAI o necesites sus formatos y streaming, pero haz que supere tu guion ruso porque las voces integradas están optimizadas para inglés.

La documentación pública no ofrece una escucha independiente del mismo guion ruso en estos servicios. Usa las capacidades y precios oficiales para elegir la primera ronda y deja que tu guion, la escucha ciega y la factura real decidan; modelos, formatos y precios se comprobaron el 24 de septiembre de 2026 y deben revisarse otra vez antes de producir.

Filtra primero por ruso, control, formato y facturación

Descarta cualquier opción que falle uno de estos cuatro filtros antes de invertir tiempo en escucharla.

  1. El ruso aparece de forma explícita en la documentación. Es un requisito de entrada, no una prueba de que la acentuación o la entonación sean correctas.
  2. El sistema de control encaja con el flujo de trabajo. Debes saber dónde se indican el ritmo, el tono y las pausas, y si esas instrucciones podrían terminar pronunciándose.
  3. El formato de salida es compatible con tu cadena. WAV o MP3 pueden bastar para edición; PCM puede ser necesario para streaming; telefonía suele requerir μ-law o A-law.
  4. La unidad de facturación es medible. El servicio puede cobrar por caracteres, tokens de texto, tokens de audio o segundos. «Desde X dólares por minuto» no es un presupuesto de producción hasta incluir reintentos y tomas descartadas.

Usa la tabla para elegir la primera pareja de prueba

Los tres servicios pueden entrar en una prueba rusa, pero difieren en controles, formatos y unidades de cobro. La tabla sirve para decidir qué probar primero, no para declarar un ganador de calidad.

ProveedorModelos y compatibilidad con rusoControl de la interpretaciónFormatos de salidaPrecio verificable el 24-09-2026
Google Geminigemini-3.8-flash-tts y gemini-3.8-flash-lite-tts; ambos incluyen rusoEstilo sostenido en speech_metadata.style; pausas y eventos puntuales con etiquetas como <short pause>Petición normal: WAV mono de 24 kHz y 16 bits; streaming: PCM sin cabecera; también μ-law y A-lawEn Standard hasta el 31-12-2026, la salida cuesta $9 o $6 por 1 millón de tokens de audio; 25 tokens por segundo
OpenAIgpt-4o-mini-tts, además de tts-1 y tts-1-hd; el ruso figura entre los idiomas admitidosLas instrucciones controlan acento, velocidad, entonación, rango emocional, tono y susurroMP3, Opus, AAC, FLAC, WAV y PCM sin cabecera a 24 kHz; admite streamingLa guía oficial de TTS no muestra la tarifa actual; registra el precio vigente o la factura el día de la prueba
ElevenLabsEleven v3, v3 Conversational, Multilingual v2 y Flash/Turbo; ruso está documentado para Multilingual v2 y Flash v2.5Contexto textual, Stability y Similarity; seed mejora la repetibilidad; previous_text / next_text enlazan fragmentosMP3, PCM, μ-law, A-law y Opus$0.10 por 1.000 caracteres en v3 y Multilingual; $0.05 en v3 Conversational y Flash/Turbo; impuestos no incluidos

Expresiones del proveedor como «calidad de estudio», «más estable para textos largos» o «máxima fidelidad» solo sirven para crear la lista inicial. Conserva un candidato únicamente si tu guion ruso mantiene los datos críticos, es estable en tres intentos y no exige una corrección demasiado cara.

El guion de prueba debe parecerse a tu trabajo real

No uses un párrafo al azar ni el texto de una demo comercial. El guion debe ser una versión reducida de la carga real. Para un curso, incluye terminología y explicaciones largas; para comercio electrónico, referencias, cantidades y direcciones; para un IVR, comandos breves, nombres y números.

La primera versión debe ser neutral: sin etiquetas propias de un proveedor y sin edición manual. Este fragmento es un buen punto de partida. Se mantiene deliberadamente en ruso en todas las traducciones del artículo porque el objetivo es probar la pronunciación rusa:

Добрый вечер! Заказ № 1847 готов к выдаче 5 октября в 18:30.
Сумма — 1 250 рублей 50 копеек. Код подтверждения: А-7-Б-9.
В письме указаны адреса example.ru/support и support@example.ru.
Сначала откройте за́мок, затем осмотрите старинный замо́к.
Компания ООО «Северный ветер» выпустила API для CRM и IoT.
Анна сказала: «Подождите… Я проверю данные и перезвоню через две минуты».

El pasaje pone a prueba a la vez:

  • fecha, hora, importe, decimales y una secuencia de caracteres;
  • abreviaturas rusas, letras latinas, URL y correo electrónico;
  • dos lecturas de una misma grafía con distinto acento;
  • pausas cortas y largas;
  • transición entre narración y discurso directo;
  • nombres propios y una organización rusa.

Añade entre cinco y diez términos críticos para tu producto: apellidos de expertos, ciudades, marcas, vocabulario médico, jurídico o técnico. Guarda junto al guion una lectura de referencia que indique el acento esperado, cómo expandir los números y cómo tratar las abreviaturas. Sin esa clave, la evaluación se convierte rápidamente en una discusión de gustos.

Ejecuta tres bases sin ajustes para detectar inestabilidad

Para cada candidato, fija el modelo, la voz, la velocidad, el formato y el resto de parámetros. Genera exactamente el mismo texto sin corregir y repite dos veces con la misma configuración. Las tres salidas no sirven para escoger la toma más afortunada, sino para medir la variación.

Renombra los archivos A1, A2, A3, B1, etc., de forma que los oyentes no vean el proveedor. Pide a al menos dos hablantes nativos de ruso que puntúen por separado. Si el contenido es especializado, uno de ellos debería conocer la terminología.

Una escala de 0 a 2 resulta suficiente:

Criterio0 puntos1 punto2 puntos
Pronunciación y acentuaciónUn error cambia el sentido o obliga a repetirHay un problema evidente pero reparableTodas las palabras críticas son correctas
Números, fechas y abreviaturasSe omiten o deforman datosEs necesario reescribir el textoNo hace falta corregir
Pausas y límites de fraseLas unidades de sentido se mezclanRitmo utilizable con ediciónLas pausas coinciden con la intención
Estabilidad en tres intentosCambian palabras, timbre o ritmo de forma materialHay variaciones menoresSalida predecible
ArtefactosClics, repeticiones, cortes o fallo claroDefectos pequeñosSin defectos evidentes
Preparación para usoRequiere regeneración y ediciónRequiere una de las dosPuede aceptarse directamente

Define criterios de descarte antes de sumar. Una cifra incorrecta puede invalidar una locución bancaria aunque la voz sea agradable. En un audiolibro, un nombre raro puede corregirse, pero un cambio de timbre entre capítulos quizá no.

Usa la segunda ronda para corregir fallos críticos, no para ajustar sin límite

La línea base muestra qué hace el modelo sin ayuda. La segunda ronda debe medir cuánto trabajo cuesta arreglarlo, no cuánto tiempo puedes ajustar hasta obtener por casualidad una toma buena.

Google Gemini TTS

Gemini 3.8 trata el campo text como una transcripción literal. Las instrucciones sostenidas —por ejemplo, «calmado, lento y seguro»— deben ir en speech_metadata.style para evitar que se pronuncien. Una pausa puntual puede insertarse como <short pause>. La documentación recomienda además usar nombres de etiquetas en inglés incluso cuando el guion no está en inglés.

Una petición no transmitida en streaming devuelve un WAV completo con cabecera RIFF: 24 kHz, mono y PCM signed little-endian de 16 bits. Una petición en streaming devuelve por defecto audio/l16 sin cabecera con los mismos parámetros básicos. Para telefonía pueden solicitarse audio/mulaw o audio/alaw y una frecuencia de muestreo concreta.

Ambos modelos 3.8 comparten el mismo esquema de API. Google posiciona gemini-3.8-flash-tts para mayor fidelidad, control expresivo, pronunciaciones difíciles y textos largos, y gemini-3.8-flash-lite-tts para gran volumen, menor latencia y menor coste. Debe considerarse orientación del proveedor hasta que la prueba rusa lo confirme.

OpenAI Speech API

En gpt-4o-mini-tts, las instrucciones pueden controlar acento, velocidad, entonación, rango emocional, tono y susurro. El ruso figura en la lista de idiomas admitidos, pero la documentación indica que las voces integradas están optimizadas para inglés. Por eso la prueba rusa es imprescindible, especialmente con acentos regionales, apellidos y términos de dominio.

La API devuelve MP3 por defecto y también admite Opus, AAC, FLAC, WAV y PCM sin cabecera a 24 kHz. La guía recomienda WAV o PCM cuando importa la rapidez de respuesta, y el streaming permite empezar la reproducción antes de completar el archivo.

Hay además un requisito de producto: OpenAI exige informar claramente al usuario de que la voz es generada por IA y no corresponde a una persona.

ElevenLabs

La guía oficial incluye el ruso en Multilingual v2 y Flash v2.5 y recomienda elegir una voz cuyo acento corresponda al idioma y la región. Frases descriptivas como «dijo emocionada» pueden afectar a la interpretación, pero también serán pronunciadas; si se usan, hay que eliminarlas, reescribirlas o cortarlas del resultado.

La salida puede ser MP3, PCM, μ-law, A-law u Opus. Los modelos no son deterministas: seed mejora la repetibilidad, pero no garantiza un audio idéntico. Para textos largos, la documentación recomienda dividir el contenido y pasar previous_text / next_text o los ID de solicitudes adyacentes para conservar la continuidad prosódica.

Se permiten hasta dos regeneraciones gratuitas solo si texto, voz y todos los parámetros son exactamente iguales. Cualquier cambio genera una nueva operación de pago. La documentación también señala que los derechos de uso comercial requieren un plan de pago.

Incluye reintentos y descartes en el coste por minuto aceptado

Contar solo la primera petición reduce artificialmente el coste. Divide todo el gasto de generación de la pieza entre la duración del audio que realmente aceptas.

Coste por minuto aceptado = todo el gasto de generación de la pieza ÷ duración aceptada en minutos.

Las alternativas pagadas, las peticiones tras editar el guion y las tomas rechazadas van en el numerador. Registra aparte el tiempo de edición para ver por separado la tarifa de API y el trabajo humano.

Ejemplo con Google Gemini

Google indica 25 tokens de audio por segundo, por lo que un minuto generado consume 1.500 tokens de audio. Con Standard hasta el 31 de diciembre de 2026:

  • gemini-3.8-flash-tts: $9 por 1 millón de tokens de salida, es decir, $0.0135 por minuto generado, más el texto de entrada;
  • gemini-3.8-flash-lite-tts: $6 por 1 millón, es decir, $0.009 por minuto generado, más la entrada.

En Batch/Flex, la salida es aproximadamente $0.00675 y $0.0045 por minuto; en Priority, $0.0243 y $0.0162. La tabla oficial duplica estas tarifas a partir del 1 de enero de 2027.

Si generas tres tomas de un minuto con Flash-Lite y aceptas una, el gasto de salida por minuto aceptado ya es de unos $0.027, no $0.009. Añade tokens de entrada, impuestos y cualquier otro concepto real.

Ejemplo con ElevenLabs

ElevenLabs factura por caracteres, no por duración:

  • v3 y Multilingual: $0.10 por 1.000 caracteres;
  • v3 Conversational y Flash/Turbo: $0.05 por 1.000 caracteres.

Un guion de 1.200 caracteres cuesta $0.12 o $0.06 por generación. Si un archivo final de un minuto requiere tres generaciones pagadas, el coste aceptado es $0.36 o $0.18. Sin embargo, esos 1.200 caracteres rusos pueden durar 50 o 90 segundos; usa la duración real del archivo aceptado. Los valores aproximados «por minuto» de la página son promedios, no una medición de tu ritmo ruso.

Cómo tratar el precio de OpenAI

La guía de TTS de OpenAI enumera modelos, controles y formatos, pero no la tarifa actual. El día de la prueba, copia el consumo y el importe reales desde la página vigente o la factura a la misma hoja; una tarifa antigua o el precio de otro producto de audio produciría una comparación precisa en apariencia, pero incorrecta.

Elige la primera pareja según la carga de trabajo

No hace falta probar todos los servicios en la primera ronda. Escoge dos según la longitud del contenido, la ruta de salida y el trabajo de corrección que puedes asumir; amplía la lista solo si ambos fallan.

Cursos, pódcast y audiolibros largos: primero Gemini Flash y Multilingual v2

Para audio ruso largo, compara primero gemini-3.8-flash-tts con ElevenLabs Multilingual v2. Gemini ofrece guion literal, estilo estructurado y pausas puntuales; ElevenLabs posiciona Multilingual v2 para texto largo y permite enlazar fragmentos con previous_text / next_text.

Empieza por Gemini si pesan más el texto exacto, WAV/raw PCM o los turnos estructurados de dos voces. Empieza por ElevenLabs si importan más la elección de voz y la continuidad entre fragmentos; cambia el candidato principal si deriva el timbre entre capítulos, se leen mal palabras críticas o necesitas regenerar con frecuencia.

Frases cortas a gran escala: primero Gemini Flash-Lite y ElevenLabs Flash/Turbo

Para catálogos, avisos e interfaces, compara primero gemini-3.8-flash-lite-tts con ElevenLabs Flash/Turbo. Ambos se posicionan para menor coste o mayor volumen, así que decide por coste por minuto aceptado, no por tarifa de lista.

ElevenLabs es más fácil de presupuestar cuando la longitud del texto es estable y te conviene cobrar por caracteres. Gemini es más directo cuando necesitas raw PCM, μ-law, A-law o registrar tokens de audio; si los reintentos y correcciones borran la diferencia de precio, elige el que cometa menos errores.

Streaming existente: deja que el decodificador marque la primera prueba

Si tu producto ya utiliza OpenAI Speech API, prueba primero gpt-4o-mini-tts porque admite streaming por chunks y salida WAV o PCM. Si importan más la recitación exacta, el control estructurado y raw PCM a 24 kHz, prueba primero Gemini.

Usa ElevenLabs Flash como primer candidato cuando la baja latencia y la variedad de voces sean centrales. Cambia de rumbo si los fallos de acentuación rusa o la limpieza elevan la latencia y el coste totales, aunque el primer audio llegue rápido.

Telefonía e IVR: primero Gemini y ElevenLabs

Para telefonía e IVR, prueba primero Gemini y ElevenLabs porque ambos pueden devolver μ-law o A-law directamente y evitar una transcodificación. Considera fallo eliminatorio cualquier error en importes, fechas, nombres o códigos: una voz agradable no compensa información incorrecta.

Añade OpenAI solo si ya dispones de una ruta fiable de transcodificación PCM. De lo contrario, reutilizar una API conocida puede generar más trabajo de conversión y diagnóstico del que ahorra.

Dos o más voces: Gemini para dos, Eleven v3 para más

Con dos papeles fijos, prueba primero Gemini 3.8; con más hablantes o diálogo más dramático, prueba primero Eleven v3. Cambia la recomendación si las voces rusas no encajan, los hablantes se mezclan o los turnos largos pierden continuidad.

Voz de marca o clonada: primero los derechos, después el sonido

Descarta antes cualquier opción que no cumpla consentimiento, retención y uso comercial, y solo entonces prueba textos largos. Un clon técnicamente convincente no queda autorizado automáticamente para publicarse, almacenarse o monetizarse.

Pasa a piloto solo después de superar seis comprobaciones

Un solo punto fallido basta para mantener el candidato fuera de producción hasta corregirlo o sustituirlo.

  • las palabras rusas críticas, apellidos, importes y abreviaturas se leen bien;
  • ritmo y pausas pueden controlarse sin que las instrucciones aparezcan en el audio;
  • tres solicitudes idénticas son suficientemente estables;
  • formato y frecuencia de muestreo encajan con edición, streaming o telefonía;
  • se entienden los derechos comerciales y las obligaciones de informar sobre la voz sintética;
  • el coste incluye todas las generaciones y se divide por duración aceptada;
  • modelo y precio se han vuelto a comprobar justo antes de producir.

Reduce la primera ronda a dos candidatos y evalúa a ciegas tres ejecuciones del mismo guion. Empieza los textos largos con Gemini Flash y ElevenLabs Multilingual v2, las frases cortas masivas con Flash-Lite y Flash/Turbo, y la telefonía con Gemini y ElevenLabs; conserva solo la opción que lea bien los datos críticos, sea estable y mantenga controlable el coste por minuto aceptado.

Fuentes oficiales

Comprobadas el 24 de septiembre de 2026:

¿Quieres optimizar tu flujo de trabajo con LLM?

Conecta modelos mediante una API, gestiona claves y controla el gasto en IA.

Empezar gratis