Synthèse vocale neuronale en russe : choisir un TTS selon la prononciation, les pauses et le coût
Une méthode neutre pour choisir un TTS russe : script réaliste, écoute à l’aveugle, vérification des formats, contrôles documentés et coût par minute acceptée.
Sommaire

Vous avez peut-être déjà écouté plusieurs démonstrations de TTS russe : toutes semblent soignées, mais vos propres noms, montants, sigles et phrases longues peuvent révéler des erreurs d’accent tonique et de pauses. À la fin de ce guide, vous saurez quelle paire tester d’abord, comment noter à l’aveugle un même script et comment inclure relances et prises rejetées dans le coût de chaque minute acceptée.
Commencez ainsi : pour un contenu russe long, comparez gemini-3.8-flash-tts à ElevenLabs Multilingual v2 ; pour de nombreuses phrases courtes, gemini-3.8-flash-lite-tts à ElevenLabs Flash/Turbo ; pour la téléphonie et le SVI, commencez par Gemini et ElevenLabs, qui documentent tous deux une sortie directe μ-law et A-law. Ajoutez gpt-4o-mini-tts si votre pile audio utilise déjà OpenAI ou si ses formats et son streaming vous sont nécessaires, mais imposez-lui votre test russe, car les voix intégrées sont optimisées pour l’anglais.
La documentation publique ne fournit pas d’écoute indépendante du même script russe chez ces services. Utilisez donc les fonctions et tarifs officiels pour définir le premier tour, puis laissez votre script, l’écoute à l’aveugle et la facture réelle décider ; modèles, formats et prix ont été vérifiés le 24 septembre 2026 et doivent être contrôlés avant la production.
Filtrer d’abord par russe, contrôle, format et facturation
Écartez toute option qui échoue à l’un de ces quatre filtres avant de consacrer du temps à l’écoute.
- Le russe est explicitement indiqué dans la documentation. Cela autorise le modèle à entrer dans le test, mais ne prouve ni la justesse des accents ni le naturel de la prosodie.
- Le mécanisme de contrôle convient à votre flux. Il faut savoir où indiquer rythme, ton et pauses, et si ces consignes risquent d’être prononcées.
- Le format de sortie s’intègre au pipeline. WAV ou MP3 peuvent suffire au montage ; le PCM peut être requis pour le streaming ; la téléphonie utilise souvent μ-law ou A-law.
- L’unité de facturation est mesurable. Le fournisseur peut compter les caractères, les tokens texte, les tokens audio ou les secondes. « À partir de X dollars par minute » n’est pas un budget de production tant que les relances et prises rejetées ne sont pas incluses.
Utiliser le tableau pour choisir la première paire
Les trois services peuvent entrer dans un test russe, mais leurs contrôles, formats et unités de facturation diffèrent. Le tableau sert à choisir quoi tester d’abord, pas à désigner un gagnant sonore.
| Fournisseur | Modèles et prise en charge du russe | Contrôle de la diction | Formats de sortie | Prix vérifiable au 24/09/2026 |
|---|---|---|---|---|
| Google Gemini | gemini-3.8-flash-tts et gemini-3.8-flash-lite-tts ; le russe est listé pour les deux | Style continu dans speech_metadata.style ; pauses et événements ponctuels via des balises comme <short pause> | Requête classique : WAV mono 24 kHz, 16 bits ; streaming : PCM brut ; μ-law et A-law disponibles | En Standard jusqu’au 31/12/2026, sortie à $9 ou $6 par million de tokens audio ; 25 tokens par seconde |
| OpenAI | gpt-4o-mini-tts, ainsi que tts-1 et tts-1-hd ; le russe figure dans la liste des langues | Les instructions contrôlent accent, vitesse, intonation, plage émotionnelle, ton et chuchotement | MP3, Opus, AAC, FLAC, WAV et PCM brut 24 kHz ; streaming pris en charge | Le guide TTS officiel n’affiche pas le tarif actuel ; relever la page active ou la facture le jour du test |
| ElevenLabs | Eleven v3, v3 Conversational, Multilingual v2 et Flash/Turbo ; russe indiqué pour Multilingual v2 et Flash v2.5 | Contexte du texte, Stability et Similarity ; seed améliore la répétabilité ; previous_text / next_text relient les segments | MP3, PCM, μ-law, A-law et Opus | $0.10 pour 1 000 caractères avec v3 et Multilingual ; $0.05 avec v3 Conversational et Flash/Turbo ; hors taxes |
Les formules fournisseurs comme « qualité studio », « le plus stable pour le long format » ou « fidélité maximale » ne sont que des indices de présélection. Conservez un candidat seulement si votre script russe préserve les informations critiques, reste assez stable sur trois essais et ne demande pas des corrections trop coûteuses.
Le script de test doit reproduire votre charge réelle
N’utilisez ni un paragraphe au hasard ni la phrase de démonstration d’un fournisseur. Le script doit reproduire en miniature votre charge réelle. Pour un cours, ajoutez des termes spécialisés et de longues explications ; pour l’e-commerce, des références, montants et adresses ; pour un SVI, des commandes courtes, noms et numéros.
La première version doit rester neutre, sans balises propres à un fournisseur et sans montage manuel. Le passage suivant constitue un bon point de départ. Il reste volontairement en russe dans toutes les versions traduites de l’article, car c’est la prononciation russe qui doit être évaluée :
Добрый вечер! Заказ № 1847 готов к выдаче 5 октября в 18:30.
Сумма — 1 250 рублей 50 копеек. Код подтверждения: А-7-Б-9.
В письме указаны адреса example.ru/support и support@example.ru.
Сначала откройте за́мок, затем осмотрите старинный замо́к.
Компания ООО «Северный ветер» выпустила API для CRM и IoT.
Анна сказала: «Подождите… Я проверю данные и перезвоню через две минуты».
Ce fragment teste plusieurs difficultés à la fois :
- date, heure, somme, décimales et séquence de caractères ;
- abréviations russes, lettres latines, URL et adresse e-mail ;
- deux lectures d’une même graphie avec un accent différent ;
- pauses courtes et longues ;
- passage de la narration au discours direct ;
- noms russes et nom d’organisation.
Ajoutez cinq à dix termes critiques pour votre produit : noms d’experts, villes, marques, vocabulaire médical, juridique ou technique. Conservez à côté du script une lecture de référence indiquant les accents attendus, le développement des nombres et le traitement des sigles. Sans corrigé, les évaluateurs discutent vite de préférences personnelles plutôt que d’exactitude.
Faire trois essais sans réglage pour révéler l’instabilité
Pour chaque candidat, figez le modèle, la voix, la vitesse, le format et tous les autres paramètres. Générez exactement le même texte non corrigé, puis répétez deux fois avec les mêmes réglages. Les trois sorties ne servent pas à choisir la meilleure par chance, mais à mesurer la variation.
Renommez les fichiers A1, A2, A3, B1, etc., afin que les auditeurs ne voient pas le fournisseur. Demandez à au moins deux russophones natifs de noter séparément. Pour un contenu spécialisé, l’un d’eux doit connaître le vocabulaire du domaine.
Une échelle simple de 0 à 2 suffit :
| Critère | 0 point | 1 point | 2 points |
|---|---|---|---|
| Prononciation et accent tonique | Une erreur change le sens ou impose une nouvelle prise | Défaut perceptible mais corrigeable | Tous les mots critiques sont corrects |
| Nombres, dates et sigles | Données omises ou déformées | Le texte source doit être réécrit | Aucune correction nécessaire |
| Pauses et limites de phrase | Les unités de sens se confondent | Rythme utilisable avec montage | Pauses conformes à l’intention |
| Stabilité sur trois essais | Mots, timbre ou rythme changent nettement | Variations mineures | Résultat prévisible |
| Artefacts audio | Clics, répétitions, coupures ou échec évident | Petits défauts | Aucun défaut manifeste |
| Prêt à l’emploi | Régénération et montage nécessaires | Une seule des deux opérations | Fichier directement acceptable |
Définissez des motifs d’élimination avant de totaliser. Un montant mal lu peut disqualifier un SVI bancaire même si la voix est agréable. Dans un livre audio, une erreur sur un nom rare peut être corrigée, tandis qu’un timbre qui dérive entre les chapitres peut être rédhibitoire.
Corriger les erreurs critiques au second tour, sans régler indéfiniment
La base montre ce que fait le modèle sans aide. Le second tour doit mesurer le travail nécessaire pour corriger le rendu, et non le temps passé à ajuster jusqu’à obtenir une génération chanceuse.
Google Gemini TTS
Gemini 3.8 traite le champ text comme une transcription littérale. Les consignes durables, telles que « calme, lent et assuré », doivent aller dans speech_metadata.style afin de ne pas être prononcées. Une pause ponctuelle peut être insérée sous la forme <short pause>. La documentation recommande également des noms de balises en anglais, même lorsque le script n’est pas anglais.
Une requête non streamée renvoie un WAV complet avec en-tête RIFF : 24 kHz, mono, PCM signed little-endian 16 bits. En streaming, le format par défaut est audio/l16 brut, sans en-tête, avec les mêmes paramètres fondamentaux. Pour la téléphonie, on peut demander audio/mulaw ou audio/alaw et préciser la fréquence d’échantillonnage.
Les deux modèles 3.8 partagent le même schéma d’API. Google positionne gemini-3.8-flash-tts pour une fidélité supérieure, une expression plus fine, les prononciations difficiles et les contenus longs, et gemini-3.8-flash-lite-tts pour le volume, la faible latence et un coût inférieur. Il s’agit d’une orientation du fournisseur à confirmer avec le test russe.
OpenAI Speech API
Avec gpt-4o-mini-tts, les instructions peuvent piloter accent, vitesse, intonation, plage émotionnelle, ton et chuchotement. Le russe figure parmi les langues prises en charge, mais la documentation précise que les voix intégrées sont optimisées pour l’anglais. Le test russe reste donc indispensable, surtout pour les accents régionaux, les noms et les termes techniques.
L’API renvoie du MP3 par défaut et prend aussi en charge Opus, AAC, FLAC, WAV et PCM brut 24 kHz. Le guide recommande WAV ou PCM lorsqu’une réponse rapide importe, et le streaming permet de lancer la lecture avant la fin du fichier.
Une exigence produit doit également être prise en compte : OpenAI demande d’informer clairement l’utilisateur que la voix est générée par une IA et n’est pas humaine.
ElevenLabs
Le guide officiel liste le russe pour Multilingual v2 et Flash v2.5 et recommande une voix dont l’accent correspond à la langue et à la région. Les expressions descriptives, par exemple « dit-elle avec enthousiasme », peuvent modifier le jeu, mais elles sont aussi prononcées ; il faut donc les supprimer, les reformuler ou les couper.
La sortie peut être MP3, PCM, μ-law, A-law ou Opus. Les modèles ne sont pas déterministes : seed améliore la répétabilité sans garantir un audio identique. Pour les textes longs, la documentation conseille de segmenter et de transmettre previous_text / next_text ou les identifiants des requêtes voisines afin de préserver la continuité prosodique.
Deux régénérations gratuites au maximum sont possibles seulement si le texte, la voix et tous les paramètres restent strictement identiques. Toute modification crée une nouvelle génération payante. La documentation indique aussi que les droits d’utilisation commerciale nécessitent un abonnement payant.
Inclure relances et prises rejetées dans le coût par minute acceptée
Ne compter que la première requête sous-estime systématiquement le coût. Divisez toutes les dépenses de génération de l’élément par la durée réellement acceptée.
Coût par minute acceptée = toutes les dépenses de génération de l’élément ÷ durée audio acceptée en minutes.
Les variantes payées, les relances après modification du script et les prises rejetées entrent au numérateur. Suivez séparément le temps de montage afin de distinguer tarif API et travail humain.
Exemple Google Gemini
Google indique 25 tokens audio par seconde ; une minute générée consomme donc 1 500 tokens audio. En Standard jusqu’au 31 décembre 2026 :
gemini-3.8-flash-tts: $9 par million de tokens de sortie, soit $0.0135 par minute générée, plus le texte d’entrée ;gemini-3.8-flash-lite-tts: $6 par million, soit $0.009 par minute générée, plus l’entrée.
En Batch/Flex, la sortie revient à environ $0.00675 et $0.0045 par minute ; en Priority, à $0.0243 et $0.0162. Le tableau officiel double ces tarifs à partir du 1er janvier 2027.
Si trois prises d’une minute sont produites avec Flash-Lite et qu’une seule est acceptée, la dépense de sortie par minute acceptée atteint déjà environ $0.027, et non $0.009. Ajoutez les tokens d’entrée, taxes et autres éléments de la facture réelle.
Exemple ElevenLabs
ElevenLabs facture la synthèse par caractères, pas par durée :
- v3 et Multilingual : $0.10 pour 1 000 caractères ;
- v3 Conversational et Flash/Turbo : $0.05 pour 1 000 caractères.
Un script de 1 200 caractères coûte $0.12 ou $0.06 par génération. Si un fichier final d’une minute exige trois générations payantes, le coût accepté est de $0.36 ou $0.18. Mais 1 200 caractères russes peuvent durer 50 ou 90 secondes ; utilisez la durée réelle du fichier retenu. Les équivalents « par minute » affichés sont des moyennes, pas une mesure de votre débit russe.
Comment traiter le prix OpenAI
Le guide TTS d’OpenAI décrit les modèles, contrôles et formats, mais pas le tarif actuel. Le jour du test, reportez dans la même feuille l’usage et le montant réels de la page active ou de la facture ; un ancien tarif ou le prix d’un autre produit audio donnerait une comparaison faussement précise.
Choisir la première paire selon la charge
Vous n’avez pas besoin de tester tous les services au premier tour. Choisissez-en deux selon la longueur du contenu, la chaîne de sortie et le volume de correction acceptable ; élargissez seulement si les deux échouent.
Cours, podcasts et livres audio longs : Gemini Flash et Multilingual v2 d’abord
Pour un contenu russe long, comparez d’abord gemini-3.8-flash-tts à ElevenLabs Multilingual v2. Gemini fournit un script littéral, un style structuré et des pauses ponctuelles ; ElevenLabs positionne Multilingual v2 pour le long format et permet de relier les segments avec previous_text / next_text.
Commencez par Gemini si le texte exact, WAV/raw PCM ou des tours structurés à deux voix sont prioritaires. Commencez par ElevenLabs si le choix de voix et la continuité entre segments comptent davantage ; changez de candidat principal si le timbre dérive entre chapitres, si des mots critiques sont mal lus ou si les régénérations se multiplient.
Phrases courtes en volume : Gemini Flash-Lite et ElevenLabs Flash/Turbo d’abord
Pour catalogues, notifications et interfaces, comparez d’abord gemini-3.8-flash-lite-tts à ElevenLabs Flash/Turbo. Les deux sont positionnés pour réduire le coût ou augmenter le débit ; choisissez donc selon le coût par minute acceptée, pas le tarif affiché.
ElevenLabs est plus simple à budgéter quand la longueur du texte est stable et que la facturation par caractères vous convient. Gemini est plus direct si vous avez besoin de raw PCM, μ-law, A-law ou d’un suivi en tokens audio ; si relances et corrections effacent l’écart de prix, gardez l’option qui commet le moins d’erreurs.
Streaming existant : laisser le décodeur déterminer le premier test
Si votre produit utilise déjà OpenAI Speech API, testez d’abord gpt-4o-mini-tts, qui prend en charge le streaming par chunks et la sortie WAV ou PCM. Si la récitation exacte, le contrôle structuré et le raw PCM 24 kHz comptent davantage, testez d’abord Gemini.
Placez ElevenLabs Flash en tête lorsque faible latence et large choix de voix sont essentiels. Changez d’orientation si les erreurs d’accent russe ou le nettoyage augmentent la latence et le coût de bout en bout, même si le premier son arrive vite.
Téléphonie et SVI : Gemini et ElevenLabs d’abord
Pour la téléphonie et le SVI, testez d’abord Gemini et ElevenLabs, capables de renvoyer directement μ-law ou A-law et d’éviter une transcodification. Toute erreur sur montant, date, nom ou code doit être éliminatoire : une voix agréable ne compense pas une information fausse.
Ajoutez OpenAI seulement si une chaîne fiable de transcodage PCM existe déjà. Sinon, réutiliser une API familière peut créer plus de conversion et de diagnostic qu’elle n’en économise.
Deux voix ou davantage : Gemini pour deux, Eleven v3 au-delà
Avec deux rôles fixes, testez d’abord Gemini 3.8 ; avec davantage de locuteurs ou un dialogue plus dramatique, testez d’abord Eleven v3. Changez de choix si les voix russes ne conviennent pas aux rôles, si les locuteurs se mélangent ou si les longs tours perdent leur continuité.
Voix de marque ou clonée : les droits avant le son
Écartez d’abord toute option qui ne respecte pas consentement, conservation et usage commercial, puis testez le long format. Un clone techniquement convaincant n’est pas automatiquement autorisé à être publié, stocké ou monétisé.
Passer au pilote seulement après six vérifications
Un seul échec suffit à maintenir le candidat hors production jusqu’à correction ou remplacement.
- mots russes critiques, noms, montants et sigles sont correctement lus ;
- rythme et pauses sont contrôlables sans fuite des instructions dans l’audio ;
- trois requêtes identiques sont assez stables ;
- format et fréquence d’échantillonnage conviennent au montage, au streaming ou à la téléphonie ;
- droits commerciaux et obligation de signaler la voix synthétique sont compris ;
- le coût inclut toutes les générations et est divisé par la durée acceptée ;
- modèle et tarif ont été revérifiés juste avant la production.
Réduisez le premier tour à deux candidats et notez à l’aveugle trois exécutions du même script. Commencez le long format avec Gemini Flash et ElevenLabs Multilingual v2, les phrases courtes en volume avec Flash-Lite et Flash/Turbo, et la téléphonie avec Gemini et ElevenLabs ; ne gardez que l’option qui lit correctement les données critiques, reste stable et conserve un coût par minute acceptée maîtrisable.
Références officielles
Vérifiées le 24 septembre 2026 :