Neuronale Sprachsynthese auf Russisch: TTS nach Aussprache, Pausen und Kosten auswählen
Eine anbieterneutrale Methode zur Auswahl von russischem TTS: realistisches Skript, Blindtest, Formatprüfung, dokumentierte Steuerung und Kosten pro akzeptierter Minute.
Inhalt

Sie haben vielleicht bereits mehrere russische TTS-Demos gehört: Alle klingen sauber, doch eigene Nachnamen, Beträge, Abkürzungen und lange Sätze können Fehler bei Betonung und Pausen sichtbar machen. Nach diesem Leitfaden wissen Sie, welches Paar zuerst getestet werden sollte, wie Sie dasselbe Skript blind bewerten und wie Wiederholungen sowie verworfene Takes in die Kosten je akzeptierter Minute eingehen.
Beginnen Sie so: Für lange russische Inhalte vergleichen Sie gemini-3.8-flash-tts mit ElevenLabs Multilingual v2; für viele kurze Ausgaben gemini-3.8-flash-lite-tts mit ElevenLabs Flash/Turbo; für Telefonie und IVR zunächst Gemini und ElevenLabs, da beide direkte μ-law- und A-law-Ausgabe dokumentieren. Nehmen Sie gpt-4o-mini-tts hinzu, wenn Ihre Audiokette bereits OpenAI nutzt oder dessen Streaming und Formate benötigt, lassen Sie es aber Ihr russisches Skript bestehen, weil die eingebauten Stimmen für Englisch optimiert sind.
Die öffentliche Dokumentation enthält keinen unabhängigen Hörvergleich desselben russischen Skripts über diese Dienste hinweg. Nutzen Sie die offiziellen Funktionen und Preise für die erste Auswahl und lassen Sie anschließend Ihr Skript, die Blindbewertung und die tatsächliche Rechnung entscheiden; Modelle, Formate und Preise wurden am 24. September 2026 geprüft und müssen vor der Produktion erneut kontrolliert werden.
Zuerst nach Russisch, Steuerung, Format und Abrechnung filtern
Schließen Sie jede Option aus, die eines dieser vier Kriterien verfehlt, bevor Sie Zeit in Hörtests investieren.
- Russisch ist ausdrücklich dokumentiert. Die Sprachunterstützung qualifiziert ein Modell für den Test, beweist aber weder korrekte Wortbetonung noch natürliche Prosodie.
- Die Steuerungsmethode passt zum Workflow. Es muss klar sein, wo Tempo, Ton und Pausen angegeben werden und ob solche Anweisungen versehentlich gesprochen werden können.
- Das Ausgabeformat passt in die Verarbeitungskette. WAV oder MP3 reichen oft für den Schnitt, Raw PCM kann für Streaming wichtig sein, und Telefonie benötigt häufig μ-law oder A-law.
- Die Abrechnungseinheit lässt sich messen. Ein Dienst kann Zeichen, Texttokens, Audiotokens oder Sekunden berechnen. „Ab X Dollar pro Minute“ ist erst dann ein Produktionsbudget, wenn Wiederholungen und verworfene Takes enthalten sind.
Mit der Tabelle das erste Testpaar wählen
Alle drei Dienste können in einen Russisch-Test aufgenommen werden, unterscheiden sich aber bei Steuerung, Formaten und Abrechnung. Die Tabelle bestimmt, was zuerst getestet wird, nicht den Klanggewinner.
| Anbieter | Modelle und Russisch-Unterstützung | Steuerung der Sprechweise | Ausgabeformate | Preisstand 24.09.2026 |
|---|---|---|---|---|
| Google Gemini | gemini-3.8-flash-tts und gemini-3.8-flash-lite-tts; Russisch ist für beide aufgeführt | Durchgehender Stil in speech_metadata.style; punktuelle Pausen und Lautereignisse mit Tags wie <short pause> | Normale Anfrage: WAV, 24 kHz, mono, 16 Bit; Streaming: Raw PCM; außerdem μ-law und A-law | Standard-Ausgabe bis 31.12.2026: $9 bzw. $6 pro 1 Mio. Audiotokens; 25 Tokens pro Sekunde |
| OpenAI | gpt-4o-mini-tts, zusätzlich tts-1 und tts-1-hd; Russisch steht in der Sprachenliste | Anweisungen können Akzent, Geschwindigkeit, Intonation, emotionale Bandbreite, Ton und Flüstern steuern | MP3, Opus, AAC, FLAC, WAV und Raw PCM mit 24 kHz; Streaming verfügbar | Der offizielle TTS-Leitfaden nennt keinen aktuellen Preis; am Testtag Live-Preisseite oder Rechnung erfassen |
| ElevenLabs | Eleven v3, v3 Conversational, Multilingual v2 und Flash/Turbo; Russisch ist für Multilingual v2 und Flash v2.5 dokumentiert | Textkontext, Stability und Similarity; seed verbessert Wiederholbarkeit; previous_text / next_text verbinden Abschnitte | MP3, PCM, μ-law, A-law und Opus | $0.10 pro 1.000 Zeichen bei v3 und Multilingual; $0.05 bei v3 Conversational und Flash/Turbo; ohne Steuern |
Herstellerformulierungen wie „Studioqualität“, „am stabilsten für lange Texte“ oder „höchste Klangtreue“ sind nur Hinweise für die Vorauswahl. Behalten Sie einen Kandidaten nur, wenn Ihr russisches Skript kritische Daten korrekt wiedergibt, drei Durchläufe stabil genug sind und die Korrektur nicht zu teuer wird.
Das Testskript muss Ihre reale Aufgabe abbilden
Verwenden Sie weder einen zufälligen Absatz noch einen Werbesatz des Anbieters. Das Skript sollte eine verkleinerte Version der realen Aufgabe sein. Bei einem Kurs gehören Fachbegriffe und längere Erklärungen hinein, im E-Commerce Artikelnummern, Beträge und Adressen, bei IVR kurze Befehle, Namen und Nummern.
Die erste Version sollte neutral sein: ohne anbieterspezifische Tags und ohne manuelle Bearbeitung. Der folgende Abschnitt eignet sich als Ausgangspunkt. Er bleibt in allen Sprachversionen dieses Artikels absichtlich russisch, weil genau die russische Aussprache getestet werden soll:
Добрый вечер! Заказ № 1847 готов к выдаче 5 октября в 18:30.
Сумма — 1 250 рублей 50 копеек. Код подтверждения: А-7-Б-9.
В письме указаны адреса example.ru/support и support@example.ru.
Сначала откройте за́мок, затем осмотрите старинный замо́к.
Компания ООО «Северный ветер» выпустила API для CRM и IoT.
Анна сказала: «Подождите… Я проверю данные и перезвоню через две минуты».
Damit werden mehrere Problemfelder gleichzeitig geprüft:
- Datum, Uhrzeit, Betrag, Dezimalwerte und Zeichenfolge;
- russische Abkürzungen, lateinische Buchstaben, URL und E-Mail-Adresse;
- zwei Lesarten derselben Schreibweise mit unterschiedlicher Betonung;
- kurze und lange Pausen;
- Wechsel von Erzählung zu direkter Rede;
- russische Personen- und Organisationsnamen.
Ergänzen Sie fünf bis zehn Begriffe, die für das eigene Produkt entscheidend sind: Namen von Fachleuten, Städte, Marken sowie medizinisches, juristisches oder technisches Vokabular. Speichern Sie eine Referenzlesung, die gewünschte Betonung, Zahlenaussprache und Behandlung von Abkürzungen festlegt. Ohne Lösungsschlüssel wird aus der Bewertung schnell eine Geschmacksdiskussion.
Drei unoptimierte Durchläufe zeigen die Stabilität
Fixieren Sie für jeden Kandidaten Modell, Stimme, Geschwindigkeit, Format und alle weiteren Parameter. Generieren Sie exakt denselben unkorrigierten Text und wiederholen Sie den Vorgang zweimal mit identischen Einstellungen. Die drei Ausgaben sollen nicht die Möglichkeit geben, den glücklichsten Take herauszupicken, sondern die Streuung zeigen.
Benennen Sie die Dateien A1, A2, A3, B1 und so weiter, damit die Hörer den Anbieter nicht erkennen. Mindestens zwei russische Muttersprachler sollten unabhängig bewerten. Bei Fachinhalten sollte eine Person die entsprechende Terminologie kennen.
Eine einfache Skala von 0 bis 2 genügt:
| Kriterium | 0 Punkte | 1 Punkt | 2 Punkte |
|---|---|---|---|
| Aussprache und Betonung | Ein Fehler verändert die Bedeutung oder erzwingt einen neuen Take | Deutliches, aber behebbares Problem | Alle kritischen Wörter sind korrekt |
| Zahlen, Daten und Abkürzungen | Angaben fehlen oder werden verfälscht | Ausgangstext muss umgeschrieben werden | Keine Korrektur nötig |
| Pausen und Satzgrenzen | Sinneinheiten laufen zusammen | Brauchbarer Rhythmus, aber Schnitt nötig | Pausen entsprechen der Absicht |
| Stabilität über drei Durchläufe | Wörter, Timbre oder Rhythmus ändern sich deutlich | Geringe Abweichungen | Vorhersagbares Ergebnis |
| Audioartefakte | Klicks, Wiederholungen, Abbrüche oder klarer Fehler | Kleine Mängel | Keine offensichtlichen Mängel |
| Produktionsreife | Neugenerierung und Schnitt erforderlich | Eine der beiden Maßnahmen nötig | Datei kann sofort akzeptiert werden |
Legen Sie Ausschlusskriterien fest, bevor Sie Punkte addieren. Ein falsch gesprochener Betrag kann eine Bank-IVR-Aufnahme disqualifizieren, auch wenn die Stimme angenehm ist. In einem Hörbuch ist ein einzelner Fehler bei einem seltenen Namen eventuell korrigierbar, ein wechselndes Timbre zwischen Kapiteln dagegen nicht.
In Runde zwei kritische Fehler beheben, nicht endlos optimieren
Der Basistest zeigt, was das Modell ohne Hilfe leistet. Die zweite Runde soll messen, wie viel Arbeit eine Korrektur kostet – nicht, wie lange man optimieren kann, bis zufällig ein guter Take entsteht.
Google Gemini TTS
Gemini 3.8 behandelt das Feld text als wörtliches Transkript. Dauerhafte Hinweise wie „ruhig, langsam und sicher“ gehören in speech_metadata.style, damit sie nicht vorgelesen werden. Eine punktuelle Pause lässt sich als <short pause> in den Text setzen. Die Dokumentation empfiehlt außerdem englische Namen für Inline-Tags, selbst wenn das Skript nicht englisch ist.
Eine nicht gestreamte Anfrage liefert eine vollständige WAV-Datei mit RIFF-Header: 24 kHz, mono, 16-Bit signed little-endian PCM. Streaming gibt standardmäßig headerloses Raw audio/l16 mit denselben grundlegenden Parametern zurück. Für Telefonie können audio/mulaw oder audio/alaw sowie eine gewünschte Abtastrate angefordert werden.
Beide 3.8-Modelle verwenden dasselbe API-Schema. Google positioniert gemini-3.8-flash-tts für höhere Klangtreue, ausdrucksstarke Steuerung, schwierige Aussprachen und lange Inhalte, gemini-3.8-flash-lite-tts dagegen für hohe Volumina, geringe Latenz und niedrigere Kosten. Bis zum eigenen russischen Test bleibt das Anbieterorientierung.
OpenAI Speech API
Bei gpt-4o-mini-tts können Anweisungen Akzent, Geschwindigkeit, Intonation, emotionale Bandbreite, Ton und Flüstern steuern. Russisch ist in der Liste der unterstützten Sprachen enthalten, doch die Dokumentation weist darauf hin, dass die integrierten Stimmen für Englisch optimiert sind. Ein russischer Test ist deshalb unverzichtbar, besonders bei regionaler Aussprache, Nachnamen und Fachwörtern.
Standardmäßig gibt die API MP3 aus; außerdem werden Opus, AAC, FLAC, WAV und Raw PCM mit 24 kHz unterstützt. Für schnellere Reaktion empfiehlt der Leitfaden WAV oder PCM. Streaming erlaubt die Wiedergabe, bevor die gesamte Datei fertig ist.
Zusätzlich ist eine Produktanforderung zu berücksichtigen: OpenAI verlangt einen klaren Hinweis an Endnutzer, dass die Stimme KI-generiert und keine menschliche Stimme ist.
ElevenLabs
Der offizielle Leitfaden führt Russisch für Multilingual v2 und Flash v2.5 auf und empfiehlt eine Stimme mit passendem Sprach- und Regionalakzent. Beschreibende Wendungen wie „sagte sie aufgeregt“ können die Darbietung beeinflussen, werden aber ebenfalls gesprochen; sie müssen entfernt, umformuliert oder herausgeschnitten werden.
Ausgabe ist als MP3, PCM, μ-law, A-law oder Opus möglich. Die Modelle sind nicht deterministisch: seed kann die Wiederholbarkeit verbessern, garantiert aber kein identisches Audio. Für lange Texte empfiehlt die Dokumentation Segmentierung und die Übergabe von previous_text / next_text oder benachbarten Request-IDs, um prosodische Kontinuität zu bewahren.
Bis zu zwei kostenlose Neugenerierungen gelten nur, wenn Text, Stimme und sämtliche Parameter exakt gleich bleiben. Jede Änderung erzeugt eine neue kostenpflichtige Generierung. Laut Dokumentation erfordern kommerzielle Nutzungsrechte außerdem einen bezahlten Tarif.
Wiederholungen und Ausschuss in die Kosten je akzeptierter Minute einrechnen
Nur die erste Anfrage zu zählen unterschätzt die tatsächlichen Kosten. Teilen Sie sämtliche Generierungsausgaben des Elements durch die Dauer des Audios, das Sie wirklich akzeptieren.
Kosten je akzeptierter Minute = sämtliche Generierungsausgaben des Elements ÷ akzeptierte Audiodauer in Minuten.
Bezahlte Alternativen, Wiederholungen nach Skriptänderungen und verworfene Takes gehören in den Zähler. Erfassen Sie Bearbeitungszeit separat, damit API-Preis und menschliche Arbeit sichtbar bleiben.
Beispiel Google Gemini
Google nennt 25 Audiotokens pro Sekunde; eine generierte Minute entspricht 1.500 Audiotokens. Beim Standard-Tarif bis 31. Dezember 2026 gilt:
gemini-3.8-flash-tts: $9 pro 1 Mio. Ausgabetokens, also $0.0135 pro generierter Minute, zuzüglich Texteingabe;gemini-3.8-flash-lite-tts: $6 pro 1 Mio., also $0.009 pro generierter Minute, zuzüglich Eingabe.
Bei Batch/Flex kostet die Ausgabe ungefähr $0.00675 bzw. $0.0045 pro Minute, bei Priority $0.0243 bzw. $0.0162. Laut offizieller Tabelle verdoppeln sich diese Sätze ab 1. Januar 2027.
Wenn drei einminütige Flash-Lite-Takes erzeugt und nur einer akzeptiert wird, liegen die Ausgabekosten pro akzeptierter Minute bereits bei etwa $0.027 statt $0.009. Eingabetokens, Steuern und weitere Rechnungsposten kommen hinzu.
Beispiel ElevenLabs
ElevenLabs berechnet TTS nach Zeichen, nicht nach Audiodauer:
- v3 und Multilingual: $0.10 pro 1.000 Zeichen;
- v3 Conversational und Flash/Turbo: $0.05 pro 1.000 Zeichen.
Ein Skript mit 1.200 Zeichen kostet pro Generierung $0.12 bzw. $0.06. Wenn eine finale einminütige Datei drei bezahlte Generierungen benötigt, betragen die Kosten der akzeptierten Minute $0.36 bzw. $0.18. Dieselben 1.200 russischen Zeichen können jedoch 50 oder 90 Sekunden dauern. Verwenden Sie deshalb die tatsächliche Dauer der akzeptierten Datei. Die ungefähren Minutenwerte auf der Preisseite sind Durchschnittswerte, keine Messung des eigenen russischen Sprechtempos.
Umgang mit dem OpenAI-Preis
Der OpenAI-TTS-Leitfaden beschreibt Modelle, Steuerung und Formate, nennt aber keinen aktuellen Preis. Übertragen Sie am Testtag tatsächliche Nutzung und Kosten von der gültigen Preisseite oder Rechnung in dieselbe Tabelle; ein alter Tarif oder der Preis eines anderen Audioprodukts würde nur scheinbar präzise vergleichen.
Das erste Testpaar nach Einsatz wählen
Sie müssen in der ersten Runde nicht jeden Dienst testen. Wählen Sie zwei nach Inhaltslänge, Ausgabekette und tolerierbarem Korrekturaufwand; erweitern Sie die Liste nur, wenn beide scheitern.
Lange Kurse, Podcasts und Hörbücher: zuerst Gemini Flash und Multilingual v2
Für lange russische Inhalte vergleichen Sie zuerst gemini-3.8-flash-tts mit ElevenLabs Multilingual v2. Gemini bietet wörtliche Skripte, strukturierte Stilsteuerung und punktuelle Pausen; ElevenLabs positioniert Multilingual v2 für lange Inhalte und verbindet Segmente über previous_text / next_text.
Beginnen Sie mit Gemini, wenn exakter Text, WAV/raw PCM oder strukturierte Zwei-Sprecher-Turns am wichtigsten sind. Beginnen Sie mit ElevenLabs, wenn Stimmenauswahl und Übergänge zwischen Segmenten wichtiger sind; wechseln Sie den Hauptkandidaten bei Timbre-Drift zwischen Kapiteln, falsch gesprochenen Schlüsselwörtern oder häufigen Neugenerierungen.
Viele kurze Texte: zuerst Gemini Flash-Lite und ElevenLabs Flash/Turbo
Für Katalogtexte, Hinweise und UI-Ausgaben vergleichen Sie zuerst gemini-3.8-flash-lite-tts mit ElevenLabs Flash/Turbo. Beide werden für geringere Kosten oder hohen Durchsatz positioniert; entscheiden Sie deshalb nach Kosten je akzeptierter Minute statt nach Listenpreis.
ElevenLabs lässt sich leichter kalkulieren, wenn die Textlänge stabil ist und Zeichenabrechnung passt. Gemini ist direkter, wenn raw PCM, μ-law, A-law oder Audiotoken-Protokollierung benötigt werden; wenn Wiederholungen und manuelle Korrekturen den Preisvorteil aufzehren, wählen Sie die fehlerärmere Option.
Bestehendes Streaming: der Decoder bestimmt den ersten Test
Wenn Ihr Produkt bereits OpenAI Speech API nutzt, testen Sie zuerst gpt-4o-mini-tts, da es Chunked Streaming und WAV- oder PCM-Ausgabe unterstützt. Wenn exakte Rezitation, strukturierte Steuerung und raw PCM mit 24 kHz wichtiger sind, testen Sie zuerst Gemini.
Setzen Sie ElevenLabs Flash an erste Stelle, wenn geringe Latenz und große Stimmenauswahl zentral sind. Wechseln Sie, wenn russische Betonungsfehler oder Nachbearbeitung die End-to-End-Latenz und Kosten erhöhen, auch wenn der erste Ton schnell kommt.
Telefonie und IVR: zuerst Gemini und ElevenLabs
Für Telefonie und IVR testen Sie zuerst Gemini und ElevenLabs, da beide μ-law oder A-law direkt liefern und eine Transkodierung sparen. Falsche Beträge, Daten, Namen oder Bestätigungscodes sind Ausschlussgründe; eine angenehme Stimme gleicht falsche Information nicht aus.
Nehmen Sie OpenAI nur hinzu, wenn bereits eine zuverlässige PCM-Transkodierung existiert. Andernfalls kann die Wiederverwendung einer vertrauten API mehr Konvertierungs- und Diagnosearbeit erzeugen als einsparen.
Zwei oder mehr Sprecher: Gemini für zwei, Eleven v3 für mehr
Bei genau zwei festen Rollen testen Sie zuerst Gemini 3.8; bei mehr Sprechern oder dramatischerem Dialog zuerst Eleven v3. Ändern Sie die Wahl, wenn russische Stimmen nicht zu den Rollen passen, Sprecher ineinanderlaufen oder lange Turns ihre Kontinuität verlieren.
Marken- oder Klonstimme: Rechte vor Klang
Schließen Sie zuerst jede Option aus, die Einwilligung, Aufbewahrung und kommerzielle Nutzung nicht erfüllt, und testen Sie danach lange Inhalte. Ein technisch überzeugender Klon ist nicht automatisch für Veröffentlichung, Speicherung oder Monetarisierung freigegeben.
Erst nach sechs bestandenen Prüfungen in den Pilotbetrieb
Ein einziger nicht bestandener Punkt hält den Kandidaten aus der Produktion, bis er behoben oder ersetzt wurde.
- kritische russische Wörter, Namen, Beträge und Abkürzungen werden korrekt gesprochen;
- Tempo und Pausen lassen sich steuern, ohne dass Anweisungen in der Aufnahme landen;
- drei identische Anfragen sind für den Einsatzzweck stabil genug;
- Format und Abtastrate passen zu Schnitt, Streaming oder Telefonie;
- kommerzielle Rechte und Kennzeichnungspflichten für synthetische Stimmen sind geklärt;
- die Kosten enthalten alle Generierungen und werden durch die akzeptierte Dauer geteilt;
- Modellkennung und Preis wurden unmittelbar vor der Produktion erneut geprüft.
Begrenzen Sie die erste Runde auf zwei Kandidaten und lassen Sie drei Durchläufe desselben Skripts blind bewerten. Beginnen Sie bei langen Inhalten mit Gemini Flash und ElevenLabs Multilingual v2, bei vielen kurzen Texten mit Flash-Lite und Flash/Turbo und bei Telefonie mit Gemini und ElevenLabs; behalten Sie nur die Option, die kritische Daten korrekt liest, stabil bleibt und kontrollierbare Kosten je akzeptierter Minute liefert.
Offizielle Quellen
Geprüft am 24. September 2026: