러시아어 신경망 음성 합성 선택법: 발음·쉼·채택 음성 1분당 비용으로 TTS 평가하기
홍보용 데모에 의존하지 않고 러시아어 TTS를 고르는 방법입니다. 동일 원고의 블라인드 평가, 형식 점검, 공급사별 제어 방식, 채택 음성 1분당 비용 계산을 다룹니다.
목차

러시아어 TTS 데모를 여러 개 들어 보면 모두 매끄럽게 들릴 수 있습니다. 하지만 실제 원고의 성씨, 금액, 약어, 긴 문장을 넣으면 강세와 쉼 오류가 드러날 수 있습니다. 이 글을 읽고 나면 첫 시험에서 어떤 두 후보를 비교할지, 같은 원고를 어떻게 블라인드 평가할지, 재생성과 폐기본까지 포함한 채택 음성 1분당 비용을 어떻게 계산할지 알 수 있습니다.
첫 후보는 이렇게 좁히면 됩니다. 긴 러시아어 음성은 gemini-3.8-flash-tts와 ElevenLabs Multilingual v2, 대량의 짧은 문장은 gemini-3.8-flash-lite-tts와 ElevenLabs Flash/Turbo, 전화·IVR은 μ-law와 A-law를 직접 출력하는 Gemini와 ElevenLabs부터 시험합니다. 기존에 OpenAI 오디오 스택을 쓰거나 그 스트리밍·출력 형식이 필요하면 gpt-4o-mini-tts를 추가하되, 내장 음성이 영어에 최적화돼 있으므로 반드시 자신의 러시아어 원고를 통과시켜야 합니다.
공개 문서에는 같은 러시아어 원고를 이 서비스들에서 독립 비교한 청취 결과가 없습니다. 아래의 공식 기능과 가격으로 첫 시험 대상을 정한 뒤, 자신의 원고·블라인드 청취·실제 청구액으로 결정하십시오. 모델, 형식, 가격은 2026년 9월 24일 기준이며 제작 직전에 다시 확인해야 합니다.
먼저 러시아어 지원·제어·형식·과금 네 조건으로 거른다
네 조건 중 하나라도 통과하지 못하면 청취에 시간을 쓰기 전에 제외합니다.
- 공식 문서에 러시아어가 명시돼 있어야 합니다. 언어 지원은 테스트에 들어갈 자격일 뿐, 강세와 억양의 정확성을 증명하지 않습니다.
- 발화 제어 방식이 작업 흐름에 맞아야 합니다. 속도, 톤, 쉼을 어디에 지정하는지, 제어 지시가 음성으로 읽힐 가능성이 있는지 확인합니다.
- 출력 형식이 기존 파이프라인과 맞아야 합니다. 편집에는 WAV나 MP3면 충분할 수 있지만, 스트리밍에는 Raw PCM, 전화에는 μ-law나 A-law가 필요할 수 있습니다.
- 과금 단위를 측정할 수 있어야 합니다. 문자, 텍스트 token, 오디오 token, 초 등 서비스마다 다릅니다. “분당 약 X달러”는 재생성과 폐기본을 포함하기 전까지 제작 예산이 아닙니다.
이 표로 첫 시험 두 후보를 정한다
세 서비스 모두 러시아어 시험 대상이 될 수 있지만 제어 방식, 출력 형식, 과금 단위가 다릅니다. 이 표는 무엇을 먼저 시험할지 정하는 데 쓰고 음질 순위를 매기는 데 쓰지 않습니다.
| 공급사 | 모델과 러시아어 지원 | 발화 제어 | 출력 형식 | 2026-09-24 확인 가격 |
|---|---|---|---|---|
| Google Gemini | gemini-3.8-flash-tts, gemini-3.8-flash-lite-tts; 두 모델 모두 러시아어 명시 | 지속 스타일은 speech_metadata.style, 순간 쉼과 발성 이벤트는 <short pause> 같은 태그 | 일반 요청은 24 kHz, mono, 16-bit WAV; 스트리밍은 Raw PCM; μ-law와 A-law도 지원 | 2026-12-31까지 Standard 출력은 100만 오디오 token당 $9 또는 $6; 초당 25 token |
| OpenAI | gpt-4o-mini-tts, 그 외 tts-1, tts-1-hd; 지원 언어 목록에 러시아어 | instructions로 억양, 속도, 인토네이션, 감정 범위, 톤, 속삭임 제어 | MP3, Opus, AAC, FLAC, WAV, 24 kHz Raw PCM; 스트리밍 지원 | 공식 TTS 안내서에는 현재 단가가 없으므로 시험 당일 가격 페이지나 실제 청구액을 기록 |
| ElevenLabs | Eleven v3, v3 Conversational, Multilingual v2, Flash/Turbo; Multilingual v2와 Flash v2.5에 러시아어 명시 | 텍스트 맥락, Stability, Similarity; seed로 재현성을 높이고 previous_text / next_text로 구간 연결 | MP3, PCM, μ-law, A-law, Opus | v3와 Multilingual은 1,000자당 $0.10, v3 Conversational과 Flash/Turbo는 $0.05; 세금 별도 |
“스튜디오급”, “장문에서 가장 안정적”, “최고 충실도” 같은 표현은 초기 후보를 만드는 단서일 뿐입니다. 자신의 러시아어 원고에서 핵심 정보를 정확히 읽고, 세 번의 결과가 충분히 안정적이며, 수정 비용이 감당 가능한 후보만 남기십시오.
테스트 원고는 실제 작업을 그대로 축소해야 한다
무작위 문단이나 공급사의 데모 문구를 쓰지 마십시오. 실제 업무를 축소한 원고를 만들어야 합니다. 강의라면 전문 용어와 긴 설명, 전자상거래라면 상품 번호·금액·주소, IVR이라면 짧은 명령·이름·숫자를 넣습니다.
첫 버전은 중립적으로 작성합니다. 특정 API 전용 태그나 수동 편집은 넣지 않습니다. 아래 러시아어 문장은 출발점으로 사용할 수 있습니다. 러시아어 발음을 시험하는 것이 목적이므로 이 글의 모든 번역본에서도 의도적으로 러시아어를 유지합니다.
Добрый вечер! Заказ № 1847 готов к выдаче 5 октября в 18:30.
Сумма — 1 250 рублей 50 копеек. Код подтверждения: А-7-Б-9.
В письме указаны адреса example.ru/support и support@example.ru.
Сначала откройте за́мок, затем осмотрите старинный замо́к.
Компания ООО «Северный ветер» выпустила API для CRM и IoT.
Анна сказала: «Подождите… Я проверю данные и перезвоню через две минуты».
이 원고는 다음을 한 번에 시험합니다.
- 날짜, 시간, 금액, 소수, 문자 순서
- 러시아어 약어, 라틴 문자, URL, 이메일
- 철자가 같지만 강세가 다른 단어
- 짧은 쉼과 긴 쉼
- 서술에서 직접 화법으로 전환
- 러시아어 인명과 조직명
제품에 중요한 단어를 5~10개 더 넣습니다. 전문가 성씨, 도시, 브랜드, 의료·법률·기술 용어 등이 좋습니다. 각 단어의 강세, 숫자 읽기, 약어 전개 방식을 적은 기준 답안도 함께 저장하십시오. 기준이 없으면 평가는 정확성보다 취향 논쟁으로 흐르기 쉽습니다.
조정 없이 세 번 생성해 변동성을 확인한다
각 후보에서 모델, 음성, 속도, 형식, 나머지 설정을 고정합니다. 수정하지 않은 동일 원고를 한 번 생성하고, 같은 설정으로 두 번 더 반복합니다. 세 개의 결과는 가장 운 좋은 테이크를 골라내기 위한 것이 아니라 변동성을 보기 위한 것입니다.
파일을 A1, A2, A3, B1처럼 바꿔 공급사를 숨깁니다. 최소 두 명의 러시아어 모어 화자가 독립적으로 점수를 매기게 합니다. 전문 콘텐츠라면 한 명은 해당 분야 용어를 이해해야 합니다.
0~2점 척도면 충분합니다.
| 기준 | 0점 | 1점 | 2점 |
|---|---|---|---|
| 발음과 강세 | 의미가 바뀌거나 다시 녹음해야 하는 오류 | 눈에 띄지만 수정 가능한 문제 | 핵심 단어가 모두 정확 |
| 숫자·날짜·약어 | 정보가 빠지거나 왜곡 | 원문을 다시 써야 함 | 수정 불필요 |
| 쉼과 문장 경계 | 의미 단위가 붙음 | 사용 가능하지만 편집 필요 | 의도한 쉼과 일치 |
| 세 번의 안정성 | 단어, 음색, 리듬이 크게 변함 | 작은 차이 | 예측 가능 |
| 오디오 결함 | 클릭, 반복, 잘림, 명확한 실패 | 작은 결함 | 눈에 띄는 결함 없음 |
| 사용 준비도 | 재생성과 편집 모두 필요 | 둘 중 하나 필요 | 즉시 채택 가능 |
총점을 계산하기 전에 탈락 조건을 정합니다. 은행 IVR에서 금액을 틀리게 읽으면 목소리가 좋아도 탈락할 수 있습니다. 오디오북에서는 희귀 성씨 한 번의 오류는 고칠 수 있지만 장 사이에 음색이 달라지는 문제는 허용하기 어려울 수 있습니다.
두 번째 라운드는 핵심 오류만 고치고 끝없이 조정하지 않는다
기준 테스트는 도움 없이 모델이 무엇을 하는지 보여줍니다. 두 번째 라운드는 문제를 수정하는 데 필요한 작업량을 측정해야 합니다. 우연히 좋은 결과가 나올 때까지 무제한으로 튜닝하는 시험이 되어서는 안 됩니다.
Google Gemini TTS
Gemini 3.8은 text 필드를 그대로 읽어야 하는 원고로 취급합니다. “차분하고, 느리며, 자신 있게”처럼 전체 구간에 적용되는 지시는 speech_metadata.style에 넣어 음성으로 읽히지 않게 합니다. 순간적인 쉼은 원고에 <short pause>로 삽입할 수 있습니다. 공식 문서는 원고가 영어가 아니어도 인라인 태그 이름은 영어를 쓰는 것을 권장합니다.
비스트리밍 요청은 RIFF 헤더가 있는 완전한 WAV를 반환합니다. 24 kHz, mono, 16-bit signed little-endian PCM입니다. 스트리밍은 같은 기본 사양의 헤더 없는 Raw audio/l16을 기본으로 반환합니다. 전화 용도에서는 audio/mulaw 또는 audio/alaw와 샘플 레이트를 지정할 수 있습니다.
두 3.8 모델은 같은 API 스키마를 사용합니다. Google은 gemini-3.8-flash-tts를 높은 충실도, 표현 제어, 어려운 발음, 장문용으로, gemini-3.8-flash-lite-tts를 대량 처리, 낮은 지연, 낮은 비용용으로 설명합니다. 자체 러시아어 테스트로 확인하기 전에는 공급사 가이드로만 취급합니다.
OpenAI Speech API
gpt-4o-mini-tts에서는 instructions로 억양, 속도, 인토네이션, 감정 범위, 톤, 속삭임을 조절할 수 있습니다. 러시아어는 지원 언어 목록에 있지만, 공식 문서는 내장 음성이 영어에 최적화되어 있다고도 밝힙니다. 지역 억양, 성씨, 전문 용어가 중요하다면 러시아어 원고 테스트가 필수입니다.
기본 출력은 MP3이며 Opus, AAC, FLAC, WAV, 24 kHz Raw PCM도 지원합니다. 빠른 응답을 원할 때는 WAV 또는 PCM을 권장합니다. 스트리밍을 사용하면 전체 파일이 완성되기 전에 재생을 시작할 수 있습니다.
제품 요구사항도 있습니다. OpenAI는 사용자가 듣는 음성이 사람이 아니라 AI로 생성된 것임을 명확히 고지하도록 요구합니다.
ElevenLabs
공식 가이드는 Multilingual v2와 Flash v2.5에 러시아어를 명시하고, 대상 언어와 지역에 맞는 억양의 음성을 선택하라고 권합니다. “흥분해서 말했다” 같은 설명 문구는 연기에 영향을 줄 수 있지만 그 문구 자체도 발화됩니다. 사용한다면 삭제, 재작성 또는 후편집이 필요합니다.
출력은 MP3, PCM, μ-law, A-law, Opus를 지원합니다. 모델은 비결정적입니다. seed는 재현성을 높일 수 있지만 동일한 오디오를 보장하지 않습니다. 장문에서는 텍스트를 나누고 previous_text / next_text 또는 인접 요청 ID를 전달해 운율의 연속성을 유지하라고 문서가 안내합니다.
무료 재생성은 최대 두 번이지만, 텍스트, 음성, 모든 파라미터가 완전히 같을 때만 적용됩니다. 글이나 설정을 바꾸면 새로운 유료 생성입니다. 상업적 사용권은 유료 플랜에서만 제공된다고 공식 문서에 나와 있습니다.
재생성과 폐기본을 채택 1분 비용에 포함한다
첫 요청만 계산하면 실제 비용을 체계적으로 낮게 보게 됩니다. 해당 콘텐츠에 든 모든 생성 비용을 실제로 채택한 음성 길이로 나누십시오.
채택 음성 1분당 비용 = 해당 콘텐츠의 모든 생성 비용 ÷ 채택된 음성의 분수.
유료 대안, 원고 수정 후 재요청, 폐기본을 모두 분자에 넣습니다. 편집 시간은 따로 기록해 API 요금과 사람의 작업 비용을 함께 확인합니다.
Google Gemini 계산 예시
Google은 오디오 1초를 25 오디오 token으로 계산하므로 1분은 1,500 token입니다. 2026년 12월 31일까지 Standard 가격은 다음과 같습니다.
gemini-3.8-flash-tts: 출력 100만 오디오 token당 $9, 즉 생성 1분당 $0.0135와 입력 텍스트 비용gemini-3.8-flash-lite-tts: 출력 100만 오디오 token당 $6, 즉 생성 1분당 $0.009와 입력 텍스트 비용
Batch/Flex는 약 $0.00675와 $0.0045, Priority는 약 $0.0243과 $0.0162입니다. 공식 가격표에서는 2027년 1월 1일부터 이 요금이 두 배가 됩니다.
Flash-Lite로 1분짜리 세 개를 만들고 하나만 채택하면, 출력 부분의 채택 1분 비용은 이미 약 $0.027이며 $0.009가 아닙니다. 입력 token, 세금, 기타 실제 청구 항목을 추가합니다.
ElevenLabs 계산 예시
ElevenLabs TTS는 음성 길이가 아니라 문자 수로 과금합니다.
- v3와 Multilingual: 1,000자당 $0.10
- v3 Conversational과 Flash/Turbo: 1,000자당 $0.05
1,200자 원고의 1회 생성은 $0.12 또는 $0.06입니다. 최종 1분 음성을 얻기 위해 세 번 유료 생성했다면 채택 1분 비용은 $0.36 또는 $0.18입니다. 그러나 같은 러시아어 1,200자라도 50초 또는 90초가 될 수 있습니다. 채택된 파일의 실제 길이로 계산해야 합니다. 가격 페이지의 “분당 약” 수치는 평균 환산이며 자체 러시아어 말하기 속도 측정이 아닙니다.
OpenAI 가격 처리 방법
OpenAI TTS 안내서는 모델, 제어 방식, 형식을 설명하지만 현재 단가는 제시하지 않습니다. 시험 당일 유효한 가격 페이지나 청구서에서 실제 사용량과 금액을 같은 표에 기록하십시오. 오래된 단가나 다른 오디오 제품의 가격을 쓰면 정밀해 보이지만 잘못된 비교가 됩니다.
작업별로 첫 시험 두 후보를 고른다
첫 라운드에서 모든 서비스를 시험할 필요는 없습니다. 콘텐츠 길이, 출력 경로, 감당 가능한 수정 작업을 기준으로 두 개를 고르고 둘 다 실패할 때만 후보를 늘립니다.
긴 강의·팟캐스트·오디오북: Gemini Flash와 Multilingual v2부터
긴 러시아어 음성은 먼저 gemini-3.8-flash-tts와 ElevenLabs Multilingual v2를 비교합니다. Gemini는 축자 원고, 구조화된 스타일, 지점별 쉼을 제공하고, ElevenLabs는 Multilingual v2를 장문용으로 설명하며 previous_text / next_text로 구간을 연결합니다.
정확한 원고, WAV/raw PCM, 구조화된 두 화자 턴이 중요하면 Gemini부터 시작합니다. 음성 선택과 구간 연결이 더 중요하면 ElevenLabs부터 시작하고, 장 사이 음색 변화·핵심 단어 오독·잦은 재생성이 생기면 주 후보를 바꿉니다.
대량의 짧은 문장: Gemini Flash-Lite와 ElevenLabs Flash/Turbo부터
상품 정보, 알림, UI 문구는 먼저 gemini-3.8-flash-lite-tts와 ElevenLabs Flash/Turbo를 비교합니다. 둘 다 저비용 또는 고처리량용으로 소개되므로 표시 단가가 아니라 채택 1분 비용으로 선택합니다.
문자 길이가 일정하고 문자 과금이 편하면 ElevenLabs 예산을 잡기 쉽습니다. Raw PCM, μ-law, A-law 또는 오디오 token 기록이 필요하면 Gemini가 더 직접적입니다. 재생성과 수동 수정이 가격 차이를 없애면 오류가 적은 쪽을 고릅니다.
기존 스트리밍 스택: 디코더에 맞춰 첫 후보를 정한다
제품이 이미 OpenAI Speech API를 사용한다면 chunked streaming과 WAV/PCM 출력을 지원하는 gpt-4o-mini-tts부터 시험합니다. 축자 낭독, 구조화된 표현 제어, 24 kHz raw PCM이 더 중요하면 Gemini부터 시험합니다.
낮은 지연과 다양한 음성 선택이 핵심이면 ElevenLabs Flash를 먼저 시험합니다. 첫 음성이 빨라도 러시아어 강세 오류나 후처리가 전체 지연과 비용을 늘리면 후보를 바꿉니다.
전화·IVR: Gemini와 ElevenLabs부터
전화와 IVR은 μ-law 또는 A-law를 직접 반환해 추가 변환을 줄일 수 있는 Gemini와 ElevenLabs부터 시험합니다. 금액, 날짜, 이름, 확인 코드의 오독은 즉시 탈락 조건으로 두고, 자연스러운 음색으로 잘못된 정보를 허용하지 않습니다.
안정적인 PCM 변환 경로가 이미 있을 때만 OpenAI를 추가합니다. 그렇지 않으면 익숙한 API를 재사용하는 것이 변환과 장애 분석 작업을 오히려 늘릴 수 있습니다.
두 명 또는 여러 화자: 두 명은 Gemini, 그 이상은 Eleven v3
고정 역할이 두 명이면 Gemini 3.8부터, 화자가 더 많거나 극적인 대화가 필요하면 Eleven v3부터 시험합니다. 러시아어 음성이 역할에 맞지 않거나 화자가 섞이거나 긴 턴의 연결이 무너지면 다른 후보로 바꿉니다.
브랜드·복제 음성: 소리보다 권리를 먼저 확인한다
동의, 보관 조건, 상업적 사용을 충족하지 못하는 후보를 먼저 제외한 뒤 장문 품질을 시험합니다. 기술적으로 닮은 복제 음성을 만들었다고 해서 공개, 저장, 수익화 권한이 자동으로 생기지는 않습니다.
여섯 항목을 모두 통과한 뒤 파일럿으로 간다
한 항목이라도 실패하면 문제를 고치거나 후보를 바꿀 때까지 제작에 넣지 않습니다.
- 중요한 러시아어 단어, 성씨, 금액, 약어를 정확히 읽는다
- 지시 문구가 음성으로 새지 않고 속도와 쉼을 제어할 수 있다
- 동일 요청 세 번이 용도에 충분히 안정적이다
- 형식과 샘플 레이트가 편집, 스트리밍, 전화에 맞는다
- 상업적 사용권과 합성 음성 고지 요구사항을 이해했다
- 모든 생성을 포함한 비용을 채택 시간으로 나눴다
- 제작 직전에 모델 ID와 가격을 다시 확인했다
첫 라운드를 두 후보로 줄이고 같은 원고를 세 번 생성해 블라인드 평가하십시오. 긴 콘텐츠는 Gemini Flash와 ElevenLabs Multilingual v2, 대량의 짧은 문장은 Flash-Lite와 Flash/Turbo, 전화는 Gemini와 ElevenLabs부터 시작하고, 핵심 정보를 정확히 읽고 충분히 안정적이며 채택 1분 비용을 통제할 수 있는 후보만 남기십시오.
공식 출처
2026년 9월 24일 확인: