Question
現在の合成音声は、どのような問題を一段ずつ解いて成立したのか。音響、言語、韻律、話者、速度、対話という異なる課題を一つの「自然さ」にまとめず、何が可能になるたびに次のボトルネックがどこへ移ったかを追う。
Context
現在のTTSは、短い音声サンプルから話者性を反映し、多言語で表現を変え、生成した部分から再生を始められる。しかし、その一声の背後には、声を分析する方法、文字を発音へ変える規則、韻律のモデル、録音資産、統計推定、ニューラル波形生成、並列計算、通信基盤が重なっている。
歴史を振り返る目的は、現在を懐古的に説明することではない。性能を突然のブームに見せず、長期間に蓄積された技術が接続された結果として捉え、次の変化がどこから生まれるかを読むためである。
Evidence
1930年代:声を分解し、再構成する
Bell LabsのHomer Dudleyらが開発したVocoderは、音声を音響的な情報へ分解し、別の信号から再構成する考え方を示した。1939年に実演されたVoderでは、訓練された操作者が鍵盤とペダルで、音源、強さ、共鳴を制御して連続音声を作った。ここで解かれたのは、声を録音ではなく操作可能な信号として扱えるかという問題だった。
1950〜1980年代:音を任意の文章へ変える
フォルマント合成と規則ベースTTSは、文字解析、発音辞書、音素、持続時間、アクセント、イントネーションを組み合わせ、機械が任意の文章を読める方向を開いた。Klattの1987年の総説は、この進歩が音響音声学、言語理論、知覚心理、発話モデル、計算機の発達を横断した成果だったことを整理している。言葉として聞こえるようになると、次に読み方の人工性が問題になった。
1990年代:録音された自然さを選び直す
連結型、とりわけ大規模音声データベースから適切な断片を選ぶユニット選択方式は、実際の人間音声を活用して自然さを高めた。HuntとBlackは1996年、対象文脈への適合と断片間の接続品質をコストとして扱い、候補列を探索する方式を示した。特定話者の自然さが向上する一方、録音にない表現、話者追加、柔軟な制御が制約として残った。
2000年代:声を連続パラメータとして予測する
統計的パラメトリック音声合成は、音素の長さ、基本周波数、スペクトルなどを統計モデルから生成した。録音断片の有無に縛られず、話者や速度を制御しやすくなった反面、平均化された滑らかな音になりやすかった。Zen、Tokuda、Blackの2009年の総説は、当時主流だったユニット選択との長所・短所を対比している。
2016〜2020年:自然さ、統合、速度を別々に突破する
WaveNetは波形を生成モデルで直接扱い、声の微細な質感を学習できる可能性を示した。Tacotronは文字から音響表現までの複数工程を一つの学習系へ統合した。Deep VoiceはニューラルTTSを本番利用できる速度へ近づけ、実時間より速い推論を報告した。Glow-TTSなどの非自己回帰方式は、音響表現を並列生成し、長い発話と大量処理を高速化した。
Findings
各段の成功が、次の不足を見えるようにした
- 音声らしい音が出る — 次に、言葉として識別できるかが問われた。
- 任意の文章を読める — 次に、アクセントとイントネーションの不自然さが目立った。
- 特定話者らしく自然に読める — 次に、録音量と表現範囲の制約が現れた。
- 声をパラメータで制御できる — 次に、平均化された音質が問題になった。
- ニューラル生成で質感が上がる — 次に、計算量と生成開始の遅さが問題になった。
- 実時間より速く生成できる — 次に、ターン交替、割り込み、文脈適応が問われた。
- 対話へ接続できる — 次に、正確性、安全、権利、責任の設計が中心になった。
評価軸も技術とともに上位へ移った
初期には発話可能性と明瞭度、商用TTSでは自然さと安定性、ニューラルTTSでは話者性、表現、速度、現在の音声AIでは対話遅延、割り込み、目的達成、安全な引き継ぎが評価される。過去の基準が不要になったのではなく、新しい基準の前提条件として残っている。
TTSが意味を理解するのではなく、意味処理系の発話層になる
現在の音声AIでは、音声認識、発話終了判定、LLM、検索、業務システム、TTSがストリーミングで接続される。文脈に応じた返答を作るのはシステム全体であり、TTSはその結果を時間、話者、韻律を持つ音声へ変換する。自然な声と、正しい判断は別に評価しなければならない。
Structural implications
並列化は、最初にモデル内部の生成速度を変え、次に音声認識・推論・音声生成を重ねて会話遅延を縮め、現在は制作工程そのものへ広がっている。技術内部で獲得した「完成を待たず、確定した部分から進める」という構造が、翻訳、仮音声、同期、QC、配給を並行させる工程設計へ移っている。
また、制御対象は音から関係へ拡張した。初期には高さ、強さ、共鳴を操作し、次に音素、速度、韻律、話者、感情を扱い、現在は誰に、どの状況で、何を理解・判断・実行してもらうかを設計する。音響技術の進化が、演出、人間工学、業務、医療、権利を同じ系へ接続した。
この歴史は進歩が止まっていないことも示す。低遅延、多言語、方言、表現制御、端末実行、評価、編集、同意管理は現在も別々に改善されている。一つの未完成な出力だけで流れ全体を判断できないのは、過去の各段階も未完成なまま次の足場になってきたからである。
Uncertainties
ここで示す年代区分は、複雑な研究史を能力ごとに整理した編集上のモデルである。フォルマント、連結、統計、ニューラルの各方式は明確に交代したわけではなく、研究と商用利用の時期も言語・用途・計算環境によって重なる。
WaveNet、Tacotron、Deep Voice、Glow-TTSは重要な転換点だが、単独で現在の音声AIを生んだわけではない。音声認識、自己教師あり学習、音声コーデック、ボコーダ、計算機、通信、データ整備、製品運用の多数の成果が接続されている。
「意味」「感情」「話者らしさ」も一つの客観量ではない。モデルが条件を反映できることと、聞き手が意図どおり理解すること、本人の利用同意があること、用途に適していることは別の検証を必要とする。
Sources
- Bell Laboratories Record — The Vocoder, Homer Dudley ↗ — VoderとVocoderの構成、1939年の同時代資料
- Journal of the Acoustical Society of America — Review of text-to-speech conversion for English ↗ — 初期合成、音韻規則、韻律、テキスト解析の歴史的総説
- Hunt & Black — Unit selection in a concatenative speech synthesis system ↗ — 大規模音声データベースからのユニット選択
- Zen, Tokuda & Black — Statistical parametric speech synthesis ↗ — 統計的パラメトリック方式とユニット選択の比較
- WaveNet — A Generative Model for Raw Audio ↗ — 自己回帰型ニューラル波形生成
- Tacotron — Towards End-to-End Speech Synthesis ↗ — 文字から音響表現までの統合
- Deep Voice — Real-time Neural Text-to-Speech ↗ — ニューラル構成と実時間より速い推論
- Glow-TTS — A Generative Flow for Text-to-Speech ↗ — 外部アライナーを必要としない並列・制御可能なTTS
- 提供調査:合成音声の進化 — 2026-08-13。能力の積層とボトルネック移動を中心に公開版として再構成