合成音声には長い歴史がある。
源流をBell LabsのHomer Dudleyが進めたvocoder関連技術まで広く取れば、1936年から2026年で90年になる。1939年のVoder公開実演を起点にすれば約87年。文字を入力して機械に読ませるText-to-Speechを狭く数えるなら、起点はさらに後になる。
AI研究は、1956年のダートマス会議を一つの起点とすれば70年になる。ただし、音声認識や音声合成の研究は「AI」という分野名が定着する前から存在していた。したがって、この二つを単純に「音声AIの歴史」として足すことはできない。
にもかかわらず、私たちがいま目にしているのは、何十年もかけて蓄積された技術が、わずか数年のうちに製品化され、投資対象になり、公開モデルとして手元へ降りてきた光景である。
五つの時計が、声の上で鳴り始めた
第一の時計は、合成音声の長い研究史だ。 1930年代のvocoderは音声の特徴を分析し、励振源とフィルタの制御情報として再構成した。Voderは人間の操作者が鍵盤とペダルを使って発話音を作る装置であり、現代の自動TTSそのものではない。それでも、身体から出た声を再構成可能な信号として扱う技術史の一部にある。
1961年にはBell Labsで「Daisy Bell」の音声・歌唱実験が行われた。1980〜90年代には商用TTS、連結合成、大規模コーパスが発展し、2010年代にはニューラル音声合成が登場した。90年とは、一つの技術がそのまま進歩した年数ではなく、異なる方式が次の制約を露出させながら積み重なった時間である。
第二の時計は、AI研究の約70年。 音声研究はAI以前から続いていたが、機械学習、ニューラル生成、言語モデル、計算資源の発展と合流し、認識・翻訳・生成・対話を一つの工程へ接続できるようになった。
第三の時計は、実装と資本の短い時間。 一般向け生成AIが普及した2022年末以降、2023〜24年には生成AI投資とAI基盤投資が急増した。Stanford AI Index 2025が示す2024年の生成AIへの世界民間投資は339億ドル、AI全体の民間投資は2523億ドル。IEAが示す同年の世界データセンター投資は約5000億ドルである。
これらは音声AI企業への直接投資額ではない。だが、音声も組み込まれる生成AI基盤、計算資源、製品化の環境へ、桁の違う資本が流れ込んだことはわかる。
第四の時計は、課金サービスから公開モデルへの分岐。 2023年末から2025年半ばにかけて、XTTS-v2、OpenVoice、GPT-SoVITS、CosyVoice、F5-TTS、Fish Speech、Kokoro、Chatterboxなどが、音声クローニング、多言語化、声質変換、ストリーミング、小型化をそれぞれ異なる形で公開した。
第五の時計は、人間の声帯と契約の遅い時間。 技術が数か月単位で更新されても、同意、報酬、クレジット、撤回、再利用、表示をどこまで認めるかは、契約と制度の時間の中で決まる。
物理的には小さな差が、社会的には大きな意味になる
音声を特徴量、埋め込み、生成パラメータとして扱えば、人の声は微細な差異の集合として記述される。声の高さ、フォルマント、息遣い、発話速度、ポーズ、アクセント、揺れ。いずれも測定でき、合成モデルの条件にできる。
しかし、人間が声を聞くとき、その差は社会的な情報へ変換される。誰が話しているのか。どの地域や世代に属するように聞こえるのか。怒っているのか、ためらっているのか。相手との距離は近いのか。その声は本人、演技、複製のどれなのか。そして、その発話に誰が責任を負っているのか。
物理的には小さな差が、本人性、感情、信頼、文化、演技、権利を担っている。AIがその差を生成・複製できるようになったことで、これまで演技、翻訳、音響制作、本人性の判断に埋め込まれていた問題が、製品仕様と契約条項の問題として表面化した。
公開されたことと、自由に使えることは同じではない
「課金機能が一斉に無料化した」と捉えると、現在の変化を見誤る。コードがMITでも重みは別条件、研究利用のみ、学習データの由来は非公開、生成する声の権利は利用者側で確認する、といった組み合わせがある。
正確には、課金サービスだけが入口ではなくなり、音声生成の試作環境が公開モデルへ短期間で分岐した。クラウドの向こう側にあった機能の一部を、開発者がローカル環境や自社サーバーで検証できるようになったのである。
コード公開、重み公開、実行可能、利用者の増加、商用採用、商用品質は、それぞれ別の段階だ。公開モデルが存在することは、社会的普及の証明ではない。しかし、試せる人と組み合わせられる機能が急増すれば、次の実装が生まれる速度は変わる。
吹替はショーケース、ナレーションは地面
AI音声の話題では、吹替が目立つ。原音と別言語の声を並べれば変化が聞き取りやすく、映像、俳優、国際展開、声の権利が一つのデモに凝縮される。
一方、ナレーション、案内、研修、カスタマーサポート、ゲームの追加台詞は、ニュースとして劇的に見えにくい。だが、そこではAI音声がインフラとして静かに組み込まれていく。
投資対象になるのも、声の品質だけではない。コンテンツの多言語化、広告の個別化、音声エージェント、教育、顧客対応を横断して、声を既存のサービスへ接続できるインターフェイス層である。
「兆」という数字が示すもの、示さないもの
1ドル150円で単純換算すれば、2024年の生成AI民間投資339億ドルは約5.1兆円、AI全体の2523億ドルは約37.8兆円、データセンター投資5000億ドルは約75兆円になる。
ただし、これは音声AIだけの売上でも、音声企業への直接投資でもない。音声AIだけを世界全体で一貫した定義により集計した数字として扱うことはできない。
それでも、この規模が示すものはある。声を生成するモデル単体ではなく、翻訳、配信、広告、エージェント、制作工程を接続する生成AIインフラへ資本が向かっている。声はその中で、利用者とシステム、作品と市場、情報と行動をつなぐ接続面になっている。
- 90年 — vocoder関連技術を起点にした広義の歴史。狭義のTTS史とは異なる。
- 70年 — 1956年を起点としたAI研究史。音声AIだけの年数ではない。
- 3〜4年 — 2022年末以降の普及、投資、製品化の加速を示す導入上の時間幅。
- 兆円 — 生成AI、AI全体、データセンターへの投資を円換算した規模。音声AI直接投資ではない。
- 公開モデル化 — 公開と商用利用、権利の明確さ、制作品質は別々に確認する必要がある。
声のインフラ化は、責任のインターフェイス化でもある
声がインフラになると、声を作る仕事も変わる。ナレーターや声優だけでなく、翻訳者、ローカライゼーション担当、音声アナリスト、品質評価者、データアノテーター、会話設計者、権利担当者が生成と運用に関わる。
彼らが判断するのは、音声が聞こえるかどうかだけではない。その言語の話者に自然か。固有名詞や数字を間違えていないか。間、感情、敬語、アクセントは場面に合うか。原話者の演技意図は変わっていないか。その声を誰がどの範囲で使えるのか。AI音声であることを誰にどう表示するのか。
こうした判断を、モデルの評価語、ルーブリック、閾値、修正指示、契約条項へ変換する人がいる。生成が速く安くなるほど、その声をどこへ接続し、何を保証し、失敗時に誰が止めるのかが表へ出てくる。
だから、これは「AIが人間の声を再現した」というだけの話ではない。数十年の研究が数年の実装へ圧縮され、公開モデルが数か月単位で更新されても、人間の声が持つ社会的な意味はパラメータの小ささに還元されない。
本稿は、技術史、AI・データセンター投資、公開音声モデルの時系列を横断した調査コラムです。本文の年数・投資額は同一系列の統計ではなく、比較可能な数値としてではなく、異なる時間尺度と規模が声の上で重なった状況を示すために使用しています。調査時点:2026年9月。
Sources
- U.S. Patent 2,121,142 — Homer Dudley / vocoder ↗ — 1938年公開の特許資料
- Library of Congress — Daisy Bell (Bicycle Built for Two) ↗ — 1961年のBell Labsにおける音声・歌唱実験の解説
- Dartmouth Summer Research Project on Artificial Intelligence ↗ — 1955年の研究提案
- Stanford AI Index 2025 ↗ — 2024年の生成AI・AI民間投資
- IEA — Energy and AI ↗ — 世界のデータセンター投資
- Coqui — XTTS-v2 ↗ — モデルカードとライセンス
- MyShell — OpenVoice ↗ — コード、重み、利用条件
- GPT-SoVITS ↗ — 公開実装
- FunAudioLLM — CosyVoice ↗ — 公開実装
- SWivid — F5-TTS ↗ — モデルカードとライセンス
- Fish Audio — Fish Speech 1.5 ↗ — モデルカードと利用条件
- hexgrad — Kokoro-82M ↗ — モデルカード
- Resemble AI — Chatterbox ↗ — 公開実装