Question
TTSが直前の音声を受け取り、返答の途中でも話し方を制御できるようになるとき、音声生成は何に変わるのか。文章を完成させてから読む工程なのか、それとも会話の状態を受け取り、次の一手を音として返す実時間の制御層なのか。
Context
従来のTTSは、テキストを入力し、音声ファイルを出力する変換器として理解しやすかった。Realtime TTS-2では、自然言語による話し方の指示、非言語音のタグ、過去の音声ターン、継続的なストリーミング、単語・音素・口形の時間情報が、同じ運用面に集まり始めている。
ここで区別したいのは、音声を生成するTTSモデルと、音声認識、対話モデル、ターン管理、再生までを含むリアルタイム会話システムである。応答の体感速度や会話の自然さは、TTS単体の速さだけでは決まらない。
Evidence
Inworldは2026年5月5日にRealtime TTS-2を公開し、8月9日に低遅延版TTS-2 Flashを追加、8月31日に一般提供を告知した。以下は同社の製品資料と技術文書から確認できる機能である。
演出指示が、発話生成の入力になる
低遅延は一つの数字ではない
モデル文書は inworld-tts-2 のサーバー側TTFBをP90で100ms、TTS-2 FlashをP90で20msとしている。製品ページはTTS層の最初の音声を中央値200ms未満と説明する。分位点、測定範囲、ネットワーク遅延の扱いが異なるため、同じ指標として比較することはできない。
Flashは速い一方、自然言語ステアリングとProfessional Voice Cloningには対応しない。会話システムでは速度だけでなく、制御性、声の一貫性、音質、費用を用途ごとに選ぶ必要がある。
音声は、他の出力を動かす時間軸になる
同期APIは単語・文字の時刻、音素情報、viseme記号を返す。音声を鳴らすだけでなく、字幕、口形、アバター、UIイベントを同じ時間軸へ接続できる。一方、同期を優先する転送方式は最初の音が出るまでの時間とトレードオフになる。
多言語化は、対応数と安定性を分けて読む
技術文書は200以上の言語・ロケールをBCP-47コードで扱うとし、製品ページは100以上の言語と説明する。公式資料内でも数え方が異なる。Tier 1は日本語を含む15言語で、Tier 2は品質が変動しうると明記されている。Voice Localizationは候補音声を生成するが、最終候補は人が聞いて承認する設計である。
Findings
自然さと、指示に従えることは別の品質軸になる
一つの音声が自然に聞こえても、場面ごとに感情強度、速度、距離感、丁寧さを変えられなければ、会話や制作では扱いにくい。今後の評価にはnaturalnessだけでなく、directability、文脈追従、再現性が入る。
非言語音は、装飾ではなくインターフェイスのcueになる
息、笑い、間、ため息は、話者の身体や状態、発話意図、ターンの終了を聞き手に推定させる。適切なら存在感や対話の流れを支えるが、不適切なら身体と音声の因果関係を壊す。タグの実装は、演技判断の自動化を意味しない。
リアルタイム性は、制御ループ全体で決まる
入力音声の検出、音声認識、対話モデル、ツール実行、文章分割、TTS、ネットワーク、再生、割り込み処理の合計が会話体験になる。TTSのTTFBが小さくても、いつ話し始め、いつ譲り、割り込みにどう反応するかが悪ければ、リアルタイム会話としては機能しない。
人間の耳は、候補選定と例外処理へ残る
多言語の声を生成できることと、その声が人物、地域、用途に合うことは別である。Voice Localizationが人の試聴と承認を工程に含めることは、生成範囲が広がるほど評価者、演出者、母語話者の配置が重要になることを示している。
Structural implications
収録後の判断が、実行時の判断へ移る
テンポ、感情、間、非言語音を生成時に指定できると、従来は収録・演出・編集で固定していた判断の一部が、ユーザーとの会話中に実行される。制作工程は消えるのではなく、ルール、プロンプト、状態管理、監視へ分散する。
声は、再利用される「状態」になる
同じ声のアイデンティティを複数言語、複数チャネル、長い対話へ保つには、音声ファイルの管理だけでなく、声の仕様、禁止用途、感情範囲、発音辞書、同意記録、バージョンを管理する必要がある。
時間情報が、音声と映像・UIを束ねる
単語、音素、visemeの時刻は、字幕や口形の補助情報であると同時に、音声を中心に複数モダリティを同期するイベント列になる。声がインターフェイスになるとは、音質だけでなく、いつ何が起きるかを設計することでもある。
新しい音響制作は、運用設計を含む
必要になるのは、良い声を一度作ることだけではない。用途別のボイスガイド、ステアリング指示、フォールバック、割り込み規則、長時間の一貫性評価、権利台帳、ログ監査、誤読・感情誤認の修正経路を整える仕事である。
Uncertainties
本稿の製品機能と性能値は主にInworldの公式資料に基づく。第三者による日本語、長時間対話、騒音環境、割り込み、複数話者での独立評価ではない。ベンチマーク順位や対応機能は更新されうるため、導入時には現行仕様と実測を確認する必要がある。
「過去の音声を使う」ことは、感情や意図を正しく理解することを保証しない。緊張、疲労、方言、障害、環境音を誤って状態推定へ結びつければ、不適切な同調や過剰な擬人化が起こりうる。ヘルスケアなど失敗コストの高い用途では、推定と介入の境界を特に慎重に設計すべきである。
Instant Voice Cloningは短い音声から作成でき、利用者に権利確認を求めるが、同意の真正性を独立に検証する仕組みではない。技術的に複製できることと、契約・表示・用途として利用してよいことは分けて扱う必要がある。
Sources
- Inworld — Introducing Realtime TTS-2 ↗ — 機能概要、ステアリング、音声コンテキスト。2026-09-03確認
- Inworld — Realtime TTS-2 ↗ — 一般提供、低遅延、多言語、製品上の位置づけ
- Inworld Docs — TTS Models ↗ — モデルID、TTFB、TTS-2とFlashの機能差
- Inworld Docs — Multilingual Support ↗ — 言語・ロケール数、Tier 1とTier 2
- Inworld Docs — Timestamps ↗ — 単語、文字、音素、visemeの時間情報
- Inworld Docs — Instant Voice Cloning ↗ — 音声サンプル長、権利確認
- Inworld Docs — Release Notes: TTS ↗ — TTS-2およびTTS-2 Flashの公開日
- Inworld Docs — Synthesize Speech Using WebSocket ↗ — 継続的ストリーミングとセッション
- 提供資料:Realtime TTS-2 調査レポート — 2026-09-03。公開情報と考察をサイト向けに再構成