Report 18

声は、会話の中で演出される

Realtime TTS-2を「自然な声の新モデル」としてではなく、相手の音声、過去のターン、演出指示、低遅延ストリーミングを接続し、返答の話し方をその場で決める制御層として読む。

Last updated 2026-09-03Evidence-led analysis
Speech InfrastructurePerformance & DirectionTechnologyHuman Factors

Question

TTSが直前の音声を受け取り、返答の途中でも話し方を制御できるようになるとき、音声生成は何に変わるのか。文章を完成させてから読む工程なのか、それとも会話の状態を受け取り、次の一手を音として返す実時間の制御層なのか。

Context

従来のTTSは、テキストを入力し、音声ファイルを出力する変換器として理解しやすかった。Realtime TTS-2では、自然言語による話し方の指示、非言語音のタグ、過去の音声ターン、継続的なストリーミング、単語・音素・口形の時間情報が、同じ運用面に集まり始めている。

ここで区別したいのは、音声を生成するTTSモデルと、音声認識、対話モデル、ターン管理、再生までを含むリアルタイム会話システムである。応答の体感速度や会話の自然さは、TTS単体の速さだけでは決まらない。

中心命題生成音声は、完成文の読み上げから、会話状況を受け取って発話を調整する「出力制御層」へ移りつつある。制作画面の一部が、会話の中へ入ってくる。

Evidence

Inworldは2026年5月5日にRealtime TTS-2を公開し、8月9日に低遅延版TTS-2 Flashを追加、8月31日に一般提供を告知した。以下は同社の製品資料と技術文書から確認できる機能である。

演出指示が、発話生成の入力になる

自然言語ステアリング「暖かく」「少し急いで」「抑えて」などの指示で、感情、テンポ、イントネーション、声質を調整する。録音後の修正ではなく、生成時の制御になる。
非言語音笑い、ため息、呼吸などをインラインタグで挿入できる。ただしタグがあることと、場面に合う演技になることは別である。
音声コンテキストRealtimeセッションでは、直前の音声ターンを条件として渡せる。返答はテキスト履歴だけでなく、声の調子を含む過去へ接続される。
声の設計と複製プロンプトによるVoice Designと音声サンプルによるVoice Cloningを備える。声の一貫性、利用権、再利用範囲が運用上の論点になる。

低遅延は一つの数字ではない

モデル文書は inworld-tts-2 のサーバー側TTFBをP90で100ms、TTS-2 FlashをP90で20msとしている。製品ページはTTS層の最初の音声を中央値200ms未満と説明する。分位点、測定範囲、ネットワーク遅延の扱いが異なるため、同じ指標として比較することはできない。

Flashは速い一方、自然言語ステアリングとProfessional Voice Cloningには対応しない。会話システムでは速度だけでなく、制御性、声の一貫性、音質、費用を用途ごとに選ぶ必要がある。

音声は、他の出力を動かす時間軸になる

同期APIは単語・文字の時刻、音素情報、viseme記号を返す。音声を鳴らすだけでなく、字幕、口形、アバター、UIイベントを同じ時間軸へ接続できる。一方、同期を優先する転送方式は最初の音が出るまでの時間とトレードオフになる。

多言語化は、対応数と安定性を分けて読む

技術文書は200以上の言語・ロケールをBCP-47コードで扱うとし、製品ページは100以上の言語と説明する。公式資料内でも数え方が異なる。Tier 1は日本語を含む15言語で、Tier 2は品質が変動しうると明記されている。Voice Localizationは候補音声を生成するが、最終候補は人が聞いて承認する設計である。

Findings

自然さと、指示に従えることは別の品質軸になる

一つの音声が自然に聞こえても、場面ごとに感情強度、速度、距離感、丁寧さを変えられなければ、会話や制作では扱いにくい。今後の評価にはnaturalnessだけでなく、directability、文脈追従、再現性が入る。

非言語音は、装飾ではなくインターフェイスのcueになる

息、笑い、間、ため息は、話者の身体や状態、発話意図、ターンの終了を聞き手に推定させる。適切なら存在感や対話の流れを支えるが、不適切なら身体と音声の因果関係を壊す。タグの実装は、演技判断の自動化を意味しない。

リアルタイム性は、制御ループ全体で決まる

入力音声の検出、音声認識、対話モデル、ツール実行、文章分割、TTS、ネットワーク、再生、割り込み処理の合計が会話体験になる。TTSのTTFBが小さくても、いつ話し始め、いつ譲り、割り込みにどう反応するかが悪ければ、リアルタイム会話としては機能しない。

人間の耳は、候補選定と例外処理へ残る

多言語の声を生成できることと、その声が人物、地域、用途に合うことは別である。Voice Localizationが人の試聴と承認を工程に含めることは、生成範囲が広がるほど評価者、演出者、母語話者の配置が重要になることを示している。

観測すべき変化「音声を生成できるか」ではなく、どの会話状態を入力し、何を制御でき、どの時間情報を下流へ渡し、誰が失敗を検出して修正するかを見る。

Structural implications

収録後の判断が、実行時の判断へ移る

テンポ、感情、間、非言語音を生成時に指定できると、従来は収録・演出・編集で固定していた判断の一部が、ユーザーとの会話中に実行される。制作工程は消えるのではなく、ルール、プロンプト、状態管理、監視へ分散する。

声は、再利用される「状態」になる

同じ声のアイデンティティを複数言語、複数チャネル、長い対話へ保つには、音声ファイルの管理だけでなく、声の仕様、禁止用途、感情範囲、発音辞書、同意記録、バージョンを管理する必要がある。

時間情報が、音声と映像・UIを束ねる

単語、音素、visemeの時刻は、字幕や口形の補助情報であると同時に、音声を中心に複数モダリティを同期するイベント列になる。声がインターフェイスになるとは、音質だけでなく、いつ何が起きるかを設計することでもある。

新しい音響制作は、運用設計を含む

必要になるのは、良い声を一度作ることだけではない。用途別のボイスガイド、ステアリング指示、フォールバック、割り込み規則、長時間の一貫性評価、権利台帳、ログ監査、誤読・感情誤認の修正経路を整える仕事である。

LAYER SHIFTとの接続TTSは「声を作る技術」から、会話の状態を声として実行する基盤へ広がる。声の演出とインターフェイス設計は、録音室の外で、実時間のフィードバック制御として再編される。

Uncertainties

本稿の製品機能と性能値は主にInworldの公式資料に基づく。第三者による日本語、長時間対話、騒音環境、割り込み、複数話者での独立評価ではない。ベンチマーク順位や対応機能は更新されうるため、導入時には現行仕様と実測を確認する必要がある。

「過去の音声を使う」ことは、感情や意図を正しく理解することを保証しない。緊張、疲労、方言、障害、環境音を誤って状態推定へ結びつければ、不適切な同調や過剰な擬人化が起こりうる。ヘルスケアなど失敗コストの高い用途では、推定と介入の境界を特に慎重に設計すべきである。

Instant Voice Cloningは短い音声から作成でき、利用者に権利確認を求めるが、同意の真正性を独立に検証する仕組みではない。技術的に複製できることと、契約・表示・用途として利用してよいことは分けて扱う必要がある。

Sources