Report 19

TTSは「言葉が出なくなる」を演じられるか

嗚咽をこらえて話し続けようとする。しかし呼吸が詰まり、ある語で声が崩れ、立て直そうとして再び失敗する。TTSは感情的な声を出すだけでなく、この因果と時間を扱えるのか。

Last updated 2026-09-07Evidence-led analysis
Performance & DirectionTechnologyHuman FactorsProduction Workflow

Question

TTSは「悲しい」「怒った」といった感情属性を音声へ加えるだけでなく、人物が発話目的を達成しようとしながら、身体状態や相手との関係に干渉され、局所的に話せなくなる過程を生成できるのか。さらに、その崩れを俳優や演出家が再現・修正・却下できる形で扱えるのか。

Context

現在のTTSは、話者性、ピッチ、持続時間、エネルギー、感情、スタイルを細かく制御する方向へ進んでいる。フィラー、反復、言い直し、呼吸、笑い、きしみ声など、自発話に現れる現象も研究対象になった。

しかし、演技で価値を持つ「崩れ」は、属性の足し算とは限らない。泣いている声を一文へ均一に塗るのではなく、泣かないよう抑え、言い切ろうとし、途中で漏れ、いったん回復し、最後に制御を失う。この時間構造には、人物の目的と身体の抵抗が同時に含まれる。

本稿でいう演技的な破綻人物が発話目的を達成しようとする過程で、情動、身体状態、相手との関係、時間的圧力が発話制御に干渉し、意図した発話形式が部分的に崩れること。単なる発音エラーや音質劣化とは区別する。

Evidence

制御対象は細分化されている

制御可能TTSのサーベイは、プロソディ、音色・話者性、感情、スタイル、言語・方言、環境などを別の制御対象として整理する。評価についても、指示追従、自然性、表現性は同一の品質ではない。自然に聞こえることと、指定したタイミングや強調に従えることは分けて測る必要がある。

自発話の部品は、すでにモデル化され始めている

Interspeech 2024の研究は、中国語の自発話について、フィラー、反復、吃音、引き伸ばし、ため息、複数種の笑いなど19種類の行動を分類した。行動ラベル、統語位置、文脈、微細なプロソディ表現を組み合わせ、読み上げ音声ではなく自発的な話し方へ近づけている。

別の研究では、言語モデルが会話文へ感情・不流暢性の記号を挿入し、TTS段階でルールと事前定義した音声を使って、ため息、フィラー、反復、間へ変換した。文脈に応じた位置へ現象を置く試みではあるが、身体状態から連続的に生じる演技を一つのモデルが生成したものではない。

テキストから感情様式を推定する研究もある

TEMOTTSは、明示的な感情ラベルへ依存せず、BERTが捉えた言語空間と音声のスタイル空間を接続する。これは台詞内容から情動的な話し方を推定する方向を示す。一方、同じ台詞でも、本心を隠す、皮肉を言う、相手を試す、平静を装うといった複数の演出が成立する。意味から話し方を一意に決めるだけでは、演技上の選択を扱い切れない。

自然性だけでは用途固有の成立を測れない

合成音声評価のガイドは、孤立した一文のMOSによる自然性評価が飽和しつつあること、自然性という概念自体が文脈と聴取者に依存することを指摘する。演技的な破綻を評価するなら、滑らかさではなく、意図した位置で崩れ、その崩れが前後の台詞、身体、相手、映像と整合するかを問わなければならない。

Findings

不流暢性の生成と、演技的破綻は重なるが同じではない

フィラー・間音声イベントとして置きやすい。しかし迷い、時間稼ぎ、対人配慮のどれとして働くかは文脈で変わる。
反復・言い直しラベル化できる。しかし思考の修正、動揺、隠蔽、説得の失敗では、同じ反復でも意味が異なる。
呼吸・震え・笑い個別の音響特徴は操作できる。しかし身体状態と発話目的の時間的な干渉として一貫させる必要がある。
破綻後の回復立て直す、言い換える、沈黙する、再び崩れる。ここまで来ると人物の意志と関係性を含む状態遷移になる。

現在地は三層に分けると見やすい

1. 音響生成声質、音素、ピッチ、長さ、音量、スペクトル、非言語音を生成する。
2. 発話行為の設計ためらい、言い直し、息、泣き笑い、語尾の崩れを、台詞の意味と状況へ結びつける。
3. 演技と制作の判断どの崩れを採用し、誰の身体・声・文化的文脈を表象し、どこまで編集可能にするかを決める。

研究は第1層から第2層へ進んでいる。しかし第3層はモデル性能だけでは閉じない。脚本、翻訳、演出、人間評価、権利、承認の工程が必要になる。

必要なのは感情ラベルより、演技の中間表現かもしれない

「悲しく」だけでは、いつ、何を、なぜ崩すかを指定できない。制作側が共有したいのは、発話目的、身体状態、抑制目標、破綻位置、回復の有無、相手との関係である。それを呼吸、間、音節、速度、声質の時間変化へ翻訳する層が、次の制御インターフェースになる可能性がある。

中心命題演技的な破綻は、ノイズを追加することではない。人物が何を維持しようとし、どこで維持できなくなるかを、時間上の状態遷移として設計することである。

Structural implications

翻訳は、どの語を言えなくするかまで扱う

原語で言葉が崩れる位置が、別言語でも同じ意味を持つとは限らない。日本語では助詞、文末、敬語、母音の長さが人物像に関わる。翻訳者は意味と尺だけでなく、どの語を言い切れないことが場面を成立させるかを設計する。

演出指示は、感情から行為へ変わる

「悲しく」ではなく、「平静を装って言い切ろうとするが、最後の動詞で息が詰まり、短く沈黙し、別の言葉へ逃げる」と記述する。この行為記述を、編集点、呼吸、ピッチ、速度、明瞭度へ分解する仕事が生まれる。

自然さの最適化が、必要な不自然さを消すことがある

生成モデルが滑らかさを強く最適化すると、演技上必要な声の濁り、躊躇、語の欠落まで修正してしまう。品質とはエラーがないことではなく、意図した崩れと意図しない失敗を区別できることになる。

評価は「成立」と「扱えること」を分ける

A. 演技の成立発話目的、破綻位置、身体整合性、抑制から漏出・回復への順序、前後文脈が成立しているか。
B. 基礎品質話者同一性、台詞、固有名詞、アクセント、音質が必要水準を満たすか。
C. 制作上の可制御性同じ指定から再現でき、位置・強度・回復を編集でき、生成条件と採否を記録できるか。

偶然うまく崩れた音声は演技として成立しても、再生成や修正ができなければ制作システムとして扱いにくい。逆に、完全に再現できても文脈上の意味がなければ、精密に制御された記号にとどまる。

最終判断と権利は工程に残る

泣き、痛み、酩酊、吃音のような表現は、話者性だけでなく俳優の身体的・演技的成果や人物表象へ関わる。誰が参照テイクを作り、破綻位置を決め、採用を承認し、どの役柄・感情・言語へ再利用できるかを記録する必要がある。

LAYER SHIFTとの接続制御の破綻を演算するとは、破綻を消すことではない。破綻が生じる条件と意味を、翻訳、演出、音声、映像、権利、QAの各工程で扱える形にすることである。

Uncertainties

本稿が参照する研究は、感情音声、自発話、不流暢性、制御可能TTS、評価方法の要素を示すものであり、「演技的な制御の破綻」を一つの課題として網羅的に検証した研究群ではない。演技上の因果を持つ状態遷移まで現在のTTSが扱えていないという判断は、公開資料を横断した本稿の推論である。

19種類の自発行動を扱う研究は中国語コーパスを対象とし、言語や演技文化を越えた一般性は未確認である。ゼロショット感情・不流暢性研究は、言語モデルの記号とルールベースの音声接続を使う特定の構成であり、連続的な身体状態の再現を示すものではない。

人間の演技にも唯一の正解はない。専門家評価も訓練背景や演技慣習に依存するため、一般聴取者、対象言語の母語話者、俳優、吹替演出、音声制作者による異なる評価を、用途に応じて組み合わせる必要がある。

Sources