Question
聞き手は、声を証拠として何を推定しているのか。言語内容、話者、身体、感情、意図、宛先、距離、ターンの終わりが一本の信号から知覚されるなら、AI実写調映像では音声、顔、口、呼吸、身体、空間をどのように整合させる必要があるのか。
Context
TTSの評価は長く、明瞭度、自然さ、話者類似度、感情表現を音声単独で測ってきた。しかし、人間の発話は声帯だけから生じない。呼吸、声門、声道、唇、顎、姿勢、視線、相手との距離が時間の中で協調し、聞き手はその結果を一つの出来事として受け取る。
生成映像では、映像と音声を別々に高品質化できる。だからこそ、各要素が異なる身体や意図を示す失敗が起きる。口形が合っていても、映像では吸気していないのに声に大きなブレスがある、脱力した姿勢なのに声だけが緊張している、視線の先と声の宛先が違う、といった不整合は残る。
Evidence
声の処理は、言語内容だけに閉じていない
Belinらは、人の声に選択的に反応する領域を聴覚皮質に報告した。声は言語の搬送波であるだけでなく、話者を知覚する対象でもある。基本周波数、フォルマント、スペクトル、時間変化には、発声器官とその使い方の特徴が重なり、聞き手は短い発話からも話者の年齢や身体的特徴を一定程度推定する。
ただし、その推定は身体の正確な測定ではない。成人の身体サイズでは、フォルマントに有効な情報が含まれる一方、低い基本周波数を大きな身体と結びつける知覚が実際の差を正しく反映しない条件もある。声は原因の痕跡だが、聞き手の経験と先入観を通した確率的な証拠である。
韻律は、言葉に書かれていない意図を運ぶ
HellberndとSammlerの実験では、単語や意味を持たない語に異なる韻律を与え、話者の発話意図を聞き手が識別できることが示された。高さ、強さ、速度、時間配置は、感情だけでなく、依頼、批判、疑いなど、発話が相手へ何をしようとしているかの手掛かりになる。
「聞く」は視覚を含む
McGurkとMacDonaldは、音声の /ba/ と映像の /ga/ を組み合わせると、別の音として知覚され得ることを示した。これは発話知覚が純粋な聴覚処理ではなく、口の動きと音を統合して構成されることを示す代表例である。
MagnottiとBeauchampは、不一致な映像と音声を常に統合するモデルより、両者が同じ話者から生じた可能性を推定する因果推論モデルの方が、McGurk刺激と非McGurk刺激の知覚をよく説明すると報告した。知覚系は手掛かりを足し合わせるだけでなく、それらが同じ原因に属するかを選別しているというモデルである。
会話では、次の発話が音になる前から準備される
10言語の自然会話を比較したStiversらの研究では、言語差を保ちながらも、話者交替で長い沈黙と大きな重なりを避ける傾向が確認された。別の会話映像研究では、次の発話に必要な唇の構えが音声開始より前に現れ、短い発話では数秒前まで遡る例が報告されている。発話は音の開始点だけで起こるのではなく、身体と相互行為の予測の中で準備される。
Findings
聞き手は、波形の背後に話者という原因を作る
発話を聞くとき、知覚側では少なくとも、言語内容、話者同定、身体らしさ、状態、意図、宛先、空間、ターン交替の推定が並行する。これらは別々のデータトラックではなく、同じ高さ、フォルマント、声質、間、速度、呼吸、非言語音を異なる目的で読む処理である。
したがって合成音声は、波形だけを生成して終わらない。聞き手の側で、その波形を生んだ仮想的な身体と主体が構成される。
写実性より、共通原因としての整合が重要になる
- 解剖学的一貫性:顔、首、胸郭から予想される声質と合うか。
- 生体力学的一貫性:呼吸、顎、唇、姿勢、緊張と発声が連動するか。
- 時間的一貫性:吸気、発話準備、破裂、口の閉鎖、語尾が同じ時間を共有するか。
- 意図的一貫性:視線、表情、韻律、間が同じ目的を示すか。
- 社会的一貫性:誰へ、どんな関係と距離で話しているかが揃うか。
- 空間的一貫性:声量、方向、反射、身体位置が同じ空間を示すか。
- 人物的一貫性:場面をまたいでも反応規則が同じ人物に見えるか。
本稿では、この複数モダリティが同じ発話原因を示す度合いを、実装上の仮説としてcross-modal causal coherenceと呼ぶ。これは確立された単一の測定尺度ではなく、既存の音声知覚・因果推論研究を生成映像の評価へ接続するための編集モデルである。
知覚された属性を、事実と混同しない
低い声から大きな身体、滑らかな声から能力、特定の訛りから人物像を推定しても、それが正しいとは限らない。声の設計は聞き手の推論を助ける一方、年齢、性別、地域、階層、性格へのステレオタイプを増幅できる。評価では「何を感じたか」と「実際に何が正しかったか」を分ける必要がある。
Structural implications
AI実写調では、俳優の身体も制作対象になる
従来の実写は、虚構の人物であっても実在する俳優の身体を通過した。呼吸、重力、疲労、声帯、姿勢の制約は、演技に最初から含まれていた。AI実写調では、顔、身体、声、運動を別々に生成できるため、従来は俳優の身体が自動的に担っていた整合まで設計する必要がある。
工程は「役柄に合う俳優を選ぶ」から、「役柄に必要な身体を定義し、その身体から声、運動、反応を導く」方向へ広がる。これはキャスティングの代替ではなく、実在しない俳優の存在設計という新しい対象である。
Voice UIの設計変数は、言葉より広い
GUIが色、位置、形、動きを設計するように、Voice UIでは韻律、間、呼吸、声質、距離感、重なり、相づち、発話開始と終了を設計する。同じ文言でも、どの主体が、どんな状態で、どの権限を持って語ったように聞こえるかが変わる。
この力は、理解や安心を支援できる一方、能力や親密さを実態以上に感じさせることもできる。生成された身体・人格を知覚させるほど、AIであること、声の来歴、実在人物のレプリカかどうかを示すクレジットと内部記録が重要になる。
評価単位を、素材から発話イベントへ移す
音声MOS、リップシンク誤差、映像品質を別々に測るだけでは足りない。誰へ話しているか、発話前の準備があるか、身体状態と声が一致するか、返答の間が関係に合うかを、一つの場面として評価する必要がある。新しい音響・演技の仕事は、完成波形を磨くだけでなく、複数の生成系を同じ原因へ束ねることになる。
Uncertainties
McGurk効果は視聴覚統合の代表例だが、効果の強さには刺激、言語、個人差があり、生成映像全体の自然さを直接説明する万能モデルではない。因果推論モデルも、発話知覚の全処理を確定した記述ではなく、行動結果を説明する計算モデルの一つである。
声からの年齢、身体、感情、意図の推定には、実際の発声器官や状態に由来する情報と、文化的に学習された連想の両方が含まれる。知覚判断の一致率が高くても、推定対象の事実を正確に復元しているとは限らない。
ここで示した七つの一貫性とcross-modal causal coherenceは、複数の研究領域から導いた制作・評価仮説である。今後、同じ映像に呼吸、視線、音響空間、韻律、発話準備を個別に操作し、存在感、理解、人物同定、違和感がどう変わるかを比較する必要がある。
Sources
- Belin et al. — Voice-selective areas in human auditory cortex ↗ — 人の声に選択的な聴覚皮質領域
- McGurk & MacDonald — Hearing lips and seeing voices ↗ — 不一致な口の動きが音声知覚を変える視聴覚音声研究
- Magnotti & Beauchamp — A Causal Inference Model Explains Perception of the McGurk Effect ↗ — 音声と映像が同じ原因かを推定する計算モデル
- Hellbernd & Sammler — Prosody conveys speaker’s intentions ↗ — 語彙内容と感情評価から分けた韻律による発話意図の知覚
- Stivers et al. — Universals and cultural variation in turn-taking in conversation ↗ — 10言語の自然会話における話者交替の時間構造
- Tilsen — Anticipatory Speech Postures During Dyadic Conversation ↗ — 音声開始前に現れる発話準備の唇運動
- Pisanski et al. — Comparing accuracy in voice-based assessments of biological speaker traits ↗ — 短い発話からの年齢・身体特徴推定と、その精度の限界
- Pisanski et al. — Rethinking the frequency code ↗ — 音響的身体サイズ、実際の相関、知覚上の連想を分けたレビュー
- 提供論点:Voice = interface / infrastructure と生成映像 — 2026-08-17。声を原因の痕跡として読む観点を、AI実写調映像の制作・評価へ再構成