Report 13

声は何の証拠として聞かれるのか

人間は発話から言葉だけを取り出していない。同じ音響信号を手掛かりに、誰が、どんな身体と状態で、誰へ、何をしようとして話したかを推定する。生成音声の次の品質軸を、音の自然さではなく、発話を生んだ原因の一貫性から考える。

Last updated 2026-08-17Evidence-led analysis
Human FactorsPerformance & DirectionTechnologySpeech Infrastructure

Question

聞き手は、声を証拠として何を推定しているのか。言語内容、話者、身体、感情、意図、宛先、距離、ターンの終わりが一本の信号から知覚されるなら、AI実写調映像では音声、顔、口、呼吸、身体、空間をどのように整合させる必要があるのか。

Context

TTSの評価は長く、明瞭度、自然さ、話者類似度、感情表現を音声単独で測ってきた。しかし、人間の発話は声帯だけから生じない。呼吸、声門、声道、唇、顎、姿勢、視線、相手との距離が時間の中で協調し、聞き手はその結果を一つの出来事として受け取る。

生成映像では、映像と音声を別々に高品質化できる。だからこそ、各要素が異なる身体や意図を示す失敗が起きる。口形が合っていても、映像では吸気していないのに声に大きなブレスがある、脱力した姿勢なのに声だけが緊張している、視線の先と声の宛先が違う、といった不整合は残る。

中心命題生成映像で作るべきなのは、自然な映像と自然な音声の組み合わせではない。身体、声、意図、空間が同じ原因から生じたと知覚できる、一つの発話イベントである。

Evidence

声の処理は、言語内容だけに閉じていない

Belinらは、人の声に選択的に反応する領域を聴覚皮質に報告した。声は言語の搬送波であるだけでなく、話者を知覚する対象でもある。基本周波数、フォルマント、スペクトル、時間変化には、発声器官とその使い方の特徴が重なり、聞き手は短い発話からも話者の年齢や身体的特徴を一定程度推定する。

ただし、その推定は身体の正確な測定ではない。成人の身体サイズでは、フォルマントに有効な情報が含まれる一方、低い基本周波数を大きな身体と結びつける知覚が実際の差を正しく反映しない条件もある。声は原因の痕跡だが、聞き手の経験と先入観を通した確率的な証拠である。

韻律は、言葉に書かれていない意図を運ぶ

HellberndとSammlerの実験では、単語や意味を持たない語に異なる韻律を与え、話者の発話意図を聞き手が識別できることが示された。高さ、強さ、速度、時間配置は、感情だけでなく、依頼、批判、疑いなど、発話が相手へ何をしようとしているかの手掛かりになる。

「聞く」は視覚を含む

McGurkとMacDonaldは、音声の /ba/ と映像の /ga/ を組み合わせると、別の音として知覚され得ることを示した。これは発話知覚が純粋な聴覚処理ではなく、口の動きと音を統合して構成されることを示す代表例である。

MagnottiとBeauchampは、不一致な映像と音声を常に統合するモデルより、両者が同じ話者から生じた可能性を推定する因果推論モデルの方が、McGurk刺激と非McGurk刺激の知覚をよく説明すると報告した。知覚系は手掛かりを足し合わせるだけでなく、それらが同じ原因に属するかを選別しているというモデルである。

会話では、次の発話が音になる前から準備される

10言語の自然会話を比較したStiversらの研究では、言語差を保ちながらも、話者交替で長い沈黙と大きな重なりを避ける傾向が確認された。別の会話映像研究では、次の発話に必要な唇の構えが音声開始より前に現れ、短い発話では数秒前まで遡る例が報告されている。発話は音の開始点だけで起こるのではなく、身体と相互行為の予測の中で準備される。

Findings

聞き手は、波形の背後に話者という原因を作る

発話を聞くとき、知覚側では少なくとも、言語内容、話者同定、身体らしさ、状態、意図、宛先、空間、ターン交替の推定が並行する。これらは別々のデータトラックではなく、同じ高さ、フォルマント、声質、間、速度、呼吸、非言語音を異なる目的で読む処理である。

したがって合成音声は、波形だけを生成して終わらない。聞き手の側で、その波形を生んだ仮想的な身体と主体が構成される。

生成と知覚の非対称生成システムは音を作る。聞き手は、その音から存在を作る。

写実性より、共通原因としての整合が重要になる

  • 解剖学的一貫性:顔、首、胸郭から予想される声質と合うか。
  • 生体力学的一貫性:呼吸、顎、唇、姿勢、緊張と発声が連動するか。
  • 時間的一貫性:吸気、発話準備、破裂、口の閉鎖、語尾が同じ時間を共有するか。
  • 意図的一貫性:視線、表情、韻律、間が同じ目的を示すか。
  • 社会的一貫性:誰へ、どんな関係と距離で話しているかが揃うか。
  • 空間的一貫性:声量、方向、反射、身体位置が同じ空間を示すか。
  • 人物的一貫性:場面をまたいでも反応規則が同じ人物に見えるか。

本稿では、この複数モダリティが同じ発話原因を示す度合いを、実装上の仮説としてcross-modal causal coherenceと呼ぶ。これは確立された単一の測定尺度ではなく、既存の音声知覚・因果推論研究を生成映像の評価へ接続するための編集モデルである。

知覚された属性を、事実と混同しない

低い声から大きな身体、滑らかな声から能力、特定の訛りから人物像を推定しても、それが正しいとは限らない。声の設計は聞き手の推論を助ける一方、年齢、性別、地域、階層、性格へのステレオタイプを増幅できる。評価では「何を感じたか」と「実際に何が正しかったか」を分ける必要がある。

Structural implications

AI実写調では、俳優の身体も制作対象になる

従来の実写は、虚構の人物であっても実在する俳優の身体を通過した。呼吸、重力、疲労、声帯、姿勢の制約は、演技に最初から含まれていた。AI実写調では、顔、身体、声、運動を別々に生成できるため、従来は俳優の身体が自動的に担っていた整合まで設計する必要がある。

工程は「役柄に合う俳優を選ぶ」から、「役柄に必要な身体を定義し、その身体から声、運動、反応を導く」方向へ広がる。これはキャスティングの代替ではなく、実在しない俳優の存在設計という新しい対象である。

Voice UIの設計変数は、言葉より広い

GUIが色、位置、形、動きを設計するように、Voice UIでは韻律、間、呼吸、声質、距離感、重なり、相づち、発話開始と終了を設計する。同じ文言でも、どの主体が、どんな状態で、どの権限を持って語ったように聞こえるかが変わる。

この力は、理解や安心を支援できる一方、能力や親密さを実態以上に感じさせることもできる。生成された身体・人格を知覚させるほど、AIであること、声の来歴、実在人物のレプリカかどうかを示すクレジットと内部記録が重要になる。

評価単位を、素材から発話イベントへ移す

音声MOS、リップシンク誤差、映像品質を別々に測るだけでは足りない。誰へ話しているか、発話前の準備があるか、身体状態と声が一致するか、返答の間が関係に合うかを、一つの場面として評価する必要がある。新しい音響・演技の仕事は、完成波形を磨くだけでなく、複数の生成系を同じ原因へ束ねることになる。

LAYER SHIFTとの接続「どれほど人間らしい声か」から、「その声を生んだ身体、意図、関係を、聞き手が一貫して推定できるか」へ。音声は情報の出力層であると同時に、存在を推定させる認知インターフェイスである。

Uncertainties

McGurk効果は視聴覚統合の代表例だが、効果の強さには刺激、言語、個人差があり、生成映像全体の自然さを直接説明する万能モデルではない。因果推論モデルも、発話知覚の全処理を確定した記述ではなく、行動結果を説明する計算モデルの一つである。

声からの年齢、身体、感情、意図の推定には、実際の発声器官や状態に由来する情報と、文化的に学習された連想の両方が含まれる。知覚判断の一致率が高くても、推定対象の事実を正確に復元しているとは限らない。

ここで示した七つの一貫性とcross-modal causal coherenceは、複数の研究領域から導いた制作・評価仮説である。今後、同じ映像に呼吸、視線、音響空間、韻律、発話準備を個別に操作し、存在感、理解、人物同定、違和感がどう変わるかを比較する必要がある。

Sources