Report 09

声は認知インターフェイスである

合成音声の設計を、自然さや話者の属性ではなく、注意、理解、記憶、信頼、行動をどう接続するかという認知タスクから考える。

Last updated 2026-08-13Evidence-led analysis
Speech InfrastructurePerformance & DirectionHuman FactorsTechnology

Question

合成音声の良し悪しは、何によって決まるのか。自然に聞こえるか、感じがよいかだけではなく、騒音や作業負荷のある環境で情報を検出し、意味と優先度を理解し、必要な行動へ移れるかを、どのように設計・評価すべきか。

Context

声は文言だけを運ばない。速度、ピッチ、間、強調、音量、声質を通じて、緊急性、確信、距離感、発話主体、次に取るべき行動まで示す。同じ文章でも、音響的な提示方法が変われば、聞き手が割り当てる注意と解釈は変わる。

一方で、聴覚の注意資源は有限である。コックピットではエンジン音、無線、警告、会話、操縦が競合し、カスタマーサービスでは電話回線、周辺騒音、数字の記憶、感情、意思決定が重なる。声は情報を届けると同時に、ほかの作業へ干渉する可能性も持つ。

中心命題声の正解は、声の中だけにはない。目的、聴取環境、同時に行う作業、誤りの種類と損失まで含めた関係の中にある。

Evidence

話者属性だけでは性能を説明できない

コックピット警告を扱った実験では、静かな条件では単調・緊急スタイルが話者の性別にかかわらず速く識別され、背景に会話雑音を加えた条件では、男性話者の単調・緊急スタイルが正答率と反応時間で優位だった。意味、発話スタイル、話者、背景音が組み合わさって結果を変えている。

高騒音下の軍用機通信を扱った別の研究でも、通常巡航時には男女の音声はおおむね許容可能だったが、最高騒音条件では女性音声の明瞭度低下が大きかった。一方、符号化音声や自動音声認識を調べた続編では、男女差が有意でない条件も確認された。単純な「女性声は聞きやすい」「男性声は信頼できる」という一般則にはできない。

速度は速ければよく、遅ければ安全でもない

ヘリコプター操縦課題中の合成警告を調べたNASAの研究では、検討した範囲でピッチによる有意差は得られず、発話速度は反応時間と操縦士の評価に影響した。最も速い条件は理解時間を短縮した一方、操縦士はやや遅い速度を好み、最も遅い条件は主作業から注意を長く奪うと評価された。速度には、聞き取りと占有時間の両方がある。

信頼は自然さだけでは作れない

音声アシスタントの信頼研究では、能力、社会的存在感、擬人化、プライバシーへの懸念などが関係している。人間らしい声は会話への入りやすさを高め得るが、システムの能力や責任を実態以上に感じさせる可能性もある。声質とともに、AIであること、何ができないか、誰へ引き継がれるかを示す必要がある。

Findings

声が担う機能は連鎖している

音声による行動は、検出 → 情報源と優先度の識別 → 内容の理解 → 短期保持 → 判断 → 操作または応答という段階を通る。前段が失敗すれば、後段の自然さや好感度は意味を持たない。「聞こえた」と「数字や否定を正しく理解した」も別の評価である。

警告、実況、確認、相談は同じ声を必要としない

危険警告には通常案内との識別性と短い行動指示が必要だが、高度や距離の反復的なコールアウトには、安定性、数値の明瞭さ、作業を妨げないテンポが必要になる。予約変更では日時の分節、支払いでは中立性と確認、不正利用では落ち着いた緊急性、障害対応では短い手順と進捗が優先される。

一つの人格ではなく、機能モードを設計する

ブランドに一つの「感じのよい声」を割り当てるより、通常案内、数字・確認、緊急、トラブル・共感、人間への引き継ぎといったモードを定義する方が、用途に対応しやすい。同じ話者でも、速度、間、韻律、文の長さ、反復、画面表示を変えられる。

好みではなく、遂行結果を測る

  • 検出:気づくまでの時間、ほかの音との識別率
  • 理解:正答率、数字・固有名詞・否定の誤聴率
  • 記憶:操作後の想起、確認要求の回数
  • 行動:反応時間、操作成功率、完了率、転送率
  • 関係:信頼、透明性、断りやすさ、責任の認識
  • 継続:疲労、苛立ち、警告慣れ、再利用
  • 公平性:年齢、聴力、言語、アクセント、利用環境別の性能

Structural implications

TTSの導入が増えると、音声制作は完成した波形を納品する作業から、用途別の認知要件を定義し、実環境で試験し、運用中に調整する継続的な設計へ移る。演技知も、感情表現の巧拙だけでなく、注意をどれだけ上げるか、数字をどう保持させるか、不安を増幅せずに緊急性を示すかという機能記述へ変換される。

このとき必要になるのは、万能な「よい声」を選ぶ人ではない。業務、環境、聞き手、失敗コストを分解し、どの音響・言語パラメータを動かし、何を測るかを設計する人である。声優、演出、音響、人間工学、UX、業務設計の知識が、同じ評価系の中で接続される。

声は行動を支援できるため、同時に操作にも使える。親密さで解約を妨げる、焦りで支払いを急かす、AIであることを隠して権威を演出するといった設計は、機能していても望ましいとは限らない。性能評価には、利用者の自律性と退出可能性も含める必要がある。

LAYER SHIFTとの接続「どんな声を作れるか」から、「誰に、どの状況で、何を理解・判断・実行してもらう声か」へ。合成性能の進歩は、声を選ぶ仕事を、目的と失敗条件を設計する仕事へ移す。

Uncertainties

航空研究の多くは、特定の雑音、機器、英語話者、軍用・実験環境に基づく。そこで得られた話者、速度、ピッチの結果を、旅客機、自動車、病院、電話応対へ直接移すことはできない。特定機種のコールアウトに特定の声が採用された理由も、公開された仕様や試験記録がなければ推測にとどまる。

カスタマーサービスの機能モードと推奨パラメータは、既存研究から導いた設計仮説を含む。業務ごとの比較試験、実際の電話回線と周辺騒音、長期利用、有人対応との差、文化・言語別の評価が必要である。

擬人化と信頼の関係も一方向ではない。自然さ、能力、プライバシー、既存のAI経験、失敗後の回復が相互に作用するため、「人間らしさ」を単独の品質指標として最大化すべきではない。

Sources