Report 06

言語対応の爆発と、評価者の希少化

世界には7,000を超える言語がある。多言語基盤モデルは翻訳と音声の到達範囲を急速に広げたが、『出力できる』ことと、その共同体で目的を果たす発話になることは同じではない。

Last updated 2026-08-13Evidence-led analysis
LocalizationSpeech InfrastructureTechnologyRights & Governance

Question

LLM、音声認識、翻訳、TTSが数百言語へ拡張するとき、何が可能になり、何が新しい制約になるのか。技術が言語を「扱える」と主張するとき、その出力が社会の中で機能するかを誰が、どの基準で判断するのか。

Context

Google Researchは世界で話される言語を7,000以上とする一方、オンラインで十分に表現されているのは一部だと説明する。ここでいう「低リソース言語」は、話者が少ない言語と同義ではない。話者人口があっても、学習可能な文字、音声、対訳、辞書、評価データ、計算基盤が不足すれば、技術上は低リソースになる。

したがって、言語対応は単純なカタログの拡大ではない。何が記録され、どの変種が標準として扱われ、誰の発音が参照され、誰が誤りを訂正できるかという、言語の可視性と権力配置に関わる。

中心命題モデルが扱える言語が増えるほど、希少になるのは生成能力ではなく、意味・関係性・文化・発音を具体的に評価できる人間の「耳」である。

Evidence

2022年:テキストと音声の規模が跳ねる

NLLB-200は200言語を対象とし、人手翻訳されたFLORES-200で4万を超える翻訳方向を評価した。論文は従来の最良手法に対してBLEUで44%の相対改善を報告する。同年のWhisperは、多言語・多タスクの音声データ68万時間を用い、追加学習なしで多様な音声認識課題へ転用できる基盤を示した。

2023年:文字、音声、翻訳が一つの系へ近づく

SeamlessM4Tは、音声から音声、音声から文字、文字から音声、文字間翻訳、音声認識を一つのモデルで扱い、タスクにより最大100言語を支援した。学習には100万時間の公開音声が用いられた。GoogleのUniversal Speech Modelは、300以上の言語にまたがる1,200万時間の音声で事前学習し、100以上の言語を目標とする音声認識基盤を示した。

評価はすでに主要なボトルネックである

Google Researchは多言語音声合成について、内容の正確さ、発音、適切なトーン、音響的な欠陥を評価する作業を主要なボトルネックと述べている。対応範囲が増えても、品質を測る仕組みと判断者が同じ速度で増えるとは限らない。

Findings

「対応」は一段階ではない

言語を識別できる、文字起こしできる、翻訳できる、自然な音声にできる、対話の文脈を保てる、公開物として配信できる——これは別々の到達点である。さらに同じ言語名の中にも、地域差、方言、世代差、敬語、専門領域、固有名詞がある。製品上のチェックマークは到達可能性を示すが、用途への適合を保証しない。

評価者の不足は自己強化する

データが少ない言語はモデル品質が上がりにくい。品質が低ければ利用が増えず、訂正データも蓄積しにくい。さらに評価者が少なければ、流暢な誤訳や近縁言語の混入を検出できない。この循環を断つには、生成量ではなく、話者による訂正時間、地域適合性、公開後の訂正率、コミュニティの納得度まで測る必要がある。

安全性は用途に応じて段階化する

  • L0 — 探索:個人利用。重要判断には使わない。
  • L1 — 下訳:字幕や原稿のドラフト。話者が抜き取り確認する。
  • L2 — 一般公開:動画や教材。ネイティブ話者が全文または重点箇所を確認する。
  • L3 — 公共・企業:複数話者、分野専門家、用語集による監修を置く。
  • L4 — 高リスク・表現作品:医療、法律、災害、劇場作品。翻訳、演出、音声、技術QCを人間の責任点として残す。

不確実性を言えることが品質になる

低リソース条件では、流暢に断定する訳より、「方言差が大きい」「固有名詞の確認が必要」「学習データが少ない」「複数の訳があり得る」と返す方が安全である。完成度だけでなく、限界を適切に表明できることが実装要件になる。

Structural implications

翻訳者や話者の役割は、文を一件ずつ作る作業だけでなく、用語集、発音辞書、評価セット、文化的な禁止事項、承認基準を設計する仕事へ広がる。少数の専門家へレビュー負荷が集中するため、分散レビュー、継続的な報酬、訂正履歴、データ利用への同意までをワークフローに含める必要がある。

同時に、どの方言を標準音声へ採用するかは中立な技術判断ではない。モデルへ実装された変種は可視性を得て、実装されない変種はデジタル空間で沈黙しやすくなる。言語を実装するとは、誰の世界の切り分け方を、誰の声で、どの目的のために作動させるかを決めることである。

LAYER SHIFTとの接続「声を生成できるか」から「目的に沿って機能するか」へ。ここでは、その問いが一つの声から言語共同体全体へ拡張される。

Uncertainties

言語と方言の境界は言語学的基準だけで決まらず、歴史、政治、自己認識にも左右されるため、「世界の言語数」は固定値ではない。研究モデルの対象言語数も、音声認識、入力翻訳、出力翻訳、TTSで定義が異なる。平均スコアは個別言語の弱さを隠しやすく、商用サービスの対応範囲も更新が速い。

数百から数千言語への拡張は技術的方向としては見えるが、各言語で社会的に信頼できる品質へ到達する時期は予測できない。データの所有、同意、利益配分、共同体内の意見差についても、普遍的な単一手順はまだない。

Sources