対象期間:2026年7月27日〜8月27日。企業発表、公式ドキュメント、独立報道、プレプリントを区別して整理しています。モデルのデモ、API提供、オープンウェイト、実運用事例は同じものとして扱いません。
今月の3行まとめ
- Fish AudioはOSS発の音声プロジェクトから、クリエイター・企業向けのホスト型API事業へ拡大した。最新モデルがオープンウェイトであることとは区別が必要だ。
- NVIDIA Magpieは、多言語・発音制御・オンプレミス配備を前面に出しながら、ゼロショット音声クローンを安全上の理由で削除した。
- Speechifyは、クローン作成前に本人がチャレンジ文を読む同意検証をAPIへ組み込み、同意を申告から記録可能な工程へ変えた。
Fish Audio — OSS発の音声基盤が商用APIへ進む
何が起きたか
Fish Audioは5,200万ドルのシード調達を発表した。元NVIDIA研究者による単一GPU上の趣味的なプロジェクトから始まり、Fish Speechをオープンソース化し、現在はクリエイター、ゲーム、企業向けの音声生成サービスへ展開している。
TechCrunchによれば、同社は直近一年で四つの音声生成モデルを含む五つのモデルを公開し、そのうち三つの音声生成モデルをオープンソース化した。一方、最新のS2.1 Proはホスト型APIで提供される。無料利用や有料プランの条件は時期と利用量で変わり得るため、「OSSで最新モデルをそのまま動かせる」とは扱わない。
なぜ重要か
注目点はモデルの自然さだけでなく、OSSコミュニティで利用者を獲得し、ホスト型API、チーム向けプラン、企業利用へ接続する経路が見えることだ。声の制御項目、低遅延、キャラクター用途などが、研究評価ではなく制作サービスの差別化になる。
一方、コミュニティ音声の登録には本人の知らない音声がアップロードされる問題が残る。自動化された削除申請は必要な救済手段だが、事後削除は事前同意や利用許諾と同じではない。
制作側の確認事項
- 利用するモデルがオープンウェイトか、ホスト型APIかを分ける
- 入力音声、生成物、クローン音声の保存・学習条件を確認する
- 短尺デモではなく、長尺、修正、固有名詞、話者一貫性を実素材で試す
- 声の登録、削除、異議申立て、商用利用の責任主体を記録する
NVIDIA Magpie — クローンなしの多言語TTS基盤
何が起きたか
NVIDIAのMagpie TTS Multilingualは、12言語を一つのモデルで扱うオープンウェイトTTSとして公開された。日本語、英語、中国語、韓国語、ヒンディー語、アラビア語、ブラジル・ポルトガル語などを含み、IPAによるカスタム発音辞書とコードスイッチングを扱う。
公式技術記事はモデルを364Mパラメータと説明する一方、モデルリポジトリ名は magpie_tts_multilingual_357m となっている。表記差はそのまま注記し、固定値の比較材料には使わない。モデルカードは、ゼロショット音声クローン機能を安全上の理由で削除したことを明記している。
なぜ重要か
オープンウェイト化は「誰の声でも複製できる」ことと同義ではない。多言語性、発音制御、コードスイッチング、ローカル・オンプレミス配備を開きながら、本人性の複製機能を外す設計も成立する。
NVIDIAが公表する初音遅延と同時処理性能は、NIMと特定のGPU構成で測定された値である。Hugging Faceのチェックポイントを一般的な制作者用PCで動かした場合の速度や品質を直接示すものではない。
動画制作との接点
- 専門用語、商品名、人名を含む多言語ナレーションの試作
- 日本語と外国語が混じる台詞の発音確認
- データを外部APIへ送れない案件のローカル検証
- 翻訳・吹替台本の尺と読み方の事前確認
Speechify — 本人同意をAPIの工程にする
何が起きたか
SpeechifyはBuild APIで新しいクローン音声を作る際、本人が一回限りのチャレンジ文を読み、その録音を提出する検証フローを公開した。サービスは録音を文字起こしして発行文との一致を確認し、音声サンプルと同じ話者かを照合し、同意記録として保持する。
新方式はAPIバージョン 2026-09-13 を指定すれば現在利用でき、同日から新規ワークスペースの既定になる。以前のバージョンを固定している環境には移行期間があり、既存のクローン音声と合成APIは影響を受けない。
なぜ重要か
これは音質の改善ではなく、クローンを作る前に「本人がその場にいて同意した」ことを、機械が検証できる記録へ変える実装である。チェックボックスやアカウント利用者の申告だけではなく、クローン対象者本人の音声を要求する。
ただし、話者本人を確認できても、作品、媒体、地域、期間、再生成、別言語化、学習利用、報酬、撤回、公開表示まで自動的に決まるわけではない。同意の存在と、利用許諾の範囲と、観客への表示は別々の管理項目である。
制作側で接続する項目
- 同意録音の日時、話者、対象音源を制作台帳へ結びつける
- 補正、追加台詞、別言語化、二次利用を契約で分ける
- 撤回・削除・利用停止の窓口と処理期限を決める
- クレジットとAI音声表示を納品仕様へ入れる
Research Radar
動画生成モデルの内部へ話者条件が近づく
8月16日のプレプリントは、text-to-audio-videoモデルの音声バックボーンへゼロ初期化した線形層を追加し、短い参照録音から話者条件を与える方法を提案した。674組・30話者のベンチマーク結果は示されているが、製品、制作ツール、長編運用、権利処理が確認されたものではない。
連続潜在表現を扱う効率的TTS
CuteTTSは、連続潜在表現を自己回帰的に扱う効率的な音声合成研究として公開された。研究方向として観測する価値はあるが、ボイスクローンや動画制作への実装を確認したニュースではない。
今月の制作チェック
- 修正しやすさ:一度きれいに出るかではなく、台詞を直しても声、発音、速度、感情を維持できるか。
- 声質と演技:話者らしさ、呼吸、間、身体動作、映像同期を別々に評価しているか。
- 配備条件:API、オープンウェイト、オンプレミス、研究コードを同じ「使える」にまとめていないか。
- 権利台帳:話者、同意、用途、期間、地域、学習、再生成、撤回、表示を記録しているか。
当面導入しやすいのは、完成演技の一括代替より、仮ナレーション、多言語版の尺確認、固有名詞の発音確認、キャラクター音声のラフ、本人許諾済み音声による限定的な追加台詞である。
編集後記
この一か月を「また声が自然になった」とだけ読むと、変化の半分を見落とす。Fish AudioはOSSからサービス事業へ進み、Magpieはクローンを外して配備と制御を開き、Speechifyは同意をAPIの前提条件にした。研究側では、話者条件が動画生成モデルの内部へ近づいている。
声を生成する層、制作へ接続する層、本人性を管理する層、観客へ表示する層が分かれて実装され始めている。次に見るべきなのは「できるか」ではなく、どの層が、誰の責任で、どの用途に機能しているかである。
訂正・更新履歴:2026年8月27日 初版公開。企業発表の性能値と事業者自身の比較評価は、第三者検証済みの結果として扱っていません。
Sources
- Fish Audio — 5 Models, 22 People, 1 Year ↗ — 企業発表
- TechCrunch — Fish Audio raises $52M seed ↗ — 独立報道。記事は$52Mへ更新
- NVIDIA / Hugging Face — Magpie TTS Multilingual ↗ — 公式技術解説
- NVIDIA — Magpie TTS model card ↗ — モデルカード・安全上の変更
- SpeechifyAI — Verified consent changelog ↗ — 公式API変更履歴
- SpeechifyAI — Voice cloning consent guide ↗ — 公式実装ガイド
- Adding Voice Cloning to Text-to-Audio-Video Models ↗ — プレプリント・研究段階
- CuteTTS ↗ — プレプリント・研究段階