日々の生活や仕事でAI音声の進化を実感する中で、自分で自由に対話の声をカスタマイズできたらいいのにと思ったことはありませんか。
Google DeepMindによると、音声生成モデルの新しいファミリーとして「Gemini 3.8 Flash TTS」および「Flash-Lite TTS」が発表されました。
これまでの機械的な音声とは異なり、アクセントや感情のトーンまで細かく指定できるのが大きな特徴です。
今回は、新しく登場したGoogleの音声生成モデルが、私たちのコンテンツ制作にどのような変化をもたらすのかについて詳しく見ていきましょう。
自分の好みに合わせたオリジナル音声の作成
オーディオブックやポッドキャストを作る際、思い通りの声を見つけるのに苦労した経験を持つ方も多いのではないでしょうか。
Google AI Studioなどを通じて、完全にゼロからオリジナルのキャラクターボイスやブランド専用の音声を作れるようになりました。
独自の音声デザインワークスペースが用意されており、テキストのプロンプトから新しい声のアイデンティティを直接生み出すことが可能です。
長時間のコンテンツや、2人の話者が登場する脚本のコントロール性能も大幅に向上しています。
Hume AIのベンチマークで首位を獲得した高い性能
今回の新しい音声モデルは、単に声を作れるだけでなく、その品質の高さでも高い評価を受けています。
発表によると、Hume AIが提供するVoice Design Benchmarkにおいて、Gemini 3.8 Flash TTSが全体で1位を獲得しました。
さらに、アクセントのモデリングや総合的な品質を測るインデックスでも上位を独占しています。
人間の耳によるブラインドテストでも、日本語をはじめとする多くの言語で競合他社を上回る結果を残しているとのことです。
安全性の確保とウォーターマークの導入
自分の声を複製したり新しい声を作ったりするときに、悪用されないか不安を感じる人は少なくありません。
Googleはこうした懸念に対応するため、音声の所有者本人による事前の音声確認を必須とする仕組みを取り入れています。
さらに、生成されたすべての音声クリップには「SynthID」と呼ばれる目に見えない電子透かしが埋め込まれます。
AIで作られた音声であることが後からでも検知できるため、偽情報の拡散を防ぐための大切な対策になっています。
開発者やクリエイターが今すぐ使える場所
新しい音声生成の機能は、本日より開発者向けにGoogle AI Studioなどで提供が開始されています。
AgoraやLiveKitといった外部のプラットフォームとも連携しており、高性能な音声生成をスムーズに組み込める環境が整っています。
FigmaやHeyGenなどの企業も、グローバルな吹き替えや地域ごとのアクセントのローカライズにこのモデルを統合し始めています。
自分のように様々なツールを使ってコンテンツを作っている人間にとっても、表現の幅を大きく広げてくれる強力な選択肢になりそうです。
まとめ
今回は、感情やアクセントを自由にコントロールできるGoogleの新しい音声生成モデル「Gemini 3.8 Flash TTS」について紹介しました。
声の質が大きく向上し、安全性への配慮も進むことで、オーディオコンテンツ制作のあり方はさらに便利になっていきそうですね。
新しい機能を試してみたい方は、ぜひGoogle AI Studioのワークスペースをチェックしてみてください。
出典
- Google DeepMind(2026年09月24日)「Gemini 3.8 text-to-speech says hello」
出典
- Google DeepMind(2026年09月24日)「Google DeepMind「Gemini 3.8 Flash TTSが新たに登場」」
Gemini 3.8 text-to-speech says helloGemini 3.8 Flash-Lite TTS and Gemini 3.8 Flash TTS are our most expressive audio models yet.
コメント