2026年9月24日 02:39
Google、テキストで声を作るFlash TTS公開
Google's new Flash TTS models let you design AI voices from scratch using text descriptions
3行まとめ
- •Google、TTSモデル2種を新発表
- •テキスト指示で新しい声を設計可能
- •100言語超対応、30秒で声を複製
詳細
背景
Googleは、テキストを音声に変換するTTS(テキスト読み上げ)モデルとして、Gemini 3.8 Flash TTSとFlash-Lite TTSの2種類を新たに発表した。どちらも100以上の言語に対応している。
内容
Flash TTSは、求める声の特徴をテキストで説明すると、その記述に沿った新しい声をゼロから作り出せる。テキストによる指示だけで声そのものを設計する仕組みとなる。両モデルとも、台本の1行ごとに演出指示(ステージディレクション)を加えられ、1つの台本から2人の声による対話音声を生成できる。さらに、30秒の音声サンプルから声のプロフィールを作るボイスクローン機能も備える。
まとめ
今回の2モデルの主な機能は、声の設計、行ごとの演出指示、2人対話の生成、30秒サンプルからの声の複製である。声の設計機能はFlash TTSに搭載され、行ごとの演出指示と2人対話の生成は両モデルで使える。声の作成から演出の指定、対話の生成までをテキストと短い音声サンプルで扱える。
なぜ重要か
声の設計と30秒サンプルからの複製が、Googleの音声生成モデルで使えるようになった。100以上の言語に対応する。
元記事を読む — The Decoder