AIニュース3行まとめ
2026年9月24日 02:39

Google、テキストで声を作るFlash TTS公開

Google's new Flash TTS models let you design AI voices from scratch using text descriptions

3行まとめ

  • Google、TTSモデル2種を新発表
  • テキスト指示で新しい声を設計可能
  • 100言語超対応、30秒で声を複製

詳細

背景

Googleは、テキストを音声に変換するTTS(テキスト読み上げ)モデルとして、Gemini 3.8 Flash TTSとFlash-Lite TTSの2種類を新たに発表した。どちらも100以上の言語に対応している。

内容

Flash TTSは、求める声の特徴をテキストで説明すると、その記述に沿った新しい声をゼロから作り出せる。テキストによる指示だけで声そのものを設計する仕組みとなる。両モデルとも、台本の1行ごとに演出指示(ステージディレクション)を加えられ、1つの台本から2人の声による対話音声を生成できる。さらに、30秒の音声サンプルから声のプロフィールを作るボイスクローン機能も備える。

まとめ

今回の2モデルの主な機能は、声の設計、行ごとの演出指示、2人対話の生成、30秒サンプルからの声の複製である。声の設計機能はFlash TTSに搭載され、行ごとの演出指示と2人対話の生成は両モデルで使える。声の作成から演出の指定、対話の生成までをテキストと短い音声サンプルで扱える。

なぜ重要か

声の設計と30秒サンプルからの複製が、Googleの音声生成モデルで使えるようになった。100以上の言語に対応する。

元記事を読む — The Decoder

人気記事