2026年9月24日 00:25
Gemini 3.8 TTS、100言語超の音声生成
Gemini 3.8 text-to-speech says hello
3行まとめ
- •Gemini 3.8 TTSモデル2種を発表
- •100言語超・2,000超の音声に対応
- •全音声にSynthID透かしを付与
詳細
概要
Googleは、テキスト読み上げ(TTS)モデルのGemini 3.8 Flash TTSとGemini 3.8 Flash-Lite TTSの2種を発表した。Flash TTSはキャラクター音声を作り込む創作用途、Flash-Lite TTSは大量処理とコスト効率を重視する用途向けに位置づけられている。
機能
自然言語のプロンプトから100以上の言語で音声をゼロから作成でき、2,000以上の制作用ボイスも使える。1行ごとにペース・感情・方言・相づちを指示でき、2人の話者による会話シーンの生成にも標準対応する。30秒の音声サンプルから声を複製でき、音声による同意の照合が必要になる。数時間に及ぶ長尺音声でも品質を維持する。音色・音高・アクセントを調整するボイスリミックスは近日提供予定。
提供と安全対策
開発者はGemini APIとGoogle AI Studioで本日から利用でき、企業向けのGemini Enterprise APIは近日対応する。一般ユーザー向けにはGemini NotebookでFlash TTS、Google VidsでFlash-Lite TTSを提供する。生成した音声にはすべてSynthIDの電子透かしが埋め込まれる。イリノイ州、テキサス州、EEA、英国、スイス、インドでは利用できない。
なぜ重要か
100言語超の音声生成と声の複製に対応し、APIで即日利用できる。全出力にSynthID透かしを付与する。
元記事を読む — Google DeepMind Blog