2026年9月2日 13:18
Meta「Muse Voice Transcribe」20人超の話者識別対応
3行まとめ
- •Metaが音声認識モデル発表
- •20人超の話者分離に対応
- •日本語含む多言語混在も認識
詳細
概要
Metaはリアルタイム音声認識モデル「Muse Voice Transcribe」を発表した。単一モデルで音声認識・話者分離・発話終了検知の3つの処理を統合的に行える点が特徴で、従来は複数モデルの組み合わせが必要だった処理を一本化している。
機能
20人以上の話者を識別できる話者分離性能を持ち、日本語を含む複数言語が混在する発話にも対応する。会議の議事録作成やコールセンターの通話記録など、多人数・多言語環境での文字起こし用途を想定した設計になっている。提供形態は「Meta Model API」経由に加え、Mac版「Meta AI」アプリや開発者向けの「Muse Code」でも利用可能で、幅広い利用シーンをカバーする。
今後の影響
議事録作成や字幕生成など、音声を扱う業務の自動化がさらに進む可能性がある。特に多言語が飛び交う国際会議や、参加者が多い大規模ミーティングでの活用が見込まれる。
なぜ重要か
多人数・多言語対応の音声認識は会議議事録や文字起こし業務の効率化に直結する新選択肢となる。
元記事を読む — ITmedia AI+