2026年10月2日 10:47
Microsoft、文字起こしと音声合成を公開
3行まとめ
- •MAI-Transcribe-2-Streamingを発表
- •音声合成MAI-Voice-2.1と高速版も公開
- •Microsoft Foundryでプレビュー提供開始
詳細
背景
Microsoft AIは、音声エージェントの構築を想定した音声系モデル群を発表した。音声エージェントでは、ユーザーの発話を遅延なく文字に変換する認識処理と、自然な声で応答する合成処理の両方が求められる。今回の発表は、その両面を自社モデルでそろえる内容となっている。
内容
発表の中心は、同社初のストリーミング文字起こしモデル「MAI-Transcribe-2-Streaming」である。音声を受け取りながら逐次的に認識する低遅延な処理に対応する。あわせて音声合成モデル「MAI-Voice-2.1」と、その高速版も公開した。音声合成モデル群は、声のトーンを保ったまま多言語で合成できる点を特徴とする。これらのモデルはMicrosoft Foundryでプレビュー提供が始まっている。複数のモデルを組み合わせた複合デモも公開された。
今後の影響
Microsoft Foundryを利用する開発者は、文字起こしから音声合成までを同じ基盤上で試せる。プレビュー段階のため、現時点では本番運用に先立つ評価や検証が中心となる。コールセンター対応や会議支援など、音声エージェントを検討する企業にとって、選択肢が一つ増えた形である。
なぜ重要か
Microsoft Foundryで音声認識から合成までを一貫して試せるようになり、音声エージェント開発の選択肢が広がる。
元記事を読む — ITmedia AI+