AIニュース3行まとめ
2026年10月2日 10:47

Microsoft、文字起こしと音声合成を公開

3行まとめ

  • •MAI-Transcribe-2-Streamingを発表
  • •音声合成MAI-Voice-2.1と高速版も公開
  • •Microsoft Foundryでプレビュー提供開始

詳細

背景

Microsoft AIは、音声エージェントの構築を想定した音声系モデル群を発表した。音声エージェントでは、ユーザーの発話を遅延なく文字に変換する認識処理と、自然な声で応答する合成処理の両方が求められる。今回の発表は、その両面を自社モデルでそろえる内容となっている。

内容

発表の中心は、同社初のストリーミング文字起こしモデル「MAI-Transcribe-2-Streaming」である。音声を受け取りながら逐次的に認識する低遅延な処理に対応する。あわせて音声合成モデル「MAI-Voice-2.1」と、その高速版も公開した。音声合成モデル群は、声のトーンを保ったまま多言語で合成できる点を特徴とする。これらのモデルはMicrosoft Foundryでプレビュー提供が始まっている。複数のモデルを組み合わせた複合デモも公開された。

今後の影響

Microsoft Foundryを利用する開発者は、文字起こしから音声合成までを同じ基盤上で試せる。プレビュー段階のため、現時点では本番運用に先立つ評価や検証が中心となる。コールセンター対応や会議支援など、音声エージェントを検討する企業にとって、選択肢が一つ増えた形である。

なぜ重要か

Microsoft Foundryで音声認識から合成までを一貫して試せるようになり、音声エージェント開発の選択肢が広がる。

元記事を読む — ITmedia AI+

人気記事