ITmedia AI+
元記事公開:
Microsoft、初のストリーミング文字起こしモデル「MAI-Transcribe-2-Streaming」公開 音声合成「MAI-Voice-2.1」と高速版も
AI要約
Microsoft AIが低遅延な逐次認識に対応するストリーミング文字起こしモデルと、声のトーンを保った多言語音声合成モデル群を公開し、音声エージェント構築を想定した技術としてMicrosoft Foundryでのプレビュー提供を開始した。
重要ポイント
- •低遅延な逐次認識に対応したストリーミング文字起こしモデル「MAI-Transcribe-2-Streaming」が発表された
- •声のトーンを保った多言語合成に対応する音声合成モデル群が同時に公開された
- •Microsoft Foundryでのプレビュー提供が始まり、音声エージェント構築を想定した複合デモも公開された