ITmedia AI+
元記事公開:

Meta、初のリアルタイム音声認識モデル「Muse Voice Transcribe」 20人超の話者識別と多言語混在に対応

AI要約

Metaが単一モデルで音声認識、話者分離、発話終了検知を処理するリアルタイム音声認識モデル「Muse Voice Transcribe」を発表。20人以上の話者識別や多言語混在に対応し、Meta AIアプリなどで利用可能となる。

重要ポイント

  • •単一モデルで音声認識だけでなく、話者分離や発話終了検知を同時に処理する高度な機能を搭載している
  • •20人以上の話者を識別可能で、日本語を含む多言語が混在する環境でも高精度な認識を実現する
  • •「Meta Model API」を通じて提供され、Mac版「Meta AI」アプリや開発者向けツール「Muse Code」でも利用可能
もっと見る