一次情報で読む、いまのAI
← すべてのニュース

Muse Voice Transcribe公開

目線

低遅延の会議文字起こしやマルチ話者アプリの音声パイプライン選択肢が増える。

対象

音声アプリ開発者・文字起こしツール制作者

使える場面

  • リアルタイム会議の話者分離文字起こし
  • コードスイッチング多言語音声処理
  • エンドポインティング付きストリーミングASR

試すなら

Meta Model APIまたはMuse Codeで試作

確認点

提供条件・料金はAPIドキュメントで要確認

背景

Muse Spark由来の音声知覚モデルで、ストリーミング特化。

何が変わったか

  • リアルタイムstreaming ASRとdiarization
  • 20+スピーカー対応、endpointing、多言語code-switching
  • streaming STT/diarizationで首位ベンチ
  • Meta Model API、Meta AI for Mac、Muse Codeで提供

使える場面・影響

低遅延音声理解が必要なアプリで既存ASRからの置き換え・併用を検討できる。

試す前に確認

  • 商用利用可否・料金は公式で確認
  • 日本からの利用可否はAPI側で要確認

一次ソース