一次情報で読む、いまのAI
← すべてのニュース

AI Gateway ストリーミング文字起こし対応

目線

ライブキャプションやボイスエージェント実装の遅延前提が変わる。今すぐ試作できる。

背景

従来は完全な音声ファイルを投入し一括で全文を返す方式だった。

何が変わったか

  • 音声をリアルタイム入力しモデル生成に合わせdeltaをストリーム受信
  • partial/final transcriptを結果ストリームで取得可能
  • openai/gpt-realtime-whisperやxai/grok-sttなどstreaming対応モデルで利用
  • エージェントへのボイスモード追加が容易に

使える場面・影響

ライブ用途のレイテンシが下がり、音声入力付きエージェント構築が現実的になる。

試す前に確認

  • 現在beta
  • streaming-capableなtranscriptionモデルのみ
  • AI SDK経由

一次ソース