2026.07.22 WED09:00 JSTVercel
AI Gateway ストリーミング文字起こし対応
- AI Gatewayで音声ストリーミング文字起こしがbeta対応。
- キャプチャしながら低遅延でtranscript更新を受信。
- AI SDKのstreamTranscribeで複数モデル利用可。
目線
ライブキャプションやボイスエージェント実装の遅延前提が変わる。今すぐ試作できる。
背景
従来は完全な音声ファイルを投入し一括で全文を返す方式だった。
何が変わったか
- 音声をリアルタイム入力しモデル生成に合わせdeltaをストリーム受信
- partial/final transcriptを結果ストリームで取得可能
- openai/gpt-realtime-whisperやxai/grok-sttなどstreaming対応モデルで利用
- エージェントへのボイスモード追加が容易に
使える場面・影響
ライブ用途のレイテンシが下がり、音声入力付きエージェント構築が現実的になる。
試す前に確認
- 現在beta
- streaming-capableなtranscriptionモデルのみ
- AI SDK経由
一次ソース
- Vercel Changelogvercel.com