一次情報で読む、いまのAI
← すべてのニュース

Grok Voice Think Fast 2.0発表

目線

音声エージェントやリアルタイム対話を使う開発者は、遅延・精度・料金を既存音声APIと比較検討する段階。

対象

音声AIエージェント開発者・リアルタイム対話実装者

使える場面

  • speech-to-speechのエージェント応答を試作する
  • ノイズ下や多言語転写精度を検証する
  • ツール呼び出しを含む会話フローを組む

試すなら

docsの料金とAPIを確認し、既存プロンプトでA/B試す

確認点

2026年8月5日にgrok-voice-latestが2.0へ自動移行。1.0継続はピン留めが必要

背景

前世代から知能・転写・会話能力を強化した次世代speech-to-speechモデル。並列推論で遅延を抑えつつ賢さを向上。

何が変わったか

  • Overall AA Speech-to-Speech Quality Index 82.9%(前75.7%)
  • Time to First Audio 0.70s(前1.25s)、推論トークン効率0.4xに改善
  • 転写精度が専用STT比で1.5-2x向上、ノイズ下で差が拡大
  • 会話で短文・一問一答傾向を強化し自然な流れに

使える場面・影響

既存プロンプトほぼ無改修で性能向上が期待でき、音声エージェントの実用性が上がる。

試す前に確認

  • 料金 $0.08 / min of audio
  • 2026-08-05にlatestが2.0へ移行
  • 1.0固定はモデル名ピン留めが必要

一次ソース