桃子桃子快讯
返回首页
模型发布

xAI 推出 Grok Voice Think Fast 2.0,智能体测评登顶

xAI 发布语音到语音模型 Grok Voice Think Fast 2.0,在 Tau Voice 智能体基准上以…

2026.07.30 · 周四5 分钟阅读

xAI 今日推出新一代语音到语音模型 Grok Voice Think Fast 2.0,这是该公司迄今能力最强的 speech-to-speech 模型。在 Artificial Analysis 公布的语音智能体基准 Tau Voice 中,该模型以 56.5% 的得分位列第一,击败了 OpenAI、Google 与阿里千问等厂商的同类模型;在 Speech-to-Speech Index 综合榜单上以 82.9% 排名第二,仅次于千问 Qwen Audio 3.0 Realtime Plus(84.1%)。

值得注意的是,Think Fast 2.0 的平均首音频响应时间仅 0.70 秒,是榜单前五名中唯一低于 1 秒的模型;定价为每分钟 0.08 美元(约合每小时输入音频 4.80 美元),约为 GPT-Realtime-2.1 High 的 45%。

核心基准与排名

根据 Artificial Analysis 公布的数据,Think Fast 2.0 的能力升级集中体现在以下几个维度:

  • Speech-to-Speech 综合得分:82.9%,较上一代 Think Fast 1.0(75.7%)提升 7.2 个百分点。
  • Big Bench Audio 语音推理:97.2%。
  • Full Duplex Bench 多人实时交互:95.1%,较上一代 77.8% 明显提升。
  • Tau Voice 智能体测评:56.5%,登顶榜首。

相比之下,GPT-Realtime-2 High、GPT-Realtime-2.1 High 与 Think Fast 1.0 的首音频响应时间分别为 1.14 秒、1.21 秒与 1.25 秒,Think Fast 2.0 在速度上具备明显领先。

语音识别与推理效率

新模型在识别精度上也做了重点优化。在覆盖 24 种语言、数千条短语的测试中:

  • 整体转写准确率较 Think Fast 1.0 提升约 1.4 倍;
  • 较 Deepgram Nova 3 与 ElevenLabs Scribe v2 提升约 1.5 至 2 倍;
  • 在背景噪声较大、电话压缩等真实场景下,识别误差可降低约 10 倍。

不同于多数语音模型「先推理、再合成语音」的两段式流程,Think Fast 系列支持一边说话一边完成推理。Think Fast 2.0 进一步压缩了推理 Token 消耗——中位数 Token 用量仅为上一代的约 40%,使得工具调用通常能在模型第一句话结束前便开始执行,从而进一步缩短整体响应时间。

在对话风格上,研发团队借助大量强化学习数据,让模型更接近真实人类交流方式:更多短句、一次只提一个问题、避免冗长重复。

开发者实测反馈

多位开发者在 X 平台分享了使用体验。AI 公司 Helionova AI CEO Nick White 表示,已在旗下产品 Tradecraft 上完成面向 grok-voice-think-fast-2.0 的全栈语音实时升级,称其「绝对是一次飞跃式的进步」。在他放出的实测音频中,Grok Voice 扮演愤怒投诉的客户,他扮演客服,双方围绕维修预约展开多轮实时电话对话,模型几乎无明显停顿。

另一位开发者把 Think Fast 2.0 集成进终端工具 GrokTerm,展示其对话速度:测试者连续发出「切换赛博朋克主题」「切回原主题」「再切到另一边屏幕」等指令,模型均快速响应并完成操作。xAI 软件工程师 Parker Conrad 也发文称,整个语音团队为此倾注了大量努力,Think Fast 2.0 向「开箱即用」的目标迈进了一大步。

行业意义

过去一年,OpenAI、Google 与阿里千问持续升级实时语音模型,竞争重心已从语音识别与合成,转向复杂任务处理、多轮对话与工具调用。Think Fast 2.0 的发布延续了这一方向:一方面提升语音推理、实时交互与识别能力;另一方面通过「边说边推理」、更低 Token 消耗与更快工具调用,让语音智能体能够承担客服、电话助手、销售等真实业务场景。

按照计划,xAI 将于 8 月 5 日完成默认模型升级,Think Fast 2.0 也将在更多开发者与企业应用中接受进一步验证。

信源