Grok Voice Transcribe 2.0 正式发布。作为最新推出的语音转文本模型,其在各项真实世界评估中的准确率较 1.0 版本提升两倍,且维持原有定价策略,成为目前市面上最准确的转录模型之一。

该模型构建于支撑 Grok Voice 的音频基础模型之上。目前,Grok Voice 每日处理数万通客户支持电话,转录数百万小时视频旁白,并驱动包括特斯拉车载 Grok 助手在内的实体产品语音代理。通过基于实时、嘈杂的多语言音频数据集训练及后训练优化,Grok Voice Transcribe 2.0 专为应对线路不稳定、多人重叠说话、地方口音及大声念出的凭证信息等复杂现实场景而设计。

性能表现:登顶公开排行榜

在公共 Artificial Analysis 排行榜上,Grok Voice Transcribe 2.0 在 32 个流式传输模型中准确率位列第一。除公开基准测试外,内部针对四个生产环境数据集的字错误率(WER)评估显示,2.0 版本在所有场景中均优于 1.0 版本,尤其在电话音频处理上领先于其他被测模型。

关键场景优化

  • 电话音频:针对8kHz客户支持通话进行优化。
  • 对话场景:提升与 AI 助手自然对话的转录精度。
  • 凭证识别:增强对电话号码、电子邮件及地址等口头凭证的捕捉能力。
  • 短语识别:支持19种语言的语音助手指令,短短语数据集字错误率从 20.6% 降至 6.8%。

此外,模型支持数十种语言的自动检测及录制过程中的语言切换,多语言准确率的显著提升是其相较于前代版本的最大改进。

功能特性与集成

Grok Voice Transcribe 2.0 提供高级配置选项,现有 API 集成无需修改代码即可享受性能升级:

  • 处理模式:支持批量文件/URL转录及实时音频流处理。
  • 精细控制:提供词级时间戳、置信度分数及免费说话人分离标签。
  • 多通道支持:可独立转录多达 8 个通道的音频。
  • 关键词偏置:每次请求可传入多达 100 个专业术语(如医疗或产品名称)以优化识别。
  • 文本格式化:自动将数字、日期、货币、联系方式等转换为书面格式,并支持移除填充词。
  • 智能轮次检测:精准识别语音代理中说话人的发言结束时刻。

在实际应用方面,Atlassian Loom 已全面采用 Grok Voice Transcribe 2.0 替代原有方案。高准确度转录使得用户可将 Loom 录制的行动计划直接输入代码编辑器 Cursor,从而自动生成代码更新,开启了新的 AI 工作流。

定价与服务过渡

Grok Voice Transcribe 2.0 定价与 1.0 版本保持一致:批量转录价格为每小时音频 0.10 美元,流式传输为每小时 0.20 美元,均包含说话人分离、时间戳和关键词功能。

该模型即将成为语音转文本 API 的默认选项,Grok Voice Transcribe 1.0 预计在未来几周内停止服务。如需在过渡期继续使用旧版本,开发者需固定调用 grok-voice-transcribe-1.0 接口。