当地时间9月18日,spacex旗下人工智能团队spacexai正式发布全新语音转文字模型——grok voice transcribe 2.0。其最大亮点在于:在将词错误率(wer)降低近50%的前提下,服务定价维持原样,未作任何上调。
该模型构建于Grok Voice底层音频基础模型之上,而这一底座早已深度融入实际业务场景:每日处理数万通客服通话、完成数百万小时视频旁白的自动转录,并支撑多类实体设备中的语音智能体运行——其中就包括特斯拉车载系统中搭载的Grok助手。换言之,它并非仅在实验室中追求指标的“纸上模型”,而是经由海量真实语音数据持续锤炼、已在生产环境稳定服役的成熟系统。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

在Artificial Analysis发布的权威流式语音识别榜单中,Grok Voice Transcribe 2.0在全部32款参测模型中准确率位列榜首,显著领先同级别竞品。为更贴近真实应用,SpaceXAI还基于自身线上业务抽取四大内部测试集开展专项评估,覆盖客服电话录音、与Grok助手的日常英语交互、含电话号码与邮箱地址等结构化信息的口述内容,以及多语种短指令场景。结果显示,2.0版本在所有四个数据集上均全面超越1.0版本。

真正打动开发者的,是极具竞争力的定价策略:批量转录仍为每小时音频0.10美元,实时流式转录维持每小时0.20美元,与前代完全一致;更重要的是,说话人分离、毫秒级时间戳标注、自定义关键词触发等关键能力,现已全部纳入基础服务包,无需额外付费。这意味着开发者只需支付与1.0相同的费用,即可获得错误率近乎腰斩、功能更完备的新一代模型——在语音识别这一高度依赖成本控制与高并发调用的领域,“性能翻倍、价格不变”的升级路径,往往比单纯刷新评测分数更具落地推动力。











