技术

Gemini 3.5 Transcribe发布:Google语音AI覆盖85种语言,自动消除口误

Adrian Kessler

Gemini 3.5 Transcribe 不只是在捕捉人们说了什么。它把说的话转换成他们本意要表达的内容。当说话者中途纠正自己——比如“我们定在周二吧,不对,周三”——模型会输出“周三”,并舍弃修正的部分。填充词消失不见。背景噪音也不会干扰它。最终输出的是经过润色、格式化的文本,而非原始的音频捕捉。

对于任何录制采访、播客或多语言内容的人来说,这一区别就是整个工作流程的关键。市场上每一种转录工具都能处理“说了什么”。而人类编辑在事后处理所有其他事宜。谷歌现在正把那个编辑功能直接构建到模型本身中。

该模型支持两个不同的 API 路径。Live API 处理连续的双向流式传输,延迟低于一秒——专为实时语音代理、客服机器人以及任何需要即时转录的场景设计。Interactions API 处理录制的音频:完整的会议、通话记录和采访,并返回最多三位参与者的说话人归属信息及时间戳。两者在流式模式下均达到 4.0% 的词错误率,在非流式模式下为 2.6%——该数据由独立评测机构 Artificial Analysis 测量。谷歌之前的语音转文本模型 Chirp 3 需要多花 70% 的时间才能完成最终转录。

此次发布的消费端功能则相对低调。在安卓平台上,Gboard Rambler 已使用 Gemini 3.5 Transcribe 进行语音转文字输入。Gemini macOS 应用通过“对话窗口”功能支持英语环境下的该模型。Chrome 浏览器被列为“即将推出”,届时用户将可以在任何网页字段中通过语音输入——回复、发帖、填写表单,无需切换应用。该功能的具体上线时间尚未公布。

该模型有其局限性。多说话人归属功能最多支持三位参与者;对于人数更多的小组讨论或圆桌会议,则需要变通方案。消费端的 Rambler 应用目前仅在“特定国家和地区及语言”中可用,而非模型所支持的 85 种语言全部覆盖。谷歌尚未公布该 API 的定价,目前该 API 通过 Google AI Studio 提供公开预览。企业级访问则通过 Gemini Enterprise Agent Platform 进行,定价需单独协商。对于小型创作者而言,成本问题仍悬而未决。

竞争格局同样值得关注。OpenAI 的 Whisper 仍然是独立开发者的默认选择,其在英语音频上的词错误率约为 5–7%,并且需要后处理代码来去除填充词和调整格式。AssemblyAI 和 Deepgram 等服务提供说话人分离功能,但不具备 Gemini 3.5 Transcribe 默认应用的内置自然语言修正能力。这一差距是可量化的,但在 85 种语言中更困难的那一端——区域口音、低资源语言、嘈杂环境——表现如何,仍需独立测试来验证。

最能体现谷歌长期方向的功能是 Chrome 集成。一旦语音输入能在任何网页字段中工作,该模型就不再仅仅是开发者工具——它将成为人们输入方式的基础设施。该功能的上线时间表尚未确认。

标签: , , , , ,

讨论

有 0 条评论。