技术

微软10人团队打造的语音模型在每项基准测试中均超越OpenAI、谷歌和ElevenLabs——每小时仅需0.10美元

Adrian Kessler

该模型名为MAI-Transcribe-2。微软AI部门(由穆斯塔法·苏莱曼 (Mustafa Suleyman) 领导)于9月3日以每音频小时0.10美元的价格推出——该定价有效期至2026年底。上一版本MAI-Transcribe-1.5的每小时费用为0.36美元。72%的降价并非营销噱头。一个每年处理10万小时音频的联络中心,此前需为旧模型支付3.6万美元;同样的工作量现在只需1万美元。

基准测试的表现才是让这一价格显得非同寻常的原因。在FLEURS多语言评估中,MAI-Transcribe-2在60种语言中排名第一,平均词错误率为5.2%——优于OpenAI的GPT-Transcribe、谷歌的Gemini 3.5 Transcribe、ElevenLabs Scribe v2以及Meta的Whisper V3-Large。在同时追踪准确率和延迟的Artificial Analysis排行榜上,它位列第二,并定义了研究者所称的帕累托前沿——即无法在不牺牲另一指标的情况下改进某一指标的边界。该模型被训练为位于该前沿的高效边界,而非追逐任何单一指标排名的顶端。

速度是第二个值得审视的宣称。微软表示,MAI-Transcribe-2处理音频的速度是GPT-Transcribe的10倍、ElevenLabs Scribe v2的7倍、Gemini 3.5 Transcribe的5倍。对于长音频——如播客转录、法律证词、临床笔记——这一差异决定了工作流是以秒计还是以分钟计。该模型还支持说话人分离(识别谁在何时说话)、词级时间戳、领域术语的关键词偏置,以及针对句子中混合语言的代码切换支持,具体以印地英语和西语英语作为测试示例。

构建该模型的团队与其成果相比显得尤为引人注目。微软描述其核心团队为10人,以极低的内部官僚作风运作,并由负责数据采集和供应商管理的更大团队提供支持。由此产生的GPU效率声称很具体:MAI-Transcribe-2的运行GPU成本仅为竞争性最先进模型的一半。这一说法在企业级负载下是否成立,从公告中无法验证,但架构声称足够精确,可以被测试。

该模型现已在Microsoft Foundry、MAI Playground和Open Router上可用——这意味着无需Azure合约或微软企业关系即可访问。这种分发广度是刻意为之。微软AI向开发者直接提供API的举措,是继OpenAI合作关系重组后更广泛重新定位的一部分。2025年10月和2026年4月的修订取消了自2019年以来定义双方关系的排他性和收入分成安排。微软现在有直接动机在模型层竞争,而不仅仅是分发OpenAI的输出。

0.10美元的价格标注为限时至2026年底。该日期之后的标准定价尚未披露。正在评估将MAI-Transcribe-2用于生产工作负载的买家,实际上是在为一个2027年日历年度成本未知的产品定价。这是一个值得明确指出的风险,即便当前费率使该模型在所有可见替代品中显得具有吸引力。

标签: , , , , ,

讨论

有 0 条评论。