技术

10秒录音克隆你的声音,ElevenLabs v4能说90种语言

Susan Hill
在 Google 中添加我们

ElevenLabs发布了Eleven v4,这是一款文本转语音模型,能把文字读出声来,还能按照写作者的要求加入笑声、叹息,或带着愤怒情绪的法语口音。它的即时语音克隆只需要一段比语音留言还短的录音,之后克隆出的声音就能说几十种语言,同时保留原本的音色。任何拥有ElevenLabs免费账户的人都可以使用。

对于用声音创作的人来说,这能省下好几天的工作。播客创作者可以用自己的声音把一期节目配成日语,独立游戏开发者不用预约录音棚,也能让每个次要角色拥有独特的说话方式;有声书旁白创作者则可以直接在脚本里写入停顿或轻笑。另一面同样不容忽视:一段语音留言、一段视频通话录音,或几秒钟的公开帖子音频,如今就足以成为素材,制作出足以乱真的某人声音克隆。

这次的主要变化在于可控性,而克隆声音本身只需10秒音频。早期的ElevenLabs模型能清晰地朗读文字,却只能猜测语气。v4可以识别直接写在文本中的方括号舞台指示,例如[laughs]或[said angrily in French accent],也能识别[light rain]或[phone buzzing]这样的背景提示。公司表示,模型还会从上下文中判断语气和节奏,因此即使没有标签,紧张场景中的台词也会读出紧张感。多位说话者参与的场景里,每个声音在较长段落中也能保持一致;这一直是合成旁白的弱项,过去声音往往会在一章内容中逐渐走样。

支持的语言从上一版本的70种增至90多种。据TechCrunch报道,ElevenLabs特别指出,日语、巴西葡萄牙语、普通话和粤语的质量提升最为显著。克隆声音切换语言时仍会保留原有身份,因此,西班牙语使用者的克隆声音即使读起德语,听起来仍像本人,同时带有地道的德语口音。另一款模型v4 Turbo则面向语音助手和呼叫中心坐席开发。它大约能在150毫秒内开口说话,差不多相当于两个人轮流交谈时的间隔;即使背后的聊天机器人还没写完回答,它也可以先开始说话。

这个市场并非只有ElevenLabs一家。Google、OpenAI、Cartesia、Deepgram和Fish Audio都向同一批开发者提供合成语音。发布后的数小时内,独立基准测试机构Artificial Analysis就在其语音排行榜上将v4列为第一;该榜单由听众并排收听匿名样本后进行评分。ElevenLabs还表示,在与竞争对手进行的盲测中,约四分之三的听众更喜欢v4;这一数据来自公司自己的测试。

隐忧首先就来自那10秒的门槛。ElevenLabs表示,克隆声音必须征得上传者所提供声音的本人同意;公司运营着一个公开分类器,可以标记由其工具生成的音频,并会直接拦截对某些政治人物声音的克隆。这些措施能阻止随手滥用,但前提是上传者如实说明情况;诈骗者只需要一小段亲属的声音样本,就能编造紧急情况打电话行骗。免费套餐的额度也很有限:根据Unite.AI对各档套餐的梳理,每月大约只能生成10分钟音频;付费套餐则从每月6美元起。

Eleven v4和v4 Turbo于9月28日在ElevenLabs的创作者应用、智能体平台和开发者API上线。这家总部位于伦敦的公司2月从Sequoia融资5亿美元,估值达到110亿美元;TechCrunch报道称,其年化营收已超过6亿美元。首席执行官马蒂·斯塔尼斯泽夫斯基(Mati Staniszewski)告诉TechCrunch,公司计划在未来几年内上市,但没有给出具体时间。

对创作者来说,一种能按指令发笑、覆盖90种语言的声音,就像把录音棚装进了浏览器标签页。对其他人来说,这又多了一个理由:当电话那头熟悉的声音开口借钱时,先挂断,再回拨确认。

标签: , , , , ,

在 Google 中添加我们

讨论

有 0 条评论。