同一段十秒录音,测出的不是同一种能力
MarkTechPost 以同一名说话人在安静房间录制的十秒 WAV 作为参考,让 ElevenLabs、Cartesia、Inworld、Gradium、Fish Audio、Resemble AI 和 Hume 走各自的默认即时克隆流程,再朗读相同的两句文本。一句偏对话,另一句包含数字和专有名词,结果先以匿名方式并排呈现,读者可以在看到厂商名称前进行盲听判断。这个设计抓住了语音克隆与普通语音合成的差别:普通合成首先要“好听”,克隆则必须让人相信“这是同一个人”。
但这并不是完全对称的实验。Hume 将最低参考音频要求设为十五秒,因此测试使用了延长后的同一说话人样本。ElevenLabs 则建议即时克隆使用一到两分钟干净音频,十秒样本低于其厂商指导。也就是说,这次比较适合观察各家低门槛即时路径的体验差异,却不能直接当作七家专业克隆能力的排名。
“即时克隆”和“专业克隆”是两种取舍
材料中所谓即时克隆,是在请求发生时用参考音频去条件化一个已有模型。它的价值是样本少、等待短、适合把克隆能力嵌入交互式产品,但身份表现会更依赖参考音频质量、长度以及模型本身的泛化能力。专业克隆则使用说话人的数据对模型进行微调,通常需要更长的素材,换取更稳定的身份保真和更明确的训练流程。
供应商给出的门槛正好说明了这种分层。ElevenLabs 的即时路径建议一到两分钟音频,专业克隆至少需要三十分钟,理想状态是两到三小时。其他平台的专业路径也大多需要十到三十分钟,Gradium 对专业克隆列出三十分钟要求并建议两小时,Inworld 的测试路径则标注至少十分钟且处于 beta、仅支持英语。技术负责人不能只问“有没有 voice cloning API”,还要先确定产品需要的是一次性角色试音、低延迟个性化,还是需要长期稳定复现某位说话人的生产能力。
自然度冠军,可能不是身份保真冠军
公开数据进一步打破了“听起来最舒服就是最像”的直觉。Hume 在 2026 年 9 月 10 日发布的 Voice Replication Leaderboard 测试了 11 个模型、25 种参考声音和 7 个提示,由 3 名盲评者对每段音频按是否像参考声音打分。在本文涉及的供应商中,Fish Audio s2-pro 的身份相似度最高,得分 4.03;Cartesia sonic-3.5 为 3.70,ElevenLabs Multilingual v2 为 3.68。
分项结果更值得用于选型。Cartesia sonic-3.6-beta 的自然度最高,达到 4.36,但身份相似度排名第八。Inworld TTS-2 的音频质量最高,得分 4.61,而 ElevenLabs Eleven v3 在身份相似度上排在 11 个模型的最后,得分 2.91。这个结果并不意味着某个模型在所有场景都更差,而是说明“自然度”“音频质量”和“身份保真”是不同指标。把它们压成一个试听印象,会让产品团队误选一个声音很顺、却不像目标说话人的系统。
授权不是合规附录,而是产品入口
这次比较把参考音频要求、同意验证、商业许可和语言覆盖放在同一张表里,揭示了语音克隆的另一个变化:授权流程已经成为 API 能否进入生产环境的一部分。ElevenLabs 的即时克隆要求权利声明,专业克隆还使用 Voice Captcha,让声音所有者朗读屏幕文字。Cartesia 要求依照条款取得许可,Inworld 要求确认权利,Gradium 的政策要求所有者同意,Fish Audio 的专业克隆包含实时所有权检查,Resemble AI 则要求专业克隆具备可验证的同意。Hume 的描述是从获得同意的说话人上传素材。
这些机制的强度并不相同,而且材料也显示,许多平台仍然主要依赖声明或条款,而不是普遍存在的技术核验。因此,企业接入时不能把“供应商写了 consent”当成风险已经解决。需要把谁能上传、谁能批准、授权覆盖哪些语言和商业用途、声音如何撤回,以及审计记录保留多久,转化为具体的接入条件。对品牌声线、客服身份或涉及公众人物的场景,克隆能力越强,授权链条越不能被产品体验的便利性掩盖。
价格表不能替代部署模型
公开列表价看起来给出了直接答案,但实际并没有一个简单的“最便宜平台”。材料中的自助方案从每月 5 美元到 15 美元不等,语言覆盖从 5 种到 200 多种语言和地区。Fish Audio 按每百万 UTF-8 字节 15 美元计费,Inworld TTS-2 约为每百万字符 12.50 至 25 美元,Gradium 约为 36 至 58 美元,ElevenLabs 则根据模型和套餐约为 50 至 100 美元。Resemble AI 的页面没有列出 TTS 单价,材料使用 2026 年年中的第三方追踪估算,约为每秒 0.0005 美元,并按每分钟约 1,000 个字符换算,因此不能与厂商明确标出的字符价等量齐观。
更大的问题是,单价只覆盖合成阶段,不能代表获得可用声音的总成本。专业克隆可能要求更高套餐、更多训练素材和更严格的授权流程,多语言产品还会受到计费单位差异的影响。UTF-8 字节计费、字符计费和按秒计费,在不同语言和文本长度下会产生不同结果。更稳妥的做法是先按身份保真、自然度、授权强度、语言覆盖和单位成本建立部署评分,再用目标月量计算总账,而不是先按试听效果或最低报价筛选供应商。