Voxtral TTS 是什么?
2026年3月23日,Mistral AI 发布了 Voxtral TTS,这是他们第一个文本转语音模型。它能把文字变成听起来很自然的语音,支持 9 种语言,还能模仿不同人的声音。官方未说明它是否开源,目前可以通过 API 和 Mistral Studio 使用。
打个比方,它就像一个会学人说话的智能配音员:你给它一段文字和一个人的声音样本,它就能用那个人的声音把文字读出来,还能带感情。
它有什么特别的能力?
Voxtral TTS 只有 40 亿个参数,在 AI 模型里算很轻巧的。它能生成带有真实情感的声音,比如开心、中性、讽刺等语气。它还能在只听 3 秒声音样本的情况下,模仿一个人的说话方式,包括停顿、节奏、语调和情绪。
更厉害的是,它还能跨语言模仿:比如用一段法语的声音样本,让它用英语说话,结果会带有自然的法语口音。这就像一个人学外语时还带着家乡口音,听起来很真实。
它支持哪些语言?
Voxtral TTS 支持 9 种语言:英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语。官方还提供了美式、英式和法式口音的预设声音。
它训练时用了大量语音数据,所以能适应不同地区的口音和说话习惯。对于需要多语言语音的企业来说,这很方便。
它有多快?
对于语音助手来说,反应速度很重要。Voxtral TTS 的模型延迟只有 70 毫秒(处理 10 秒声音样本和 500 个字符的典型输入),实时因子约为 9.7 倍。它能一次生成最多 2 分钟的音频,API 还能处理更长的内容。
这意味着它说话几乎和真人一样快,不会让你等很久。
它的内部是怎么工作的?
Voxtral TTS 是一个基于 Transformer 的自回归流匹配模型,建立在 Ministral 3B 之上。它由三部分组成:一个 34 亿参数的 Transformer 解码器主干、一个 3.9 亿参数的流匹配声学 Transformer,以及一个 3 亿参数的神经音频编解码器。
模型接收 5 到 25 秒的声音提示和文本提示,然后逐帧预测语义标记,再通过流匹配生成声学特征。它使用自研的编解码器,以 12.5Hz 的帧率处理音频。
它和别的模型比怎么样?
官方进行了人类评估,让母语者对比 Voxtral TTS 和 ElevenLabs Flash v2.5。在零样本自定义声音场景下,Voxtral TTS 的自然度更胜一筹,同时保持相似的首次音频时间。它的质量与 ElevenLabs v3 相当,还能支持情感引导。
在语音定制胜率测试中,Voxtral TTS 获得了 68.4% 的偏好,而 ElevenLabs 为 31.6%。
谁适合用它?
Voxtral TTS 适合需要语音功能的企业,比如构建语音助手、客服系统或有声内容。它成本低、延迟低、容易定制,起价每千字符 0.016 美元。开发者可以通过 API 或 Mistral Studio 快速试用。
不过,官方未说明它是否开源,也没有提到语音克隆的伦理限制,使用时需要注意合规问题。
本文由 AIGCWHY 自动监测系统发现,经结构化处理后发布。重要决策请打开原文核验。