Voxtral Transcribe 2 是什么?

2026年2月4日,Mistral AI 发布了新一代语音转文字模型 Voxtral Transcribe 2。它包含两个模型:Voxtral Mini Transcribe V2 用于批量转录,Voxtral Realtime 用于实时转录。其中 Realtime 模型以 Apache 2.0 开源,开发者可以自由使用和修改。

简单来说,它能把音频变成文字,就像给声音装上了即时的文字速记员。它支持13种语言,包括英语、中文、印地语等,还能区分说话人,并给出每个词的时间戳。

Voxtral Realtime:实时转录的利器

Voxtral Realtime 专为需要低延迟的场景设计,比如语音助手、实时字幕。它采用流式架构,音频一边输入一边转录,延迟可低至200毫秒以下,几乎感觉不到等待。

在2.4秒延迟下,它的准确率与批量模型相当;在480毫秒延迟下,词错误率仅增加1-2%。模型参数量为4B,可以在边缘设备上运行,保护隐私。

Voxtral Mini Transcribe V2:高性价比的批量转录

Voxtral Mini Transcribe V2 是批量转录模型,在 FLEURS 基准上词错误率约4%,API 价格仅为每分钟0.003美元,性价比极高。它支持说话人分离、上下文偏置(可提供最多100个词或短语来纠正专有名词)、词级时间戳,还能处理长达3小时的音频。

在嘈杂环境(如工厂、呼叫中心)中也能保持准确,适合会议记录、访谈分析等场景。

开源与闭源:如何获取?

Voxtral Realtime 的模型权重已在 Hugging Face 上以 Apache 2.0 许可证开源,开发者可以下载并部署到自己的服务器或边缘设备。Voxtral Mini Transcribe V2 则通过 API 提供,价格为每分钟0.003美元,官方未说明是否开源。

此外,Mistral Studio 推出了音频测试平台,用户可以上传音频文件,测试转录、说话人分离等功能。

用途与适用人群

Voxtral Transcribe 2 可用于多种场景:会议记录(自动区分发言人)、语音助手(实时响应)、呼叫中心自动化(实时分析对话)、媒体字幕(多语言实时字幕)、合规记录(带时间戳的审计轨迹)。

适合开发者、企业、媒体机构等需要语音转文字服务的用户。对于学生,它可以帮助把课堂录音变成笔记,但需注意隐私。

限制与注意事项

官方说明,上下文偏置功能目前仅优化了英语,其他语言支持为实验性。模型在重叠语音时通常只转录一个说话人。实时模型的延迟可配置,但具体效果取决于硬件和网络。

此外,虽然支持13种语言,但非英语性能虽优于竞品,仍可能不如英语准确。使用开源模型时,需遵守 Apache 2.0 许可证。

总结

Voxtral Transcribe 2 是 Mistral AI 在语音领域的重要更新,提供了高性价比的批量转录和低延迟的实时转录,并开源了实时模型。它让语音转文字技术更易用、更普及。

对于小学生来说,可以想象一个超级速记员,他听人说话就能立刻写下文字,还能分清谁在说话,甚至能纠正名字的拼写。这个速记员现在有两个版本:一个适合慢慢听(批量),一个适合边听边写(实时)。

官方来源

本文由 AIGCWHY 自动监测系统发现,经结构化处理后发布。重要决策请打开原文核验。

查看原始发布信息 ↗