Mistral OCR 3 是什么?

2025年12月17日,Mistral AI 发布了 Mistral OCR 3。这是一款专门从文档中提取文字和图片的AI模型,可以处理PDF、扫描件、表单、手写笔记等。它通过API和Mistral AI Studio中的Document AI Playground开放使用,也支持自托管。

你可以把它想象成一位超级图书管理员:无论纸张上的字迹多潦草、表格多复杂,它都能快速准确地抄写下来,并整理成电脑能用的格式。

相比上一代有哪些提升?

Mistral OCR 3 在表单、手写内容、低质量扫描件和复杂表格上表现大幅提升。官方数据显示,它在这些任务上对Mistral OCR 2的胜率高达74%。

这意味着,以前难以识别的潦草字迹、歪斜的扫描件,现在都能被更准确地读取。

如何识别复杂表格?

Mistral OCR 3 能重建表格结构,包括表头、合并单元格和多行层级。它输出带有HTML标签的表格,这样电脑程序就能理解表格的布局,而不仅仅是文字。

就像一位细心的抄写员,不仅抄下表格里的数字,还画出了表格的格子线,让信息一目了然。

价格和开放方式如何?

Mistral OCR 3 的价格为每1000页2美元,如果使用批量API,还能享受50%折扣,即每1000页1美元。这比许多同类产品便宜。

开发者可以通过API调用模型(模型名为mistral-ocr-2512),普通用户则可以使用Studio中的Document AI Playground,拖拽文件就能得到干净的文本或JSON。

适合哪些场景?

Mistral OCR 3 适合处理发票、收据、政府文件、历史手稿等。早期客户用它来提取发票字段、数字化公司档案、从技术报告中提取文本,以及改进企业搜索。

它就像一个万能的文档转换器,能把纸质或图片文件变成电脑能理解的数据。

有哪些限制和注意事项?

官方未说明模型的具体参数大小、训练数据细节,以及支持哪些语言。虽然它支持自托管,但具体部署要求需要联系Mistral AI。

另外,它主要面向开发者和企业用户,普通用户可能需要通过Studio界面来使用。

适合哪些人使用?

Mistral OCR 3 适合需要处理大量文档的企业、开发AI应用的工程师,以及需要数字化历史档案的机构。对于学生来说,它也可以帮助把纸质笔记变成电子文本。

总之,只要你有“把纸上的字变成电脑里的字”的需求,Mistral OCR 3 都可能帮上忙。

官方来源

本文由 AIGCWHY 自动监测系统发现,经结构化处理后发布。重要决策请打开原文核验。

查看原始发布信息 ↗