Mistral OCR 是什么?

2025年3月6日,Mistral AI 团队发布了一个叫 Mistral OCR 的新工具。它是一个光学字符识别 API,简单说就是“看图识字”的电脑程序。你给它一张图片或者一个 PDF 文件,它就能把里面的文字、表格、公式甚至图片都找出来,并且按照顺序整理成电脑能读懂的文字和图片。

这个工具是闭源服务,也就是说,你不能把它的“大脑”搬回自己家,但可以通过网络调用它的能力。它就像一个超级厉害的“文档翻译官”,能把任何纸质文件变成电脑能读懂的文字和图片,还能把表格、公式都整理得清清楚楚。官方说,这个模型已经被用在 Le Chat 上,服务数百万用户,并且现在可以通过 API 使用,价格是 1000 页/美元。

它有什么特别的本领?

Mistral OCR 最厉害的地方是它能理解复杂的文档。比如,一份科学论文里可能有图表、数学公式、表格,还有各种排版,它都能准确识别。它还能处理多种语言,官方说它能解析、理解和转录来自各大洲的数千种文字、字体和语言。这就像一位不仅认识汉字,还认识英文、法文、阿拉伯文等多种语言的“翻译官”,而且还能看懂数学公式和表格。

另外,它速度非常快,官方说在单个节点上每分钟能处理多达 2000 页。它还支持“文档即提示”,也就是说,你可以把文档当作提示词,让它提取特定信息并输出成 JSON 这样的结构化格式,方便后续的程序调用。对于需要高度保密信息的组织,它还提供选择性自托管选项,让敏感信息留在自己的基础设施内。

它能用来做什么?

Mistral OCR 可以用在很多地方。比如,科研机构可以用它把科学论文和期刊转换成 AI 能读的格式,加快科研合作。博物馆、图书馆等文化机构可以用它数字化历史文档和文物,让更多人能看到。客服部门可以用它把说明书和手册变成索引知识,更快地回答客户问题。设计、教育、法律等行业也可以用它把技术文献、工程图纸、讲义、演示文稿、监管文件等转换成可索引、可回答的格式。

官方还提到,它适合和 RAG 系统结合使用,处理多模态文档,比如幻灯片或复杂的 PDF。简单说,就是让 AI 能更好地理解和利用文档里的信息,就像给 AI 配了一副能看懂各种文档的“眼镜”。

它的表现怎么样?

官方给出了一些基准测试结果。在整体、数学、多语言、扫描件、表格等多项测试中,Mistral OCR 2503 的得分都超过了 Google Document AI、Azure OCR、Gemini-1.5-Flash-002、Gemini-1.5-Pro-002、Gemini-2.0-Flash-001 和 GPT-4o-2024-11-20 等模型。比如,在整体测试中,Mistral OCR 2503 得分 94.89,而其他模型大多在 83 到 90 之间。

在多语言测试中,Mistral OCR 2503 在俄语、法语、印地语、中文、葡萄牙语、德语、西班牙语、土耳其语、乌克兰语、意大利语、罗马尼亚语等语言上的模糊匹配生成得分都接近或超过 99,而其他模型大多在 95 到 98 之间。这说明它在多语言文档识别上确实有优势。

怎么使用和收费?

Mistral OCR 的 API 名称为 mistral-ocr-latest,已经在 Mistral 的开发者平台 la Plateforme 上线。定价是 1000 页/美元,如果使用批处理推理,大约可以翻倍到 2000 页/美元。官方说,它即将登陆云和推理合作伙伴,以及本地部署。对于需要自托管的组织,可以联系 Mistral 探讨自部署方案。

需要注意的是,官方在页面顶部标注了这个模型已经弃用,不再维护,并被最新的、更强大的 OCR 模型取代。所以,如果你现在想用,可能需要查看 Mistral 的最新模型列表,找到替代的 OCR 模型。但作为一次产品发布,它当时提供了完整的 API 和定价信息。

它有什么限制?

首先,它是一个闭源服务,你不能直接下载模型权重自己运行,只能通过 API 调用。虽然提供选择性自托管,但需要联系官方,具体条件官方未说明。其次,它已经被弃用,官方明确说不再维护,所以新用户应该考虑替代模型。另外,官方未说明模型的具体参数量、训练数据细节、支持的语言总数等。

还有,虽然它支持多语言,但官方未说明是否覆盖所有语言,以及对于手写体、低质量扫描件等特殊情况的处理能力。定价方面,批处理推理的具体折扣比例官方未说明,只说“大约翻倍”。自托管的具体条件、费用和技术要求也官方未说明。

适合哪些人使用?

Mistral OCR 适合需要处理大量文档的组织,比如科研机构、文化机构、客服部门、法律和金融行业等。它特别适合需要多语言文档识别、复杂表格和公式提取的场景。对于有严格数据隐私要求的组织,可以选择自托管选项。对于开发者,可以通过 API 快速集成文档识别功能。

不过,由于它已被弃用,新用户应该关注 Mistral 的最新 OCR 模型。对于小学生和初中生来说,可以把它想象成一个超级能干的“文档小助手”,能帮你把图片里的文字变成可以编辑的文字,把表格变成数据,把公式变成可计算的表达式。但记住,它需要通过网络调用,而且现在有了更新的版本。

官方来源

本文由 AIGCWHY 自动监测系统发现,经结构化处理后发布。重要决策请打开原文核验。

查看原始发布信息 ↗