Mistral OCR 4是什么?
2026年6月23日,Mistral AI发布了Mistral OCR 4,这是一款文档解析模型。它能把PDF、Word、PPT等文档中的文字、表格、图片等内容提取出来,并整理成结构化的信息。
你可以把它想象成一位超级图书管理员,他不仅会读书,还会在每页上做标记:哪里是标题,哪里是表格,哪里是签名,甚至还会告诉你他对每个标记有多确定。
它有什么新本领?
OCR 4最大的新本领是“边界框”和“块分类”。边界框就像给文档里的每个文字块画一个框,标明它的位置;块分类则是告诉你是标题、表格还是其他类型。
另外,它还会给出“置信度分数”,就像老师批改作业时写的“很有把握”或“不太确定”,这样你就能知道哪些信息需要人工检查。
支持哪些语言和格式?
OCR 4支持170种语言,分为10个语系,包括一些其他系统处理不好的专业语言和低资源语言。
它接受常见的办公文档格式,比如PDF、DOC、PPT和OpenDocument,所以大多数企业文档都能处理。
性能表现如何?
在人类评估中,独立标注员在超过600份真实文档上对比,OCR 4的胜率平均达到72%,超过了所有测试的竞品。
在公开基准OlmOCRBench上,它取得了85.20的最高分;在内部多语言评估中得分0.98;在OmniDocBench上得分93.07。不过官方也提醒,这些基准有评分局限,实际效果可能更好或更差。
如何部署和使用?
OCR 4可以通过API调用,也可以在Mistral Studio的Document AI中使用,后者无需代码,适合非技术团队。
对于需要数据隐私的企业,OCR 4可以部署在单个容器中,完全自托管,让文档数据留在自己的环境里,满足数据主权和合规要求。
价格和适用场景
API定价为每1000页4美元,批量API有50%折扣,即2美元每1000页;Document AI定价为每1000页5美元。
它适合企业搜索、RAG(检索增强生成)、智能体工作流等场景,比如自动处理发票、表单、合规检查等。官方还提到,OCR 4是Mistral Search Toolkit的组件,该工具已公开预览。
限制和注意事项
官方指出,OCR 4是一个“小而专注”的模型,但未说明具体参数大小。基准测试存在已知局限,比如参考标注错误、格式噪音等,所以分数不能完全代表真实性能。
自托管部署仅对企业客户开放,个人开发者主要通过API使用。模型是否开源,官方未说明。
适合谁用?
如果你是企业开发者,需要从大量文档中提取结构化信息,OCR 4是一个高效且成本可控的选择。
如果你关心数据隐私,需要本地部署,OCR 4的单容器设计也很友好。对于学生或普通用户,可以通过Document AI的无代码界面体验,无需编程。
本文由 AIGCWHY 自动监测系统发现,经结构化处理后发布。重要决策请打开原文核验。