Pixtral Large 是什么?

2024年11月18日,Mistral AI 发布了 Pixtral Large,这是一个 124B 参数的开源权重多模态模型,基于 Mistral Large 2 构建。它能够理解文档、图表和自然图像,同时保持领先的纯文本理解能力。你可以把它想象成一个既会看图又会读字的超级助手,比如你给它一张菜单,它就能帮你算账。

Pixtral Large 是 Mistral 多模态家族中的第二个模型,采用 Mistral 研究许可证(MRL)和商业许可证,研究用途可免费使用,商业用途需要获得许可。官方未说明训练数据的具体来源和规模。

它有哪些核心能力?

Pixtral Large 在多个多模态基准测试中表现出色。在 MathVista 上,它达到了 69.4% 的准确率,超过了所有其他模型。在 ChartQA 和 DocVQA 上,它超越了 GPT-4o 和 Gemini-1.5 Pro。在 MM-MT-Bench 上,它优于 Claude-3.5 Sonnet、Gemini-1.5 Pro 和 GPT-4o。在 LMSys Vision Leaderboard 上,它是最佳开源权重模型,领先第二名近 50 ELO 分。

这些测试就像考试,Pixtral Large 在数学推理、图表理解和文档问答方面都拿到了高分。它还能处理多语言 OCR 和推理,比如识别收据并计算总价。

如何使用 Pixtral Large?

你可以通过 le Chat 试用 Pixtral Large,也可以在 Mistral API 中使用 pixtral-large-latest 模型。此外,你还可以从 Hugging Face 下载模型权重进行自部署。官方未说明推理所需的硬件配置。

对于商业用途,需要获得 Mistral 商业许可证。研究用途则遵循 Mistral 研究许可证。官方未说明模型是否支持微调。

它有哪些限制?

Pixtral Large 目前已被标记为弃用,不再维护,并被更新的视觉和多模态模型取代。官方未说明弃用的具体原因和替代模型的具体信息。

此外,模型采用 128K 上下文窗口,可以容纳至少 30 张高分辨率图像,但官方未说明在多语言任务上的具体表现数据。模型可能对某些特定领域的图像理解有限。

谁适合使用 Pixtral Large?

Pixtral Large 适合研究人员、开发者和企业用户。研究人员可以免费使用它进行多模态研究;开发者可以通过 API 快速集成图像理解功能;企业可以用于文档智能、图表分析、客户服务等场景。

对于小学生和初中生来说,可以把它想象成一个能帮你读图解题的智能工具,但需要在大人的指导下使用。

如何核验信息?

你可以访问 Mistral AI 的官方网站查看原始公告,或者在 Hugging Face 上查看模型卡片。官方未说明模型的具体架构细节,但你可以通过 API 文档了解调用方式。

如果你对性能数据有疑问,可以查看官方提供的基准测试结果,或自行在标准数据集上测试。官方未说明模型是否支持微调,如有需要可联系 Mistral AI 获取更多信息。

官方来源

本文由 AIGCWHY 自动监测系统发现,经结构化处理后发布。重要决策请打开原文核验。

查看原始发布信息 ↗