Pixtral 12B 是什么?

2024年9月17日,Mistral AI 发布了 Pixtral 12B,这是一个原生多模态模型,采用 Apache 2.0 开源许可证。它能同时理解图片和文字,支持任意尺寸图片和 128K 长上下文,就像一个同时会看图说话和读书写字的智能小助手。

Pixtral 12B 基于 Mistral Nemo 12B 构建,新增了一个 400M 参数的视觉编码器,可以处理自然图像和文档,在 MMMU 推理基准上达到 52.5%,超过了许多更大的模型。

它有什么特别的本领?

Pixtral 12B 能看懂各种图片,比如图表、图形、文档,还能回答关于图片的问题。它支持可变图像尺寸和宽高比,可以按图片原本的分辨率处理,这样既准确又快速。它还能在 128K 的上下文窗口里处理任意数量的图片。

与之前开源模型不同,Pixtral 12B 在多模态任务上表现出色的同时,没有牺牲文本能力。它在指令遵循、编程和数学等文本基准上保持了领先水平。

它是怎么工作的?

Pixtral 12B 有两个主要部分:视觉编码器和多模态 Transformer 解码器。视觉编码器把图片切成 16×16 的小块,转换成图像令牌,然后加上 [IMG BREAK] 和 [IMG END] 标记,让模型能区分不同宽高比的图片。

解码器则根据文字和图片的序列预测下一个文字令牌。模型在交错的图像和文本数据上训练,因此能处理任意数量、任意尺寸的图片。

它有多厉害?

在评估中,Pixtral 12B 在同等规模的开源模型中表现最佳,甚至超过了一些闭源模型如 Claude 3 Haiku,并在多模态基准上匹配或超过更大的 LLaVa OneVision 72B。在指令遵循方面,它比 Qwen2-VL 7B、LLaVa-OneVision 7B 和 Phi-3.5 Vision 有显著提升。

官方还创建了多模态版本的指令遵循基准 MM-IF-Eval 和 MM-MT-Bench,Pixtral 在这些基准上也优于开源替代品,并将开源 MM-MT-Bench 给社区。

怎么使用它?

Pixtral 12B 采用 Apache 2.0 许可证,可以免费用于商业和非商业用途。你可以在 La Plateforme 或 Le Chat 上试用它。官方未说明具体的 API 定价和硬件要求。

由于它是开源的,开发者可以下载模型权重,在自己的服务器上运行和微调。它适合需要多模态理解能力的应用,比如文档问答、图表分析、多图推理等。

它有什么限制?

官方未说明训练数据的具体来源和规模,也未说明模型是否支持中文等多语言能力。此外,模型已被标记为弃用,不再维护,被更新的视觉和多模态模型取代。

虽然它在多模态任务上表现优秀,但可能在某些特定领域或复杂推理上仍有不足。用户需要根据实际需求评估是否适合使用。

适合哪些人使用?

Pixtral 12B 适合研究人员、开发者和企业,用于构建需要同时处理图像和文本的 AI 应用,比如智能文档分析、图表理解、多模态对话等。也适合学习多模态模型的学生和爱好者。

由于它是开源的,任何人都可以免费获取和使用,但需要一定的技术能力来部署和微调。对于小学生和初中生,可以把它想象成一个能看懂图片的智能机器人,帮助解答问题。

官方来源

本文由 AIGCWHY 自动监测系统发现,经结构化处理后发布。重要决策请打开原文核验。

查看原始发布信息 ↗