Mistral 7B 是什么?一句话说清楚身份

2023 年 9 月 27 日,Mistral AI 团队发布了 Mistral 7B。它是一个 7.3B 参数的大语言模型,采用 Apache 2.0 许可证开放权重,可以无限制使用、下载到本地、部署到任意云或 HuggingFace。官方同时提供了一个微调后的聊天版本 Mistral 7B Instruct。

打个比方,它就像一个只有七岁小孩体重的小个子跑步选手,却能在很多比赛中跑赢十三岁的大孩子。这里的“体重”就是参数数量,“跑步比赛”就是各种基准测试。它虽然个子小,但跑得快、吃得少,适合放在普通电脑或小服务器上运行。

它到底有多强?用成绩单说话

官方原文说,Mistral 7B 在所有基准上都超过了 Llama 2 13B,在很多基准上超过了 Llama 1 34B。在代码任务上接近 CodeLlama 7B,同时英文任务表现依然很好。在常识推理、世界知识、阅读理解、数学和代码等分类测试中,它都大幅领先同尺寸模型。

官方还提出了一个“等效模型大小”的指标:在推理、理解和 STEM 推理上,Mistral 7B 的表现相当于一个体积超过它三倍的 Llama 2 模型。这意味着它省下了大量内存,同时提高了处理速度。就像一个小书包能装下大书包的东西,还跑得更快。

它用了什么省力又聪明的技术?

Mistral 7B 使用了两项关键技术。第一是分组查询注意力(GQA),让模型在生成回答时更快。第二是滑动窗口注意力(SWA),每一层只关注前面 4096 个隐藏状态,计算成本随序列长度线性增长,而不是平方增长。

滑动窗口注意力还利用了 Transformer 的堆叠层:第 k 层的某个词可以关注到更早的信息,因为前一层已经帮它“看过”更远的地方。这就像接力赛跑,每一棒选手只跑自己那一小段,但接力棒把信息一路传下去,最终能覆盖很长的距离。官方还通过旋转缓冲区把缓存限制在窗口大小,在 8192 序列长度下节省了一半缓存内存。

怎么下载、部署和使用?

官方提供了多种使用路径:可以用参考实现下载到本地使用,可以通过 vLLM 推理服务器和 skypilot 部署到 AWS、GCP、Azure 等任意云,也可以直接在 HuggingFace 上使用。Apache 2.0 许可证意味着可以无限制使用,包括商业用途。

对于想自己动手改造的开发者,Mistral 7B 很容易微调。官方还提供了一个在 HuggingFace 公开指令数据集上微调的聊天版本 Mistral 7B Instruct,没有使用任何专有数据或技巧。这个聊天版本在 MT-Bench 上超过了所有 7B 模型,与 13B 聊天模型相当。

它有什么限制和需要注意的地方?

官方原文明确指出,Mistral 7B Instruct 没有任何审核机制。它只是一个快速演示,展示基础模型可以轻松微调出不错的效果。官方表示期待与社区合作,让模型更好地遵守护栏,以便部署在需要审核输出的环境中。

另外,在世界知识类基准上,Mistral 7B 与 Llama 2 13B 持平,并没有明显超越。官方解释这很可能是因为参数数量有限,能压缩的知识量受到限制。就像一个小朋友虽然跑得快,但背的百科知识没有大孩子多,遇到需要大量记忆的题目就不占优势。

谁适合用它?谁需要再想想?

适合使用 Mistral 7B 的人包括:想在自己电脑或小服务器上跑大模型的开发者、需要低成本推理的研究人员、想学习微调技术的学生和爱好者、以及需要把模型部署到云上但预算有限的团队。Apache 2.0 许可证对商业使用也很友好。

需要再想想的情况包括:需要模型输出经过严格审核的应用,因为官方明确说 Instruct 版本没有审核机制;需要大量世界知识问答的任务,因为小参数限制了知识容量;以及需要官方长期维护和安全更新的生产环境,原文没有说明后续支持计划。做决定前最好先在自己的任务上测试效果。

怎么核验这些说法?

官方原文给出了详细的基准测试分类和对比方法,包括常识推理、世界知识、阅读理解、数学和代码等类别,并说明所有模型都用同一套评估流程重新跑过,以保证公平比较。原文还注明了与 LLaMA2 论文评估的两点差异:MBPP 使用人工验证子集,TriviaQA 不提供维基百科上下文。

想核验的人可以下载模型,在 HuggingFace 上查看模型卡和许可证,用官方参考实现或 vLLM 复现推理,再在自己的任务上跑一遍。注意原文没有说明训练数据来源、训练算力总量、上下文窗口精确最大值和多语言表现,这些信息需要等官方后续补充或从社区实践中观察。

官方来源

本文由 AIGCWHY 自动监测系统发现,经结构化处理后发布。重要决策请打开原文核验。

查看原始发布信息 ↗