Mixtral 8x22B 是什么?谁发布的?

2024年4月17日,Mistral AI 发布了 Mixtral 8x22B,这是他们最新的一款开源大语言模型。它采用 Apache 2.0 许可证,这是最宽松的开源协议之一,意味着任何人都可以免费使用、修改和分发这个模型,没有限制。

你可以把它想象成一个超级大的工具箱,里面装了1410亿件工具,但每次干活只需要拿出其中390亿件最合适的工具来用。这种设计叫“稀疏混合专家模型”,既省力又厉害。它能流利使用英语、法语、意大利语、德语和西班牙语,擅长数学和编程,还能记住很长的对话内容。

为什么说它“更便宜、更好、更快、更强”?

Mixtral 8x22B 的总参数量是1410亿,但每次推理只激活390亿参数。这意味着它运行起来比那些每次都要用全部参数的“稠密模型”更省计算资源,速度也更快。原文说它比任何稠密70B模型都快,同时能力超过其他所有开源权重模型。

“更便宜”体现在它的成本效率上:因为只激活一部分参数,所以运行成本更低。“更好”和“更强”则体现在它的性能上,在推理、数学、编程和多语言任务中都领先于其他开源模型。“更快”是因为稀疏激活让计算量大幅减少。

它有哪些具体能力?

Mixtral 8x22B 支持五种语言:英语、法语、意大利语、德语和西班牙语。它在数学和编程方面表现特别强,在 HumanEval、MBPP、GSM8K 等基准测试中都是开源模型里最好的。指令微调版本在 GSM8K maj@8 上得分90.8%,在 Math maj@4 上得分44.6%。

它还原生支持函数调用,配合 la Plateforme 上的约束输出模式,可以大规模开发应用和现代化技术栈。它的上下文窗口有64K tokens,能从大型文档中精确回忆信息。就像一个记忆力超强又擅长算数和写代码的助手,还能同时听懂好几种语言。

什么是稀疏混合专家模型?

稀疏混合专家模型(SMoE)是一种特殊的模型结构。它内部有很多个“专家”子网络,但每次处理一个词或一个任务时,只挑选其中一小部分专家来工作,而不是让所有专家都参与。Mixtral 8x22B 有1410亿总参数,但每次只激活390亿。

这就像一家大医院里有很多专科医生,但你看病时只需要挂对应的科室,不用把所有医生都叫来。这样既保证了医院整体水平高,又不会浪费资源。原文说这种稀疏激活模式让它比任何稠密70B模型都快,同时能力更强。

它和 Mistral 其他模型是什么关系?

Mixtral 8x22B 是 Mistral AI 开源模型家族的自然延续。之前他们发布了 Mistral 7B 和 Mixtral 8x7B,都是高效模型。Mixtral 8x22B 在性能上进一步提升,同时保持成本效率。原文图1展示了 Mistral 7B、Mixtral 8x7B 和 Mixtral 8x22B 在性能与推理预算之间的权衡,它们都属于高效模型家族。

基础模型的开放使得它成为微调应用的绝佳基础。开发者可以在它的基础上针对特定任务进行训练,就像买了一套精装修的房子,你可以根据自己的喜好重新布置家具。

它适合谁用?有什么限制?

Mixtral 8x22B 适合开发者、研究人员和企业用户。开发者可以用它来构建应用、现代化技术栈;研究人员可以用它做实验和微调;企业可以用它处理多语言文档、代码生成和数学推理任务。它已经在 la Plateforme 上开放使用。

限制方面,原文没有说明模型的具体训练数据来源、训练成本、推理硬件要求、API 定价细节,也没有说明微调所需的最低硬件配置。另外,虽然它支持五种语言,但其他语言的表现官方未说明。使用前需要确认自己的硬件能否支持1410亿参数的模型加载和推理。

如何核验这些信息?

你可以访问 Mistral AI 官网的新闻页面,找到2024年4月17日的文章“Cheaper, Better, Faster, Stronger”。文章明确写了 Mixtral 8x22B 采用 Apache 2.0 许可,是稀疏混合专家模型,总参数1410亿、激活参数390亿,支持五种语言,具备函数调用和64K上下文窗口。

你还可以在 la Plateforme 上直接试用模型,或者查看 Hugging Face 等平台上的模型卡,确认许可证和参数信息。如果看到其他来源说它是闭源或需要付费才能使用,那是不准确的,因为原文明确说它是 Apache 2.0 开源。

官方来源

本文由 AIGCWHY 自动监测系统发现,经结构化处理后发布。重要决策请打开原文核验。

查看原始发布信息 ↗