Mixtral 8x7B 是什么?
2023年12月11日,Mistral AI 发布了 Mixtral 8x7B,这是一个开放权重的稀疏混合专家模型,采用 Apache 2.0 许可证。它由 Mistral AI 团队开发,能处理32k上下文、五种语言和代码生成,性能超越 Llama 2 70B 并匹配 GPT-3.5。就像一支由8个专科医生组成的团队,每次只叫最合适的2个医生来看病,既快又省力。
这个模型是 Mistral AI 继续为开发者社区提供最佳开放模型使命的一部分。它同时发布了 Mixtral 8x7B Instruct 版本,经过监督微调和直接偏好优化,在 MT-Bench 上达到8.30分,成为最佳开源模型之一。
稀疏混合专家是怎么工作的?
Mixtral 是一个稀疏混合专家网络,属于解码器-only 模型。它的前馈块从8组不同的参数中挑选,每一层、每个 token,一个路由网络选择其中两组(称为“专家”)来处理 token,并将它们的输出相加合并。这种技术增加了模型的总参数量,但每个 token 只使用一部分参数,从而控制成本和延迟。
具体来说,Mixtral 有46.7B总参数,但每个 token 只使用12.9B参数。因此,它处理输入和生成输出的速度与成本和12.9B模型相同。这就像一家大公司有很多部门,但每个任务只调动最相关的两个部门,既高效又省钱。
Mixtral 8x7B 能做什么?
Mixtral 能优雅地处理32k token 的上下文,支持英语、法语、意大利语、德语和西班牙语。它在代码生成方面表现强劲,并且可以通过微调变成指令跟随模型,在 MT-Bench 上达到8.3分。这意味着它可以帮助写代码、回答问题、翻译语言等。
例如,你可以让它写一段 Python 代码,或者用法语写一封邮件。它还能在需要时被提示禁止某些输出,用于需要强审核的应用,但如果没有这样的提示,它会直接遵循指令。
性能表现如何?
Mistral AI 将 Mixtral 与 Llama 2 家族和 GPT-3.5 基础模型进行了比较。Mixtral 在大多数基准上匹配或超越 Llama 2 70B 和 GPT-3.5。在质量与推理预算的权衡上,Mistral 7B 和 Mixtral 8x7B 属于高效模型家族。
在幻觉和偏见方面,与 Llama 2 相比,Mixtral 在 BBQ 基准上表现出更少的偏见,在 BOLD 上整体呈现更积极的情感,各维度方差相似。这些评估帮助识别需要通过微调或偏好建模纠正的缺陷。
如何部署和使用?
为了让社区能用完全开源的堆栈运行 Mixtral,Mistral AI 向 vLLM 项目提交了更改,集成了 Megablocks CUDA 内核以实现高效推理。Skypilot 允许在任何云实例上部署 vLLM 端点。此外,Mixtral 8x7B 已在 Mistral AI 平台的 mistral-small 端点后面使用,目前处于测试阶段。
开发者可以注册获取所有生成和嵌入端点的早期访问。这意味着你可以自己搭建服务,也可以直接通过 Mistral AI 的平台调用。
有哪些限制和注意事项?
官方未说明训练数据的具体来源和截止日期,也未说明模型在安全对齐方面的完整评估结果。虽然 Mixtral 在偏见和幻觉方面有改进,但任何模型都可能产生不准确或有害的输出。使用时需要根据应用场景进行适当的提示和审核。
另外,Mixtral 是开放权重模型,但并非完全开源所有训练细节。Apache 2.0 许可证允许商业使用,但用户需遵守许可证条款。对于需要强审核的应用,建议使用提示或偏好调优来限制输出。
适合哪些人使用?
Mixtral 适合开发者、研究人员和公司,尤其是那些需要高效、低成本且性能强大的开源模型的人。它适合用于代码生成、多语言任务、聊天机器人等。对于小学生和初中生来说,可以把它想象成一个聪明的助手,能帮你解答问题,但需要大人指导使用。
如果你是想学习 AI 的学生,可以通过开源社区了解如何运行和微调模型。但要注意,模型本身不会理解对错,需要人类来引导和检查。
本文由 AIGCWHY 自动监测系统发现,经结构化处理后发布。重要决策请打开原文核验。