Mistral NeMo 是什么?

2024年7月18日,Mistral AI 与 NVIDIA 合作发布了一个名叫 Mistral NeMo 的大语言模型。它是一个 12B(120亿参数)的模型,采用 Apache 2.0 开源许可证,开放了预训练基础版和指令微调版的权重。简单说,它就像一个精通多国语言的翻译官兼程序员助手,能帮你写代码、回答问题,而且它的“笔记本”特别大,能记住长达 128k 个 token 的内容,相当于一本几百页的书。

Mistral NeMo 是 Mistral AI 和 NVIDIA 一起开发的,属于 Mistral 系列模型的新成员。它使用标准架构,可以轻松替换任何使用 Mistral 7B 的系统,就像给电脑换一个更强大的零件一样方便。

它有什么特别的能力?

Mistral NeMo 支持长达 128k 个 token 的上下文窗口,这意味着它可以一次性处理非常长的文本,比如整份合同或一整本书。它在推理、世界知识和编码准确性方面,在同类尺寸的模型中达到了最先进的水平。它还专门训练了函数调用能力,可以更好地与外部工具配合。

这个模型特别擅长多语言,包括英语、法语、德语、西班牙语、意大利语、葡萄牙语、中文、日语、韩语、阿拉伯语和印地语。就像一个能流利说十几种语言的翻译官,无论你用什么语言提问,它都能理解并回答。

Tekken 分词器是什么?

Mistral NeMo 使用了一个新的分词器叫 Tekken,它基于 Tiktoken 构建,训练了超过 100 种语言。分词器就像把一句话切成小块,方便模型理解。Tekken 在压缩自然语言和源代码方面比之前的 SentencePiece 分词器更高效,特别是在压缩源代码、中文、意大利语、法语、德语、西班牙语和俄语时,效率提高了约 30%。

对于韩语和阿拉伯语,Tekken 的压缩效率分别是之前的 2 倍和 3 倍。与 Llama 3 的分词器相比,Tekken 在约 85% 的语言上表现更好。这意味着模型处理这些语言时更快、更省资源。

指令微调让它更听话

Mistral NeMo 经过了先进的指令微调和对齐阶段。与 Mistral 7B 相比,它在遵循精确指令、推理、处理多轮对话和生成代码方面表现更好。就像一个经过专门训练的学生,能更准确地理解老师的要求并完成任务。

官方用 GPT-4o 作为裁判,在官方参考上进行了评估,结果显示指令微调版在多项任务上都有显著提升。这意味着你可以更放心地让它帮你完成复杂的任务,比如写代码或回答专业问题。

如何获取和使用?

Mistral NeMo 的权重托管在 HuggingFace 上,包括基础版和指令版。你可以使用 mistral-inference 来尝试它,用 mistral-finetune 来微调它。它也在 la Plateforme 上以 open-mistral-nemo-2407 的名称提供。此外,它还被打包成 NVIDIA NIM 推理微服务容器,可以从 ai.nvidia.com 获取。

由于采用 Apache 2.0 许可证,研究人员和企业可以自由使用、修改和分发这个模型。这就像拿到了一份公开的食谱,你可以照着做菜,也可以根据自己的口味调整。

适合哪些人使用?

Mistral NeMo 适合需要多语言支持的开发者和企业,比如做跨国客服、文档翻译或代码辅助工具。它也适合研究人员,因为开源权重允许他们深入研究和改进模型。对于初学者,可以通过 la Plateforme 或 NVIDIA NIM 快速体验。

不过,它需要一定的计算资源来运行,尤其是 128k 上下文窗口会占用较多内存。如果你只是简单聊天,可能不需要这么强大的模型。另外,官方未说明模型的具体训练数据截止日期和推理延迟,使用前最好先测试是否符合你的需求。

有哪些限制和未知?

官方未说明 Mistral NeMo 的训练数据截止日期、训练成本、推理延迟和吞吐量等性能指标,也未说明是否提供 API 免费试用额度。这些信息对于评估模型的实际应用很重要,建议在使用前查阅最新文档或联系官方。

此外,虽然模型在多语言和代码方面表现优秀,但它在某些特定领域(如医疗、法律)的准确性可能有限,需要结合专业判断。开源许可证允许商用,但使用者仍需遵守 Apache 2.0 的条款。

官方来源

本文由 AIGCWHY 自动监测系统发现,经结构化处理后发布。重要决策请打开原文核验。

查看原始发布信息 ↗