Codestral Mamba 是什么?
2024年7月16日,Mistral AI 发布了 Codestral Mamba,这是一个专门用来帮助写代码的 AI 模型。它采用 Apache 2.0 许可证,这意味着任何人都可以免费使用、修改和分享它,就像一份公开的菜谱,谁都可以照着做菜,还能自己改口味。
Codestral Mamba 有 72.85 亿个参数,参数就像模型大脑里的“小开关”,数量越多,通常能处理越复杂的问题。它支持长达 256k 的上下文,相当于能记住很长的对话或代码文件,不会聊着聊着就忘了前面说过什么。
为什么它叫 Mamba?和普通模型有什么不同?
大多数 AI 模型用的是 Transformer 架构,就像一条流水线,每个零件都要和所有其他零件打招呼,零件多了就会很慢。而 Mamba 架构像一条传送带,每个零件只和相邻的零件交流,所以速度更快,而且理论上可以处理无限长的序列。
Codestral Mamba 就是基于这种 Mamba 架构训练的,它特别适合代码生成,因为写代码经常需要参考很长的文件。Mistral AI 说,它的表现和目前最好的 Transformer 模型差不多,而且响应速度很快,不管输入多长。
它能做什么?
Codestral Mamba 是一个指令模型,也就是说你可以直接告诉它你想写什么代码,它就会帮你生成。它被训练来理解和生成代码,还能进行推理,比如帮你找出代码里的错误或者补全一段逻辑。
Mistral AI 希望它成为一个出色的本地代码助手。你可以在自己的电脑上运行它,不需要联网,就像请了一个私人家教,随时帮你解答编程问题。它已经在 256k 长度的上下文检索测试中表现良好,说明它能记住很长的代码文件。
怎么使用 Codestral Mamba?
你可以通过 mistral-inference SDK 来部署它,这个工具包使用了 Mamba 官方 GitHub 仓库的参考实现。另外,它也支持通过 TensorRT-LLM 部署,这是一种加速推理的工具。对于本地推理,llama.cpp 的支持即将到来,你可以关注后续消息。
模型的原始权重可以从 HuggingFace 下载。如果你不想自己部署,也可以直接在 Mistral 的 la Plateforme 平台上试用,模型代号是 codestral-mamba-2407。这样你就不用自己搭建环境,打开网页就能用。
它和 Codestral 22B 有什么不同?
Codestral 22B 是 Mistral AI 之前发布的另一个代码模型,有 220 亿参数,比 Codestral Mamba 大得多。Codestral 22B 采用商业许可证,自部署需要付费,或者用社区许可证进行测试。而 Codestral Mamba 是 Apache 2.0 开源,完全免费。
Codestral Mamba 的优势在于速度更快,能处理无限长的序列,适合需要快速响应的场景。Codestral 22B 可能在某些任务上更强大,但需要更多计算资源。你可以根据需求选择:想要免费、快速、本地运行,选 Codestral Mamba;想要更强大的性能,可以考虑 Codestral 22B。
适合哪些人使用?
Codestral Mamba 适合程序员、编程学习者,以及任何需要写代码的人。因为它可以本地运行,所以也适合对数据隐私有要求的人,代码不用上传到云端。对于学生来说,它是一个很好的学习工具,可以帮你理解代码逻辑。
不过,它毕竟是一个 AI 模型,生成的代码可能需要检查和修改。它不能替代真正的编程知识,但可以作为一个辅助工具,提高你的效率。如果你刚开始学编程,可以用它来生成示例代码,然后自己研究。
有哪些限制和未知信息?
原文没有说明 Codestral Mamba 的训练数据来源、训练成本、具体的推理速度数值,也没有给出与 Codestral 22B 的详细性能对比。此外,它是否支持除代码外的其他语言任务,以及 llama.cpp 支持的具体时间,都还是未知数。
虽然它支持 256k 上下文,但实际使用中可能受限于硬件内存。另外,Apache 2.0 许可证允许商业使用,但如果你修改后分发,需要保留版权声明。总的来说,这是一个值得关注的开放模型,但具体效果还需要实际测试。
本文由 AIGCWHY 自动监测系统发现,经结构化处理后发布。重要决策请打开原文核验。