Mistral Small 3 是什么?
2025年1月30日,Mistral AI 发布了 Mistral Small 3。它是一个有 240 亿个“小零件”(参数)的模型,采用 Apache 2.0 许可证开放权重,意味着任何人都可以下载、修改和免费使用。它就像一个装在书包里的小型智能助手,虽然个头不大,但跑得飞快,能帮你快速回答问题、查资料,还能在你自己的电脑上运行,不用联网也能用。
这个模型同时提供了预训练版本和指令微调版本。预训练版本像一个刚读完很多书但还没学会听话的学生,指令微调版本则像经过老师专门训练、能听懂指令并完成任务的助手。官方未说明训练数据的具体来源和训练成本。
它有多厉害?
Mistral Small 3 虽然只有 240 亿参数,但它的表现可以和 700 亿参数的 Llama 3.3 70B 或 320 亿参数的 Qwen 32B 相媲美,甚至在某些任务上更好。在 MMLU 测试中,它的准确率超过 81%,而且生成速度达到每秒 150 个词,比同硬件上的 Llama 3.3 70B 快 3 倍以上。这就像一个小个子运动员,跑得比大个子还快,而且力气也不小。
官方通过第三方人工评估,在超过 1000 个编程和通用提示上对比了 Mistral Small 3 和其他模型,评估者更偏好它的回答。不过,官方也提醒,人工评估结果有时会和公开基准测试不同,但他们已尽力确保公平。
它能做什么?
Mistral Small 3 适合需要快速响应的场景,比如虚拟助手、实时聊天、自动调用工具等。它还可以通过微调变成特定领域的专家,比如法律咨询、医疗诊断或技术支持。对于喜欢动手的爱好者和处理敏感信息的组织,它可以在单张 RTX 4090 显卡或 32GB 内存的 MacBook 上本地运行,保护隐私。
客户正在金融、医疗、机器人、汽车和制造业中评估它,用于欺诈检测、客户分诊、设备控制等。通用场景包括虚拟客服、情感分析和反馈分析。官方未说明具体客户案例的详细效果和部署规模。
怎么使用它?
Mistral Small 3 已经在 la Plateforme 上线,模型名为 mistral-small-latest 或 mistral-small-2501。同时,Mistral AI 与 Hugging Face、Ollama、Kaggle、Together AI、Fireworks AI 和 IBM Watson X 合作,在这些平台上提供模型。未来还将在 NVIDIA NIM、Amazon SageMaker、Groq、Databricks 和 Snowflake 上推出。
开发者可以通过 API 调用,也可以下载权重在本地部署。对于企业,还可以通过私有云或本地部署使用。官方未说明 API 的具体定价和免费额度。
它有什么限制?
Mistral Small 3 没有使用强化学习或合成数据训练,因此它的推理能力不如 DeepSeek R1 等模型。它更像一个基础模型,可以在此基础上继续训练出更强的推理能力。官方未说明它在多语言、长上下文或复杂推理任务上的具体表现。
量化后可以在消费级硬件上运行,但量化可能会损失一些精度。官方未说明量化后的性能下降程度和具体量化方法。此外,模型的知识截止日期和上下文窗口长度也未在原文中说明。
适合哪些人使用?
Mistral Small 3 适合需要快速响应、低延迟的开发者,比如构建聊天机器人、虚拟助手或自动化工作流。它也适合想要在本地运行模型、保护数据隐私的爱好者和企业。对于研究人员,它可以作为基础模型进行微调和实验。
如果你是小学生或初中生,可以把它想象成一个装在电脑里的智能小助手,能帮你快速查资料、回答问题,但它的知识有限,不能代替老师或家长。使用前最好在大人指导下进行。
未来会怎样?
Mistral AI 表示,未来几周将推出具有更强推理能力的小型和大型 Mistral 模型。他们也在逐步放弃 MRL 许可证,转而使用 Apache 2.0 许可证发布通用模型,让更多人能自由使用和修改。
官方未说明未来模型的具体版本号、发布时间和功能细节。但可以期待,开源社区会基于 Mistral Small 3 创造出更多有趣的应用。
本文由 AIGCWHY 自动监测系统发现,经结构化处理后发布。重要决策请打开原文核验。