Leanstral 是什么?
2026年3月16日,Mistral AI 发布了一款名叫 Leanstral 的新工具。它是第一个专门为 Lean 4 设计的开源代码智能体。Lean 4 是一种“证明助手”,可以帮数学家写出非常严谨的数学证明,也能检查软件代码是否符合严格的要求。Leanstral 就像一个会写证明的机器人小助手,你告诉它想要什么,它不但帮你写出来,还会一步一步检查每一步推理是否严密。
Mistral AI 把 Leanstral 的“权重”(也就是模型学到的知识)按照 Apache 2.0 许可证开放出来,这意味着任何人都可以下载、使用甚至修改它。同时,你还可以在 Mistral vibe 这个智能体模式里直接使用它,或者通过一个免费的 API 接口来调用。官方还表示会发布一份技术报告,详细说明训练方法,并推出一个新的评估套件 FLTEval。
为什么需要 Leanstral?
现在很多 AI 都能写代码,但在数学研究或关键软件这种高风险领域,人类必须仔细检查 AI 写出的东西是否正确。这种检查需要专业知识和大量时间,反而成了拖慢进度的瓶颈。Mistral AI 希望未来的编程智能体不仅能完成任务,还能像数学证明一样,严格证明自己的实现符合要求。这样人类就不用再逐行调试机器生成的逻辑,而是直接告诉 AI 想要什么结果。
Leanstral 就是朝这个方向迈出的第一步。它专门针对 Lean 4 这个证明助手进行训练,而不是像其他系统那样只是把通用大模型包装一下,或者只解决单个数学题。它被设计成能在真实的正式代码仓库中高效工作。
它有多厉害?
Leanstral 采用了一种非常稀疏的架构,只有 60 亿个活跃参数,但效率很高。在评估中,它被要求完成 FLT 项目中每个 PR 的全部形式化证明,并正确定义新的数学概念,而不是做孤立的数学题。对比对象包括 Claude Opus 4.6、Sonnet 4.6、Haiku 4.5 以及开源模型 Qwen3.5 397B-A17B、Kimi-K2.5 1T-A32B、GLM5 744B-A40B。
结果非常亮眼:Leanstral 在 pass@2 时得分 26.3,超过了 Sonnet 的 23.7,而成本只有 36 美元,Sonnet 却要 549 美元。在 pass@16 时,Leanstral 得分 31.9,比 Sonnet 高出 8 分。虽然 Claude Opus 4.6 质量仍然领先,但它的成本高达 1650 美元,是 Leanstral 的 92 倍。面对更大的开源模型,Leanstral 用更少的计算量就取得了更好的成绩。
它能做什么?
官方给出了两个实际案例。第一个是回答 Stack Exchange 上关于 Lean 新版本变化的问题。有人写了一段代码在 Lean 4.29.0-rc6 里突然编译不过了,Leanstral 没有瞎猜,而是自己搭建测试环境,诊断出问题出在 def 和 abbrev 的区别上,并给出了简单的修复方案,还向用户解释了原因。
第二个案例是把 Rocq(一种证明助手)里的程序定义转换成 Lean,并证明程序的一些性质。Leanstral 成功完成了转换,甚至实现了自定义符号,还能在只给出 Rocq 语句(没有证明)的情况下,在 Lean 中证明程序的性质。这说明它不仅能写证明,还能理解程序的行为。
怎么使用它?
你可以通过三种方式使用 Leanstral:第一,下载开放权重,自己部署;第二,在 Mistral vibe 智能体模式中使用;第三,通过免费的 API 端点调用。Leanstral 还支持任意的 MCP(模型上下文协议),并且专门针对常用的 lean-lsp-mcp 进行了训练,以达到最佳性能。这意味着它可以和现有的 Lean 工具链很好地配合。
有什么限制?
官方没有说明 Leanstral 的训练数据来源、训练时长和硬件配置,也没有说明免费 API 的具体额度限制。技术报告和 FLTEval 评估套件的发布时间也未公布。此外,目前它只针对 Lean 4,是否支持其他证明助手还不清楚。虽然它在成本效益上很有优势,但在绝对质量上仍落后于 Claude Opus 4.6。
适合谁用?
Leanstral 适合数学研究者、形式化验证工程师、对 Lean 4 感兴趣的开发者,以及任何需要高可信度代码或证明的团队。对于预算有限但又想尝试形式化方法的个人或小团队来说,它提供了一个高性价比的选择。对于小学生和初中生,可以把它想象成一个会写数学证明的机器人小助手,帮你检查每一步推理是否严密,就像老师批改作业一样。
本文由 AIGCWHY 自动监测系统发现,经结构化处理后发布。重要决策请打开原文核验。