Leanstral 1.5 - Mistral AI 开源的形式化验证大模型
来源:互联网
时间:2026-07-06 15:25:41
Leanstral 1.5是什么
Leanstral 1.5,简单来说,就是Mistral AI最新开源的一款形式化验证大模型,专门为Lean 4自动定理证明做了深度优化。它采用了119B参数的MoE架构,支持256k超长上下文,还能处理图文输入。在miniF2F、PutnamBench这些数学证明基准上,它已经拿下了SOTA成绩——说白了,就是目前最顶级的水平。它的目标很明确:让AI形式化数学验证和代码正确性证明的自动化再上一个台阶。
Leanstral 1.5的主要功能
- :基于Lean 4语言,它能自动生成完整的形式化数学证明,覆盖代数、几何、数论这些高难度领域。你给它一个命题,它就能给你一个可验证的证明链。
自动定理证明
- :对软件代码和数学命题做严格的逻辑验证,确保每一步推导都符合Lean 4的类型系统和公理体系。这等于给代码上了一道数学锁。
形式化验证
- :支持在证明过程中解析并理解数学图表、公式截图等多模态输入,辅助复杂几何与符号推导。比如你扔一张几何图进去,它也能看懂。
图文联合推理
- :256k的上下文窗口,让它能处理整本教材或长篇论文级别的证明任务,跨章节的逻辑一致性也能保持。
长文档证明生成
- :以代码Agent模式自主调用Lean 4编译器、检索数学库并迭代修正错误,实现端到端自动化——你只需要把命题丢给它,剩下的它自己跑。
Agent式交互证明
Leanstral 1.5的技术原理
- :总参数量119B,但每个token只激活6.5B参数。这就好比一个超大专家团队,每次只派几个最对口的专家上场,效率高、成本低。
稀疏混合专家架构(MoE)
- :在大量形式化数学库(比如mathlib4)、竞赛题(IMO、Putnam)以及人工标注的证明路径上做了后训练。数据是专门喂给它的。
Lean 4专用语料训练
- :利用证明成功与否这种明确的反馈信号,结合RL优化策略网络,提升它在复杂定理上的搜索和构造能力。试错越多,它越强。
强化学习微调
- :集成了视觉编码器,能把LaTeX公式图片、几何图表转化成和文本统一的嵌入表示,实现跨模态联合推理。
多模态编码器融合
- :采用支持256k tokens的扩展位置编码方案,保证超长证明链条里的依赖关系不丢失。上下文越长,越考验编码能力。
长上下文位置编码
如何使用Leanstral 1.5
- :前往
访问HuggingFace下载权重
https://huggingface.co/mistralai/Leanstral-1.5-119B-A6B获取开源模型文件与配置文件。这是最直接的入口。 - :本地安装Lean 4编译器以及mathlib4依赖库,确保模型生成的代码能够被正确解析和验证。环境搭好了,模型才能跑起来。
配置Lean 4运行环境
- :使用Transformers或vLLM加载模型权重,通过API或本地脚本把自然语言命题转化为Lean 4代码。这一步是桥接。
加载模型并接入证明接口
- :调用模型生成证明策略,模型会自动迭代编译、报错修正与库检索,直到输出
启动自动证明Agent
proof complete或达到尝试上限。全程自动化,无需人工干预。 - :登录Mistral AI Console(
在线快速体验
https://console.mistral.ai/),选择labs-leanstral-1-5端点,直接输入命题进行验证。最快的方式,不用本地部署。
Leanstral 1.5的核心优势
- :MoE架构下每token只激活6.5B参数,相比同性能的Dense模型,GPU显存和算力消耗大幅降低。省钱也省算力。
推理成本极低
- :在miniF2F达到100%饱和,PutnamBench解出587/672题,FATE-H达到87%——全是当前SOTA。数据不会说谎。
数学基准全面领先
- :针对形式化验证领域深度优化,生成的代码可以直接通过Lean编译器检查,避免通用模型常见的语法错误。专业对口,少走弯路。
原生支持Lean 4
- :256k上下文意味着它能处理整本书籍或大型软件规范的形式化验证,远超同类竞品的窗口限制。篇幅再大也不怕。
超长上下文支持
Leanstral 1.5的项目地址
- :
项目官网
https://mistral.ai/news/leanstral-1-5/ - :
HuggingFace模型库
https://huggingface.co/mistralai/Leanstral-1.5-119B-A6B
Leanstral 1.5的同类竞品对比
开源协议Apache 2.0(完全开源)MIT(开源)
架构119B MoE(每token 6.5B)671B MoE(每token 37B)
专用语言Lean 4Lean 4
miniF2F性能100%饱和高分但未公开饱和
上下文长度256k tokens128k tokens
多模态支持支持图文输入主要支持文本
推理成本每token激活参数少,成本低激活参数量大,成本较高
Leanstral 1.5的应用场景
- :帮助数学家快速验证猜想、生成引理证明草稿,加速代数几何、数论等领域的探索。等于多了一个不会累的助手。
数学研究辅助
- :自动解答IMO、Putnam等高水平数学竞赛题,并提供可机器验证的完整形式化解答过程。竞赛选手可以拿它当陪练。
竞赛培训与解题
- :为航空航天、金融系统等关键软件生成形式化规约与验证证明,替代部分人工审计工作。安全要求越高的地方,它越有用。
软件正确性验证
- :在高等教育中自动验证学生提交的Lean 4证明作业,给出精确到每一步的反馈。老师省心,学生也能快速定位问题。
教育领域自动批改
- :用于验证复杂AI系统的逻辑一致性、策略安全性,通过形式化方法确保关键决策没有漏洞。这在AI信任领域是个大方向。
AI安全对齐验证