Mistral AI 将 Leanstral 1.5 开源,以降低数学研究的门槛
Mistral AI 最近发布了一个名为 Leanstral1.5 的开源模型,该模型专为 Lean4 数学形式化证明语言而构建。该模型采用 Apache-2.0 许可证,总参数数达 1190 亿,其中仅激活了 60 亿个,在保持高性能的同时显著降低了成本。
作为一款专用于数学推理的工具,Leanstral1.5 取得了令人印象深刻的成果。 在备受推崇的 miniF2F 形式数学基准测试中,该模型在验证集和测试集上均实现了 100% 的完成率。在处理具有挑战性的 PutnamBench 竞赛题目时,该模型成功解决了 672 道 Lean4 题目中的 587 道。 它在抽象代数的 FATE 基准测试系列中同样表现出色,在大师级 FATE-H 测试中取得了 87% 的成功率,在博士级 FATE-X 测试中取得了 34% 的成功率——创下了此类模型的新纪录。

成本效益是本次发布的另一大关键优势。Mistral AI 强调,与现有替代方案相比,Leanstral1.5 极大地降低了科学试错的成本。 例如,使用 Leanstral1.5 解决 PutnamBench 中的一个问题,平均成本仅为 4 美元,而对比模型 Seed-Prover1.5 的成本超过 300 美元,Aleph Prover 的成本则在 54 至 68 美元之间。 预计这一成本的大幅降低将使高精度的数学证明辅助工具走出实验室,进入更广泛的研究应用领域。
在实际的代码开发场景中,Leanstral1.5 还展现出了强大的漏洞检测能力。 在对 57 个代码仓库进行测试时,它识别出 47 处违规,其中 11 处被确认为真实缺陷。值得注意的是,其中 5 处漏洞此前从未在 GitHub 上被报告过,这凸显了该模型在协助程序验证和安全审计方面的潜力。
随着 Leanstral1.5 的开源发布,数学和计算机科学领域将更便捷地获得这一强大的证明辅助工具。通过降低计算成本和资金成本,该模型有望加速形式化数学证明的普及,帮助研究人员摆脱繁琐的计算和验证工作,从而专注于实现基础科学领域的重大突破。
相关文章
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。
Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额
尽管近期有报道称OpenAI未达营收目标,给本周二的科技股带来压力,但私营人工智能实验室的投资者仍表现坚韧。经验丰富的投资者已确认,尽管媒体报道负面,他们仍不会减少投资。分析师认为当前的人工智能竞赛仍处于早期阶段,因此不会出现“赢家通吃”的局面。尽管高昂的计算成本给营收带来压力,但实验室可通过提高订阅费来提升盈利能力。行业格局正发生微妙变化与OpenAI不同,其竞争对手Anthropic获得了强有
加利福尼亚州自动驾驶合规:罚单、地理围栏和100万英里的新时代
Guident公司在南佛罗里达州运营一辆AuveTech自动驾驶班车,利用其远程监控技术管理西棕榈滩的一条4英里路线和博卡拉顿的一条1英里路线。| 图片来源:Guident加利福尼亚州正在重新定义无人驾驶车辆的监管格局,正逐渐摆脱科技行业“快速行动,打破常规”的思维模式,转向严格的问责制和严苛的行驶里程要求。Guident执行董事长兼首席执行官哈罗德·布劳恩(Harold Braun)在《机器人报
相关专题推荐
评论 (0)
0/500
Mistral AI 最近发布了一个名为 Leanstral1.5 的开源模型,该模型专为 Lean4 数学形式化证明语言而构建。该模型采用 Apache-2.0 许可证,总参数数达 1190 亿,其中仅激活了 60 亿个,在保持高性能的同时显著降低了成本。
作为一款专用于数学推理的工具,Leanstral1.5 取得了令人印象深刻的成果。 在备受推崇的 miniF2F 形式数学基准测试中,该模型在验证集和测试集上均实现了 100% 的完成率。在处理具有挑战性的 PutnamBench 竞赛题目时,该模型成功解决了 672 道 Lean4 题目中的 587 道。 它在抽象代数的 FATE 基准测试系列中同样表现出色,在大师级 FATE-H 测试中取得了 87% 的成功率,在博士级 FATE-X 测试中取得了 34% 的成功率——创下了此类模型的新纪录。

成本效益是本次发布的另一大关键优势。Mistral AI 强调,与现有替代方案相比,Leanstral1.5 极大地降低了科学试错的成本。 例如,使用 Leanstral1.5 解决 PutnamBench 中的一个问题,平均成本仅为 4 美元,而对比模型 Seed-Prover1.5 的成本超过 300 美元,Aleph Prover 的成本则在 54 至 68 美元之间。 预计这一成本的大幅降低将使高精度的数学证明辅助工具走出实验室,进入更广泛的研究应用领域。
在实际的代码开发场景中,Leanstral1.5 还展现出了强大的漏洞检测能力。 在对 57 个代码仓库进行测试时,它识别出 47 处违规,其中 11 处被确认为真实缺陷。值得注意的是,其中 5 处漏洞此前从未在 GitHub 上被报告过,这凸显了该模型在协助程序验证和安全审计方面的潜力。
随着 Leanstral1.5 的开源发布,数学和计算机科学领域将更便捷地获得这一强大的证明辅助工具。通过降低计算成本和资金成本,该模型有望加速形式化数学证明的普及,帮助研究人员摆脱繁琐的计算和验证工作,从而专注于实现基础科学领域的重大突破。
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。
Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额
尽管近期有报道称OpenAI未达营收目标,给本周二的科技股带来压力,但私营人工智能实验室的投资者仍表现坚韧。经验丰富的投资者已确认,尽管媒体报道负面,他们仍不会减少投资。分析师认为当前的人工智能竞赛仍处于早期阶段,因此不会出现“赢家通吃”的局面。尽管高昂的计算成本给营收带来压力,但实验室可通过提高订阅费来提升盈利能力。行业格局正发生微妙变化与OpenAI不同,其竞争对手Anthropic获得了强有





首页






