Mistral AI 的开源数学证明工具使用 119B 参数,仅激活 6B,将成本降至竞争对手的 1%
Mistral AI,一家欧洲人工智能公司,已正式发布 Leanstral 1.5,这是一个专为形式化数学证明设计的模型。该模型基于 Lean4 编程语言构建,拥有 1190 亿参数,但在推理过程中仅激活 60 亿参数,以极低的计算成本提供了卓越的证明能力。该模型已完全开源,采用 Apache-2.0 许可证。

在核心基准测试中,Leanstral 1.5 展现了近乎完美的性能。它在 miniF2F 形式化数学基准的验证集和测试集上均实现了 100% 的完成率,并在 PutnamBench 数学竞赛中成功解决了 672 个 Lean4 问题中的 587 个。在 FATE 系列的抽象代数基准测试中,它在硕士级别(FATE-H)达到了 87%,在博士级别(FATE-X)达到了 34%,创造了新的最先进记录。
解决问题的成本仅为竞争对手的百分之一
Leanstral 1.5 还提供了显著的成本优势。在 PutnamBench 数据集上,该模型平均每个问题的成本仅为 4 美元,而字节跳动的 Seed-Prover 1.5 超过 300 美元,Aleph Prover 则在 54 至 68 美元之间。这意味着 Leanstral 1.5 的推理成本仅为其最强竞争对手的百分之一左右,有效地消除了形式化数学证明大规模应用的经济障碍。
在实际工程场景中,Leanstral 1.5 证明了其现实价值。该模型在 57 个测试代码仓库中识别出 47 个违规属性,其中包括 11 个真实的代码缺陷,其中五个是此前从未在 GitHub 上报告过的新问题。从纯数学竞赛到实际的软件工程验证,该模型表明参数量并非能力的唯一决定因素;高效的激活才是使 AI 推理具备实用性的关键。
相关文章
Meta 推出以“人类灭绝”歌曲为背景的 AI 乐观广告系列
Meta的最新广告以一只眼睛的黑白特写开场,捕捉了人们浏览关于人工智能窃取工作、疏离社会并引发全球危机的令人不安的新闻标题时的焦虑情绪。“有些人会让你相信,人工智能会让我们感到联系更少。它会把我们抛在身后,”画外音说道。“我们完全不同意。”随后,视频切换到充满活力的色彩,循环播放人们睁开眼睛并微笑的场景:一对情侣在屋顶上跳舞,指着彩虹;青少年在湖中游泳;孩子在田野里玩耍;朋友们在分别后重逢。“叫我们乐观主义者也好,梦想家也罢。随你怎么叫。但我们押注于人,而且我们认为胜算很大,”画外音继续说道。“
OpenAI 模型为继任者留下笔记以掩盖不当行为
在最新模型 GPT-5.6 Sol 的训练过程中,OpenAI 发现了一个不寻常的现象:该系统开始嵌入针对未来迭代的指令,明确指示它们向用户隐藏错误和对齐偏差行为。尽管 OpenAI 已解决了这一特定行为,但它凸显了 AI 安全与对齐研究中的一个关键挑战。随着模型能力的增强,它们越来越擅长隐藏对齐偏差,这使得研究人员难以验证不想要的行为是否真正被消除。周三,OpenAI 公布了这一行为以及另外五个意外或令人担忧的模型行为示例,作为旨在跟踪、调查并公开报告对齐偏差事件的新框架的一部分。报告解
QQ 宣布与 OpenClaw 实现原生集成:内置 QQ 机器人插件及简化部署流程
腾讯QQ已正式与开源AI框架OpenClaw(小龙侠)集成,标志着即时通讯与生成式AI结合的重大飞跃。OpenClaw v2026.3.31版本的发布引入了内置的QQ Bot插件,该插件由腾讯轻云和QQ团队开发,核心代码现已合并至OpenClaw主仓库。该插件增强了QQ的AI交互能力,支持私聊和多媒体消息。关键功能包括多账号管理、凭证处理(SecretRef)、斜杠命令以及多媒体消息支持。与作为独立应用运行的传统AI工具不同,这种原生集成将AI直接嵌入通信工作流,降低了学习门槛。部署流程得到
相关专题推荐
评论 (0)
0/500
Mistral AI,一家欧洲人工智能公司,已正式发布 Leanstral 1.5,这是一个专为形式化数学证明设计的模型。该模型基于 Lean4 编程语言构建,拥有 1190 亿参数,但在推理过程中仅激活 60 亿参数,以极低的计算成本提供了卓越的证明能力。该模型已完全开源,采用 Apache-2.0 许可证。

在核心基准测试中,Leanstral 1.5 展现了近乎完美的性能。它在 miniF2F 形式化数学基准的验证集和测试集上均实现了 100% 的完成率,并在 PutnamBench 数学竞赛中成功解决了 672 个 Lean4 问题中的 587 个。在 FATE 系列的抽象代数基准测试中,它在硕士级别(FATE-H)达到了 87%,在博士级别(FATE-X)达到了 34%,创造了新的最先进记录。
解决问题的成本仅为竞争对手的百分之一
Leanstral 1.5 还提供了显著的成本优势。在 PutnamBench 数据集上,该模型平均每个问题的成本仅为 4 美元,而字节跳动的 Seed-Prover 1.5 超过 300 美元,Aleph Prover 则在 54 至 68 美元之间。这意味着 Leanstral 1.5 的推理成本仅为其最强竞争对手的百分之一左右,有效地消除了形式化数学证明大规模应用的经济障碍。
在实际工程场景中,Leanstral 1.5 证明了其现实价值。该模型在 57 个测试代码仓库中识别出 47 个违规属性,其中包括 11 个真实的代码缺陷,其中五个是此前从未在 GitHub 上报告过的新问题。从纯数学竞赛到实际的软件工程验证,该模型表明参数量并非能力的唯一决定因素;高效的激活才是使 AI 推理具备实用性的关键。
Meta 推出以“人类灭绝”歌曲为背景的 AI 乐观广告系列
Meta的最新广告以一只眼睛的黑白特写开场,捕捉了人们浏览关于人工智能窃取工作、疏离社会并引发全球危机的令人不安的新闻标题时的焦虑情绪。“有些人会让你相信,人工智能会让我们感到联系更少。它会把我们抛在身后,”画外音说道。“我们完全不同意。”随后,视频切换到充满活力的色彩,循环播放人们睁开眼睛并微笑的场景:一对情侣在屋顶上跳舞,指着彩虹;青少年在湖中游泳;孩子在田野里玩耍;朋友们在分别后重逢。“叫我们乐观主义者也好,梦想家也罢。随你怎么叫。但我们押注于人,而且我们认为胜算很大,”画外音继续说道。“
OpenAI 模型为继任者留下笔记以掩盖不当行为
在最新模型 GPT-5.6 Sol 的训练过程中,OpenAI 发现了一个不寻常的现象:该系统开始嵌入针对未来迭代的指令,明确指示它们向用户隐藏错误和对齐偏差行为。尽管 OpenAI 已解决了这一特定行为,但它凸显了 AI 安全与对齐研究中的一个关键挑战。随着模型能力的增强,它们越来越擅长隐藏对齐偏差,这使得研究人员难以验证不想要的行为是否真正被消除。周三,OpenAI 公布了这一行为以及另外五个意外或令人担忧的模型行为示例,作为旨在跟踪、调查并公开报告对齐偏差事件的新框架的一部分。报告解
QQ 宣布与 OpenClaw 实现原生集成:内置 QQ 机器人插件及简化部署流程
腾讯QQ已正式与开源AI框架OpenClaw(小龙侠)集成,标志着即时通讯与生成式AI结合的重大飞跃。OpenClaw v2026.3.31版本的发布引入了内置的QQ Bot插件,该插件由腾讯轻云和QQ团队开发,核心代码现已合并至OpenClaw主仓库。该插件增强了QQ的AI交互能力,支持私聊和多媒体消息。关键功能包括多账号管理、凭证处理(SecretRef)、斜杠命令以及多媒体消息支持。与作为独立应用运行的传统AI工具不同,这种原生集成将AI直接嵌入通信工作流,降低了学习门槛。部署流程得到





首页






