美团LongCat发布开源定理证明器模型LongCat-Flash-Prover
2026年3月24日,美团LongCat团队正式开源了一个专用于数学形式化和定理证明的深度学习模型:LongCat-Flash-Prover。该模型通过将形式推理分解为三大核心能力——自动形式化、证明草图生成和最终证明——从而克服了大型语言模型在严谨逻辑推理方面的局限性。 这标志着从“概率性答案预测”向“可验证逻辑证明”的范式转变。

通过采用工具集成推理(TIR)策略,该模型在MiniF2F-Test基准测试中仅用72步推理就实现了97.1%的通过率,创下了开源定理证明器的最新纪录。在MathOlympiad-Bench和PutnamBench等高难度竞赛级基准测试中,其表现也显著超越了现有开源模型。

从技术层面看,LongCat-Flash-Prover采用基于TIR的“混合专家迭代”框架。通过集成Lean4Server验证、语义与定理一致性检查,以及针对九类作弊行为的合法性验证,该模型有效解决了逻辑漏洞和代码欺骗问题。 在训练过程中,团队引入了分层掩码策略和令牌级过时控制,极大提升了混合专家(MoE)架构下强化学习的稳定性。
随着AI推理从处理自然语言的模糊性演进到处理可验证的形式语言,此类定理证明器已超越了简单的算法基准测试范畴,正逐渐成为核心科学研究的基石。这一突破标志着一个加速发展的时代——AI将深度参与前沿数学探索与自动化文档验证。
GitHub:
https://github.com/meituan-longcat/LongCat-Flash-Prover
Hugging Face:https://huggingface.co/meituan-longcat/LongCat-Flash-Prover
报告:
https://github.com/meituan-longcat/LongCat-Flash-Prover/blob/main/LongCat_Flash_Prover_Technical_Report.pdf
相关文章
前OpenAI首席科学家Ilya的SSI首次发布模型
AI 取得了另一项重大里程碑。在从 OpenAI 离职后,前首席科学家伊利亚·苏茨克弗(Ilya Sutskever)创立了 Safe Superintelligence Inc.(SSI),该公司最近公布了其首个模型的详细信息。海外社交媒体上的报道指出,该团队正在利用 TTT(测试时训练)开发一个紧凑的推理引擎,这是他们在追求安全超级智能过程中的关键进展。这种新颖的架构专注于使模型能够“学习如何学习”。与在推理过程中保持参数静态的传统大型语言模型不同,该引擎在处理现实世界任务时会动态更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI应用开发平台Lovable宣布参与丹麦硬件初创公司Atech的80万美元种子轮融资。该轮由Lovable领投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在内的顶级风险投资机构。此次投资标志着Lovable将“Vibe Coding”概念从纯软件开发战略扩展至硬件工程领域。Atech旨在通过AI驱动的交互式平台简化复杂的硬件原型制作。用户购买基础硬件套件,并通过AI聊天机器人以自然语言描述其设计概念;系统
Anthropic 将 Claude AI 编码工具扩展至日本,以推动海外增长
Anthropic,一家美国知名的人工智能公司,正加强其全球推广力度。周三,该公司在东京举办了一场大型开发者活动“Code with Claude”,吸引了近500名软件工程师参加。该举措旨在积极将Claude AI工具及相关产品引入日本市场,强调其自主编码能力在提升企业生产力方面的核心优势。强调自动化代码生成在活动中,Anthropic展示了其先进的自主编码系统,该系统能够独立处理复杂的编程任务并优化现有代码结构。随着全球对高效开发工具的需求不断增长,Anthropic希望通过此类活动加强
相关专题推荐
评论 (2)
0/500
2026年3月24日,美团LongCat团队正式开源了一个专用于数学形式化和定理证明的深度学习模型:LongCat-Flash-Prover。该模型通过将形式推理分解为三大核心能力——自动形式化、证明草图生成和最终证明——从而克服了大型语言模型在严谨逻辑推理方面的局限性。 这标志着从“概率性答案预测”向“可验证逻辑证明”的范式转变。

通过采用工具集成推理(TIR)策略,该模型在MiniF2F-Test基准测试中仅用72步推理就实现了97.1%的通过率,创下了开源定理证明器的最新纪录。在MathOlympiad-Bench和PutnamBench等高难度竞赛级基准测试中,其表现也显著超越了现有开源模型。

从技术层面看,LongCat-Flash-Prover采用基于TIR的“混合专家迭代”框架。通过集成Lean4Server验证、语义与定理一致性检查,以及针对九类作弊行为的合法性验证,该模型有效解决了逻辑漏洞和代码欺骗问题。 在训练过程中,团队引入了分层掩码策略和令牌级过时控制,极大提升了混合专家(MoE)架构下强化学习的稳定性。
随着AI推理从处理自然语言的模糊性演进到处理可验证的形式语言,此类定理证明器已超越了简单的算法基准测试范畴,正逐渐成为核心科学研究的基石。这一突破标志着一个加速发展的时代——AI将深度参与前沿数学探索与自动化文档验证。
GitHub:
https://github.com/meituan-longcat/LongCat-Flash-Prover
Hugging Face:https://huggingface.co/meituan-longcat/LongCat-Flash-Prover
报告:
https://github.com/meituan-longcat/LongCat-Flash-Prover/blob/main/LongCat_Flash_Prover_Technical_Report.pdf
前OpenAI首席科学家Ilya的SSI首次发布模型
AI 取得了另一项重大里程碑。在从 OpenAI 离职后,前首席科学家伊利亚·苏茨克弗(Ilya Sutskever)创立了 Safe Superintelligence Inc.(SSI),该公司最近公布了其首个模型的详细信息。海外社交媒体上的报道指出,该团队正在利用 TTT(测试时训练)开发一个紧凑的推理引擎,这是他们在追求安全超级智能过程中的关键进展。这种新颖的架构专注于使模型能够“学习如何学习”。与在推理过程中保持参数静态的传统大型语言模型不同,该引擎在处理现实世界任务时会动态更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field
2026年5月14日,AI应用开发平台Lovable宣布参与丹麦硬件初创公司Atech的80万美元种子轮融资。该轮由Lovable领投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在内的顶级风险投资机构。此次投资标志着Lovable将“Vibe Coding”概念从纯软件开发战略扩展至硬件工程领域。Atech旨在通过AI驱动的交互式平台简化复杂的硬件原型制作。用户购买基础硬件套件,并通过AI聊天机器人以自然语言描述其设计概念;系统
Anthropic 将 Claude AI 编码工具扩展至日本,以推动海外增长
Anthropic,一家美国知名的人工智能公司,正加强其全球推广力度。周三,该公司在东京举办了一场大型开发者活动“Code with Claude”,吸引了近500名软件工程师参加。该举措旨在积极将Claude AI工具及相关产品引入日本市场,强调其自主编码能力在提升企业生产力方面的核心优势。强调自动化代码生成在活动中,Anthropic展示了其先进的自主编码系统,该系统能够独立处理复杂的编程任务并优化现有代码结构。随着全球对高效开发工具的需求不断增长,Anthropic希望通过此类活动加强





首页






