MiniMax 发布 M3,一款超越 GPT-5.5 的国产 AI 大模型
中国的AI领域迎来了重大技术飞跃,随着稀宇科技(Xiyu Technology)最新大型语言模型MiniMax M3的正式推出。这一先进系统结合了最先进的编码能力,并支持高达100万token的超长上下文窗口。值得注意的是,它原生支持多模态输入,包括图像和视频处理,以及计算机桌面交互,使其成为中国首个整合这三项关键能力的开源模型。

标准化基准测试中的卓越表现
在严格的SWE-Bench Pro编程评估中,MiniMax M3获得了59.0%的分数,超越了GPT-5.5和Gemini 3.1 Pro,同时紧追顶级模型Opus 4.7。该模型在AI代理能力的Claw-Eval测试中也展示了优越的性能,并在OmniDocBench多模态文档理解基准测试中取得了领先分数。
先进架构提升效率
推动这一性能的是M3采用的新型稀疏注意力架构(MSA)。在处理100万token的超长上下文时,与上一代模型相比,该设计将单个token的计算量减少了一半。因此,该模型的解析速度提升了9倍以上,答案生成速度提升了15倍以上。API现已上线,官方团队承诺在10天内向全球开发者发布模型权重和技术报告。
相关文章
印度要求来电显示应用程序与电信运营商共享垃圾数据
印度扩大了其反垃圾短信法规,要求来电显示和电话管理应用程序与电信运营商共享用户垃圾报告,这一举措导致知名垃圾阻止应用程序提供商 Truecaller 将该政策标记为反竞争。周五,印度电信监管机构印度电信管理局(TRAI)更新了规范商业通信的规则。这些更新强制要求允许用户将电话标记为垃圾或 junk 的来电 ID 和电话管理应用程序,将这些报告传输到由电信运营商运营的基于区块链的平台。该平台监控商业通信并执行反垃圾协议。根据 TRAI 的说法,这一修改旨在扩大可用于打击垃圾短信发送者的垃圾报告
Qwen AI 平台通过正式发布 GLM-5.3 和 DeepSeek-V4-Pro,进一步扩展其模型矩阵
阿里云通义千问 AI 平台(MaaS)近期进一步扩充了模型服务矩阵,接入了智谱的旗舰大模型 GLM-5.3,并正式发布了 DeepSeek-V4-Pro。相关的 API 服务现已面向公众开放,使开发者能够快速接入并利用这些模型能力。这两款新推出的模型专为编程和智能体核心应用场景设计。GLM-5.3 基于智谱最新技术成果构建,显著提升了编程能力、长周期任务执行以及网络安全防护水平。与此同时,DeepSeek-V4-Pro 专注于增强智能体交互体验,使其成为代码开发及多步复杂任务处理的理想选择。目前
为什么智能体在长任务中会遗忘并偏离轨道:AWS、Claude Code 和 Manus 解析四大框架
大型语言模型在执行长时间操作时经常失去焦点,偏离其最初目标——这是智能体领域的一个持续挑战。该问题通常并非源于模型本身,而是源于周围的执行框架。AWS 最近发布的云编程智能体设计指南清楚地指出了这一点:浅层智能体会因上下文溢出而失去焦点,在长周期中迷失方向,且无法维持状态。解决这一问题需要优化管理核心模型外部所有操作的“框架”(harness)。对主流框架的全面审查揭示了这一关键层。LangChain Deep Agents、Claude Code、Manus、OpenAI Codex 和 A
相关专题推荐
评论 (0)
0/500
中国的AI领域迎来了重大技术飞跃,随着稀宇科技(Xiyu Technology)最新大型语言模型MiniMax M3的正式推出。这一先进系统结合了最先进的编码能力,并支持高达100万token的超长上下文窗口。值得注意的是,它原生支持多模态输入,包括图像和视频处理,以及计算机桌面交互,使其成为中国首个整合这三项关键能力的开源模型。

标准化基准测试中的卓越表现
在严格的SWE-Bench Pro编程评估中,MiniMax M3获得了59.0%的分数,超越了GPT-5.5和Gemini 3.1 Pro,同时紧追顶级模型Opus 4.7。该模型在AI代理能力的Claw-Eval测试中也展示了优越的性能,并在OmniDocBench多模态文档理解基准测试中取得了领先分数。
先进架构提升效率
推动这一性能的是M3采用的新型稀疏注意力架构(MSA)。在处理100万token的超长上下文时,与上一代模型相比,该设计将单个token的计算量减少了一半。因此,该模型的解析速度提升了9倍以上,答案生成速度提升了15倍以上。API现已上线,官方团队承诺在10天内向全球开发者发布模型权重和技术报告。
印度要求来电显示应用程序与电信运营商共享垃圾数据
印度扩大了其反垃圾短信法规,要求来电显示和电话管理应用程序与电信运营商共享用户垃圾报告,这一举措导致知名垃圾阻止应用程序提供商 Truecaller 将该政策标记为反竞争。周五,印度电信监管机构印度电信管理局(TRAI)更新了规范商业通信的规则。这些更新强制要求允许用户将电话标记为垃圾或 junk 的来电 ID 和电话管理应用程序,将这些报告传输到由电信运营商运营的基于区块链的平台。该平台监控商业通信并执行反垃圾协议。根据 TRAI 的说法,这一修改旨在扩大可用于打击垃圾短信发送者的垃圾报告
Qwen AI 平台通过正式发布 GLM-5.3 和 DeepSeek-V4-Pro,进一步扩展其模型矩阵
阿里云通义千问 AI 平台(MaaS)近期进一步扩充了模型服务矩阵,接入了智谱的旗舰大模型 GLM-5.3,并正式发布了 DeepSeek-V4-Pro。相关的 API 服务现已面向公众开放,使开发者能够快速接入并利用这些模型能力。这两款新推出的模型专为编程和智能体核心应用场景设计。GLM-5.3 基于智谱最新技术成果构建,显著提升了编程能力、长周期任务执行以及网络安全防护水平。与此同时,DeepSeek-V4-Pro 专注于增强智能体交互体验,使其成为代码开发及多步复杂任务处理的理想选择。目前
为什么智能体在长任务中会遗忘并偏离轨道:AWS、Claude Code 和 Manus 解析四大框架
大型语言模型在执行长时间操作时经常失去焦点,偏离其最初目标——这是智能体领域的一个持续挑战。该问题通常并非源于模型本身,而是源于周围的执行框架。AWS 最近发布的云编程智能体设计指南清楚地指出了这一点:浅层智能体会因上下文溢出而失去焦点,在长周期中迷失方向,且无法维持状态。解决这一问题需要优化管理核心模型外部所有操作的“框架”(harness)。对主流框架的全面审查揭示了这一关键层。LangChain Deep Agents、Claude Code、Manus、OpenAI Codex 和 A





首页






