选项
首页
新闻
Hy3 预览:元重构后的首个开源版本,实用性和代理能力均得到增强

Hy3 预览:元重构后的首个开源版本,实用性和代理能力均得到增强

2026-06-01
211

4月23日,腾讯幻元发布了开源语言模型Hy3preview。 这一混合专家模型融合了快速推理与慢速推理,总参数达2950亿,有效参数210亿,支持长达256K的上下文长度。作为幻元重构后的首个训练模型,它也是幻元历史上最智能的模型,在复杂推理、指令执行、上下文学习、代码生成、智能体能力以及整体推理性能方面均实现了显著提升。

2026年2月,腾讯幻元重构了预训练与强化学习基础设施,并确立了实现实用价值的三大指导原则:

1. 系统化能力:我们不强调专业化,而是认识到即使是代码代理这样的单一应用,也需要推理、长上下文处理、指令执行、对话、编码和工具使用等能力的深度协作。

2. 真实评估:超越易被钻空子的公开基准,我们通过自研试题、最新考试题库、人工评估、产品专属众测及其他方法,评估并提升模型在现实世界中的有效性。

3. 注重成本效益:实用性必须与商业可行性相契合。深度协同设计的模型架构与推理框架显著降低了任务成本,使AI既经济实惠又高效实用。

Hy3preview标志着幻元加速推进解决现实世界问题的实用型大型语言模型的征程。

腾讯首席AI科学家姚顺宇指出,Hy3preview是幻源模型重构的第一步。通过此次开源发布,我们期待获得来自社区和用户的真实反馈,这将有助于完善正式版Hy3的实用性。 与此同时,我们持续扩大预训练和强化学习的规模,不断突破模型智能的上限。通过与众多腾讯产品的深度协同设计,我们稳步提升模型的实际应用表现,并开始探索专用模型能力。

目前,Hy3preview 已在腾讯云、Yua、ima、CodeBuddy、WorkBuddy、QQ、QQ浏览器、腾讯文档和腾讯乐享上线。微信官方账号、和平精英、腾讯新闻、腾讯选股、腾讯客服和微信阅读等其他主要产品也正在逐步上线。 此外,Hy3preview 已与 OpenClaw、OpenCode、KiloCode 等主流开源代理框架实现集成,并入驻腾讯云大模型服务平台 TokenHub。

Hy3preview 注重全方位的实用性,智能代理能力显著提升

多项评估证实,Hy3preview 的能力已获得全面提升。

1.出色的上下文学习与指令遵循能力

在多样化的真实生产和日常场景中,解析杂乱冗长的上下文并遵循复杂且不断变化的规则,仍是模型面临的关键挑战。基于腾讯的业务用例,Huan Yuan 推出了 CL-bench 和 CL-bench-Life,以创新的方式评估上下文学习能力,并显著增强了 Hy3preview 的上下文学习和指令遵循能力。

image.png

2. 卓越的复杂推理能力,在中国清华大学数学博士资格考试中取得最高分

复杂推理能力是模型解决各类问题的基础。Hy3preview在FrontierScience-Olympiad和IMOAnswerBench等高难度STEM推理基准测试中表现优异,并在最新一届清华大学曲真学院数学博士资格考试(2026年春季)及全国高中生物竞赛(CHSBO2025)中取得优异成绩,展现出强大的泛化推理能力。

image.png

3. 代码与智能体能力取得重大突破,展现出强劲的成本效益

代码与智能体能力是 Hy3preview 最显著的改进。得益于重构的预训练和强化学习基础设施,以及强化学习任务规模的扩大,腾讯幻元在 SWE-Bench Verified 和 Terminal-Bench2.0 等主流代码智能体基准测试,以及 BrowseComp 和 WideSearch 等搜索智能体基准测试中,迅速取得了具有竞争力的成绩。

image.png

在数字领域,代码能力衡量模型在开发环境中执行任务的能力,而搜索能力则评估其从公开来源检索、筛选和综合信息的能力。这两者共同决定了模型在OpenClaw等复杂智能体场景中是否真正有用。Hy3preview在ClawEval和WildClawBench等评估中取得了优异成绩,表明我们的智能体能力正稳步朝着完备性和实用性迈进。

image.png

除公开基准测试外,腾讯幻元还构建了多套内部评估体系,以衡量模型在真实开发场景中的表现。结果表明,在后端工程任务集Hy-Backend、面向开发者的Hy-Vibe Bench以及高难度软件工程集Hy-SWE Max中,Hy3preview均展现出强劲的竞争力。

48920987-bdbb-464b-adca-513891f742e1.png

在对比开源替代方案的模型规模与整体智能体性能时,Hy3preview 因其高性价比而脱颖而出。

image.png

腾讯核心业务深度融合,多款关键AI产品成效显著

在正式发布前,Hy3preview已在腾讯主要AI产品中经过测试,并取得了显著的积极成效。

在 Yua 方面,Huan Yuan 与 Yua 进行了深度协同设计。模型在意图理解准确率、文本生成质量和深度搜索等关键指标上的性能得到提升,同时针对写作风格、表达、情感智能、内容结构和专业性进行了微调。这种紧密的模型与产品协作,为用户带来了更智能、更类人的交互体验。

在ima的知识库问答和通用问答场景中,测试表明Hy3preview在长文本处理方面表现卓越,尤其在检索任务中,其回答具有高准确率、高覆盖率和高全面性。

在CodeBuddy和WorkBuddy中,Hy3preview的首词延迟降低了54%,端到端耗时缩短了47%,成功率攀升至99.99%以上。在真实用户环境中,它能稳定驱动多达495步的复杂智能代理工作流,涵盖文档处理、数据分析、知识检索及MCP工具链编排等各类办公任务。

在针对微信官方账号AI虚拟助手和AI客服的专项评估中,Hy3preview相较于Hy2实现了更全面的升级。它在用户意图理解、复杂上下文延续以及知识组织方面展现出更高的成熟度。 在处理模糊查询、短句及多轮对话时,它能更准确地把握用户需求,并生成更清晰、更稳定的回复。通过整合知识库、用户记忆和上下文生成机制,其输出结果与AI虚拟形象或客服角色更为契合,显著减少了过度想象、主观臆断和情绪化表达,使整体交互体验更趋近于“可信、自然、高效”。

在《和平精英》的AI NPC场景中,团队在Hy3preview发布后迅速将其集成并进行评估,取得了令人印象深刻的整体成果。 在游戏外的角色扮演场景中,Hy3preview准确把握角色设定,针对开放式问题提供高度相关且具有附加值的内容,营造出更真实、自然、沉浸式的对话体验。在复杂的游戏内战斗场景中,该模型的响应时序与真实玩家极为接近,展现出卓越的稳定性和类人角色扮演能力,整体表现极为出色。

在腾讯文档的AI PPT场景中,相较于前代Hy2版本,Hy3preview表现显著提升:生成成功率提升20%,评估分数提高10%,生成时间缩短20%。总体而言,新模型在模板选择、配色方案、大纲生成及内容补充方面表现优异——无幻觉、主题契合且视觉吸引力强。

在QQ智能助手“小Q”方面,相较于前一版本,Hy3preview在长文本首字节延迟、整体响应速度及流式处理效率上实现了重大优化。数学推理等核心能力显著提升,多场景指令执行与泛化能力也得到进一步增强。 在工具调用推理和多轮引用解析方面,其表现更为稳定高效。在OpenClaw官方PinchBench QQ智能代理场景测试中,该模型取得了优异成绩,整体用户体验显著提升。

推理效率提升40%,在同等成本下实现最优智能密度

得益于模型与推理框架的深度协同,以及在推理框架、运算子性能、量化算法等方面的全面优化,整体推理效率提升了40%,Hy3preview的成本相较上一代产品大幅降低。

在腾讯云的大模型服务平台 TokenHub 上,Hy3preview 的输入价格低至每百万令牌 1.2 元,输入缓存为每百万令牌 0.4 元,输出为每百万令牌 4 元。 此外,腾讯云与幻元联合推出了定制化的Hy3preview代币套餐,个人版月费低至28元,为智能体开发和构建“龙虾”应用提供了高性价比的选择。

image.png

image.png

相关文章
印度科技巨头投资3000万美元,打造微软Office的AI竞争对手 印度科技巨头投资3000万美元,打造微软Office的AI竞争对手 连续创业者 Bhavin Turakhia 正投入 3000 万美元自有资金,押注企业 AI 领域仍有新玩家的空间。他最新的创业项目 Neo 基于一个核心信念:传统的职场软件不能仅靠聊天机器人进行修补,而需要进行彻底的架构重构。46 岁的 Turakhia 有着支持雄心勃勃的企业科技项目的历史。在过去二十年中,他联合创立了 Directi、Radix、Titan 和 Zeta,在寻求外部投资之前,主要使用个人资本为这些项目提供资金。他正将同样的自力更生策略应用于 Neo。Turakhia 向
前OpenAI首席科学家Ilya的SSI首次发布模型 前OpenAI首席科学家Ilya的SSI首次发布模型 AI 取得了另一项重大里程碑。在从 OpenAI 离职后,前首席科学家伊利亚·苏茨克弗(Ilya Sutskever)创立了 Safe Superintelligence Inc.(SSI),该公司最近公布了其首个模型的详细信息。海外社交媒体上的报道指出,该团队正在利用 TTT(测试时训练)开发一个紧凑的推理引擎,这是他们在追求安全超级智能过程中的关键进展。这种新颖的架构专注于使模型能够“学习如何学习”。与在推理过程中保持参数静态的传统大型语言模型不同,该引擎在处理现实世界任务时会动态更新特定
Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field Lovable Leads Atech's Seed Round as AI Ambient Coding Officially Enters the Hardware Field 2026年5月14日,AI应用开发平台Lovable宣布参与丹麦硬件初创公司Atech的80万美元种子轮融资。该轮由Lovable领投,吸引了包括a16z Scout Fund、Sequoia Scout Fund以及Nordic Makers在内的顶级风险投资机构。此次投资标志着Lovable将“Vibe Coding”概念从纯软件开发战略扩展至硬件工程领域。Atech旨在通过AI驱动的交互式平台简化复杂的硬件原型制作。用户购买基础硬件套件,并通过AI聊天机器人以自然语言描述其设计概念;系统
相关专题推荐
聊天机器人 最佳AI对话训练工具,助你备战面试
最佳AI对话训练工具,助你备战面试

2026年最新、最受好评的AI面试模拟训练工具现已登陆XIX.AI!这份精心精选的合集收录了功能强大、具有革命性意义的工具,它们均经过严格的实际测试,能够提供精准的反馈。 您将看到免费版与付费版的对比分析以及详细排名,助您挑选出必试之选,从而提升自信并精进技能。立即探索,发现助您面试成功的完美工具!

12 个工具
xix.ai
设计与艺术 最适合创意实验的AI风格转换工具
最适合创意实验的AI风格转换工具

2026年最新最佳、评价最高的AI风格转换工具,助您开展创意实验!XIX.AI精心甄选了一系列功能强大、颠覆性的必试工具,这些工具经过实际测试和严格排名,可带来卓越的效果。这些顶级解决方案通过加速内容创作并释放无限创意潜能,帮助创作者显著提升工作效率。 立即探索,找到最适合您的工具,今天就开始创作吧!

9 个工具
xix.ai
漫画创作 最适合视觉叙事的AI对话气泡工具
最适合视觉叙事的AI对话气泡工具

2026年最新、最受欢迎的视觉叙事AI对话气泡工具现已登陆XIX.AI!这份精心精选的合集汇集了功能强大、具有颠覆性的工具,可帮助创作者提升工作效率并突破创作瓶颈。 获取免费版与付费版的对比分析,查看实际测试结果,并查阅最新排行榜,找到最适合打造引人入胜的视觉叙事的必试解决方案。立即探索,发现您的理想工具!

10 个工具
xix.ai
会议助理 顶级AI会议摘要工具:清晰追踪决策与后续跟进
顶级AI会议摘要工具:清晰追踪决策与后续跟进

2026年最新高评分最佳AI会议摘要工具,助您清晰追踪决策并轻松跟进。这份精心筛选的清单展示了功能强大、具有颠覆性的解决方案,它们通过自动化会议记录、识别关键行动项以及简化所有项目中的团队协调,显著提升工作效率。 获取免费版与付费版的对比分析,以及实际测试报告和每周更新的排行榜,助您找到最适合的工具。立即探索,释放您的AI优势!

9 个工具
xix.ai
数据分析 最佳人工智能数据清洗工具:快速处理缺失值与重复数据
最佳人工智能数据清洗工具:快速处理缺失值与重复数据

2026年最新、最优秀且评分最高的AI数据清洗工具,可快速处理缺失值与重复数据问题。这份精心挑选的清单展示了那些功能强大、能带来颠覆性变革的解决方案,可显著提升工作效率。所有候选工具都经过了严格的实际应用测试,以确保其稳定性。您可以获取免费版与付费版的对比信息,找出最符合您需求的必备工具。即刻访问XIX.AI,开启您的AI优势之旅。

11 个工具
xix.ai
设计与艺术 最佳AI创意构思工具,助力艺术家突破视觉瓶颈
最佳AI创意构思工具,助力艺术家突破视觉瓶颈

2026 年最新最佳顶级评分 AI 创意构思工具由 XIX.AI 精心策划,旨在帮助创作者突破视觉瓶颈并即时提升创造力。这些强大的变革性工具提供真实世界测试、详细的免费与付费对比以及每周更新的排名。发现您的完美工具,加速内容创作,并立即释放您的 AI 优势。立即探索!

14 个工具
xix.ai
评论 (0)
0/500
OR