選項
首頁
新聞
Hy3 預覽:元重組後的首個開源版本,實用性與代理功能全面提升

Hy3 預覽:元重組後的首個開源版本,實用性與代理功能全面提升

2026-06-01
211

4月23日,騰訊的「環元」團隊以開源形式發布了語言模型 Hy3preview。 這款混合專家模型結合了快速與慢速推理機制,總參數達2,950億,有效參數達210億,支援長達256K的上下文長度。它是環源重構後訓練的首個模型,也是環源史上最智能的模型,在複雜推理、指令遵循、上下文學習、程式碼生成、代理能力以及整體推理表現方面均取得顯著提升。

2026年2月,騰訊幻元重構了預訓練與強化學習基礎架構,並確立了三項實現實用價值的指導原則:

1. 系統化能力:與其強調專精化,我們更意識到即使是程式碼代理這類單一應用,也需要推理、長上下文處理、指令遵循、對話、編碼及工具使用等領域的深度協作。

2. 真實評估:超越易被操縱的公開基準測試,我們透過內部開發的題庫、最新考試題組、人工評分、產品專屬群眾測試及其他方法,來評估並提升模型在現實世界中的實效性。

3. 聚焦成本效益:實用性必須與商業可行性相契合。經深度協同設計的模型架構與推論框架,大幅降低了任務成本,使人工智慧既經濟實惠又高效。

Hy3preview 標誌著環源加速追求能解決現實世界問題的實用大型語言模型的起點。

騰訊首席 AI 科學家姚順宇指出,Hy3preview 是環源模型重構的第一步。透過此次開源發布,我們期待獲得社群與用戶的真實反饋,這將有助於完善正式版 Hy3 的實用性。 與此同時,我們持續擴大預訓練與強化學習的規模,不斷提升模型的智能上限。透過與眾多騰訊產品的深度協同設計,我們正穩步提升模型的實務表現,並開始探索專項模型能力。

目前,Hy3preview 已上線於騰雲、Yua、ima、CodeBuddy、WorkBuddy、QQ、QQ瀏覽器、騰訊文檔及騰訊樂翔。其他主要產品如微信官方帳號、和平精英、騰訊新聞、騰訊選股、騰訊客服及微信閱讀等,也將陸續推出。 此外,Hy3preview 已與 OpenClaw、OpenCode 及 KiloCode 等熱門開源代理框架整合,並上架於騰訊雲的大型模型服務平台 TokenHub。

Hy3preview 強調全方位的實用性,並大幅提升代理能力

多項評估證實,Hy3preview 的能力已獲得全面提升。

1.卓越的上下文學習與指令遵循能力

在多樣化的真實生產與日常情境中,解析雜亂冗長的上下文並遵循複雜且不斷演變的規則,仍是模型面臨的關鍵挑戰。汲取自騰訊的業務應用案例,桓元團隊推出了 CL-bench 和 CL-bench-Life,以創新方式評估上下文學習能力,並顯著強化了 Hy3preview 的上下文學習與指令遵循能力。

image.png

2. 卓越的複雜推理能力,榮獲中國清華大學數學博士資格考試最高分

複雜推理是模型解決各類問題能力的基石。Hy3preview 在 FrontierScience-Olympiad 和 IMOAnswerBench 等高難度 STEM 推理基準測試中表現優異,並在最新的清華大學鶴巖學院數學博士資格考試(2026年春季)及全國高中生物競賽(CHSBO2025)中取得卓越成績,展現出強大的泛化推理能力。

image.png

3. 程式碼與代理能力取得重大突破,展現強勁的成本效益

程式碼與代理能力是 Hy3preview 最顯著的改進。得益於重新設計的預訓練與強化學習基礎架構,以及擴大的強化學習任務規模,騰訊幻元迅速在 SWE-Bench Verified 和 Terminal-Bench2.0 等領先的程式碼代理基準測試,以及 BrowseComp 和 WideSearch 等搜尋代理基準測試中,取得具競爭力的成績。

image.png

在數位領域中,程式碼能力衡量模型在開發環境中執行任務的能力,而搜尋能力則評估其從開放來源檢索、篩選及整合資訊的能力。這兩者共同決定了模型在 OpenClaw 等複雜代理情境中是否真正實用。Hy3preview 在 ClawEval 和 WildClawBench 等評估中表現優異,顯示我們的代理能力正穩步邁向完備與實用。

image.png

除了公開基準測試外,騰訊環源還構建了多個內部評估套件,以衡量模型在真實開發情境中的表現。結果顯示,在後端工程任務集 Hy-Backend、以開發者為中心的 Hy-Vibe Bench,以及具挑戰性的軟體工程任務集 Hy-SWE Max 中,Hy3preview 均展現出強大的競爭力。

48920987-bdbb-464b-adca-513891f742e1.png

若將模型規模與整體代理性能與開源替代方案進行比較,Hy3preview 憑藉其高性價比脫穎而出。

image.png

騰訊核心業務已全面整合,多款關鍵 AI 產品均展現顯著效益

在正式發布前,Hy3preview 已於騰訊主要 AI 產品中進行測試,並帶來顯著的正面成效。

在 Yua 方面,Huan Yuan 與 Yua 進行了深度協同設計。該模型在意圖理解準確度、文本生成品質及深度搜尋等關鍵指標上的表現均獲得提升,同時針對寫作風格、表達方式、情緒智能、內容結構及專業性進行了微調。這種緊密的模型與產品協作,為用戶帶來了更智能且類人化的互動體驗。

在 ima 的知識庫問答與通用問答場景中,測試顯示 Hy3preview 在長文本處理方面表現優異,特別是在檢索任務中,其回應具備高準確度、高覆蓋率及高全面性。

在 CodeBuddy 和 WorkBuddy 應用中,Hy3preview 的首個標記延遲降低 54%,端到端處理時間縮短 47%,成功率攀升至 99.99% 以上。在真實用戶環境中,它能穩定驅動多達 495 步驟的複雜代理工作流程,涵蓋文件處理、數據分析、知識檢索及 MCP 工具鏈調度等多元辦公任務。

針對微信官方帳號的AI虛擬形象與AI客服進行的專項評估顯示,Hy3preview 相較於 Hy2 實現了更全面的升級。它在用戶意圖理解、複雜語境延續以及知識組織方面展現出更高的成熟度。 在處理模糊查詢、短句及多輪對話時,它能更精準地掌握用戶需求,並產生更清晰、更穩定的回應。透過整合知識庫、用戶記憶與情境生成機制,其輸出內容更貼近AI虛擬形象或客服角色的定位,顯著減少了過度想像、主觀臆測及情緒化語氣,使整體互動體驗更趨近於「值得信賴、自然且高效」的境界。

在《和平精英》的 AI NPC 場景中,團隊於 Hy3preview 發布後迅速進行整合與評估,並取得令人印象深刻的整體成果。 在遊戲外的角色扮演情境中,Hy3preview 精準掌握角色設定,針對開放式問題提供高度相關且具附加價值的內容,營造出更真實、自然且沉浸式的對話。在複雜的遊戲內戰鬥情境中,模型的回應時機近乎真實玩家,展現出卓越的穩定性與類人角色扮演能力,使其整體表現出類非凡。

在騰訊 Docs 的 AI PPT 場景中,相較於前一代 Hy2 版本,Hy3preview 展現出顯著提升:生成成功率上升 20%、評分提升 10%,生成時間縮短 20%。整體而言,新模型在模板選擇、配色、大綱生成及內容補充方面表現優異——既無幻覺、主題契合,且視覺吸引力強。

針對 QQ 人工智慧助理「小 Q」,相較於前一版本,Hy3preview 在長文本首字節延遲、整體回應速度及流式傳輸效率方面帶來重大優化。數學推理等核心能力顯著提升,同時多情境指令遵循與泛化能力亦進一步強化。 在工具調用推理與多輪參考解析方面,其表現更為穩定高效。在 OpenClaw 官方 PinchBench QQ 智能代理場景測試中,該模型取得優異成績,整體用戶體驗顯著提升。

推理效率提升 40%,在相同成本下實現最佳智慧密度

得益於模型與推理框架的深度協作,以及在推理框架、運算子效能、量化演算法等層面的全面優化,整體推理效率提升了 40%,且 Hy3preview 的成本相較上一代大幅降低。

在騰雲的大模型服務平台 TokenHub 上,Hy3preview 的輸入價格低至每百萬令牌 1.2 元,輸入快取為每百萬令牌 0.4 元,輸出為每百萬令牌 4 元。 此外,騰雲與環源共同推出了客製化的 Hy3preview 代幣方案,個人版每月僅需 28 元起,為代理開發及打造「龍蝦」應用程式提供了高性價比的選擇。

image.png

image.png

相關文章
DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。 DeepMind執行長哈西里斯:我每天睡六個小時,通常在凌晨1點左右感到精力充沛。 Fortune 最近刊登了對谷歌 DeepMind 執行長 Demis Hassabis 的採訪,揭示了他對休息和生產力的非傳統方法。Hassabis 透露,他睡眠時間非常少,將清醒時間劃分為兩個不同的工作階段。關於他的睡眠習慣,Hassabis 表示:“我目標睡六小時,但我的習慣非同尋常。我可以在白天有效運作。”他強調,睡眠少於六小時會對大腦健康產生負面影響。Hassabis 於 2010 年聯合創立了 DeepMind(後被谷歌收購),並因其在蛋白質結構預測方面的開創性工作榮獲 20
儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額 儘管營收未達預期,OpenAI 與 Anthropic 仍爭奪市場份額 儘管近期有報導指出 OpenAI 未達營收目標,導致本週二科技股承壓,但私人人工智慧實驗室的投資者仍展現出韌性。資深投資者已確認,儘管媒體報導負面,他們仍不會削減投資。分析師認為當前的 AI 競逐仍處於初期階段,因此排除「贏家通吃」的結果。儘管高昂的運算成本對營收造成壓力,但各實驗室可透過調高訂閱費來提升獲利能力。產業格局正經歷微妙的變化與 OpenAI 不同,競爭對手 Anthropic 獲得了
加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代 加州自動駕駛合規:罰單、地理圍欄與 100 萬英里的新時代 Guident 在南佛羅里達州營運一輛 AuveTech 接駁車,並運用其遠端監控技術,管理西棕櫚灘的一條四英里路線以及博卡拉頓的一條一英里路線。| 圖片來源:Guident加州正重新定義無人駕駛車輛的監管格局,從科技產業的「快速行動、打破常規」心態,轉向嚴格的問責制與嚴謹的行駛里程要求。Guident 執行董事長兼執行長哈羅德·布勞恩(Harold Braun)在《機器人報告》(The Robo
相關專題推薦
聊天機器人 用於語言練習、面試準備和日常流利度的最佳 AI 角色扮演聊天應用
用於語言練習、面試準備和日常流利度的最佳 AI 角色扮演聊天應用

2026 年最新最佳頂級評分 AI 角色扮演聊天應用,用於語言練習、面試準備和日常流利度!XIX.AI 精心策劃了一個強大的變革性合集,提供免費與付費對比、真實世界測試以及每週更新的排名。這些必試工具可幫助您提升寫作技能,克服流利度挑戰,並提高所有日常場景下的溝通效率。立即探索,發現您語言成長的完美工具!

10 個工具
xix.ai
音樂創作 用於混音製作、取樣準備及卡拉OK母帶處理的 AI 聲部分離工具
用於混音製作、取樣準備及卡拉OK母帶處理的 AI 聲部分離工具

2026年最新、最優秀且評分最高的AI音軌分離工具彙總,專為混音製作、取樣準備以及卡拉OK音訊處理而設計。這些功能強大的創新工具經過實際測試,能夠實現精準的音訊分離,顯著提升工作效率。XIX.AI每週都會更新免費的付費產品對比指南,幫助您找到最適合自身需求的工具。立即探索,發揮您的AI優勢。

8 個工具
xix.ai
數據分析 用於收入看板、轉化漏斗分析及產品指標分析的 AI SQL 助手
用於收入看板、轉化漏斗分析及產品指標分析的 AI SQL 助手

2026年最新最優秀的AI SQL輔助工具排名揭曉!XIX.AI精心挑選了一系列功能強大的工具,這些工具會定期更新,並透過真實的場景測試來驗證其效能。使用這些值得嘗試的工具,您可以快速生成精準的收入分析報表、分析銷售流程,並追蹤產品各項指標,從而大幅提升工作效率。立即探索,找到最適合您的資料驅動決策工具!238個字元

9 個工具
xix.ai
音樂創作 最佳用於歌曲草稿的 AI 旋律創作工具
最佳用於歌曲草稿的 AI 旋律創作工具

2026 年最新最佳頂級評分 AI 旋律創作工具,助力歌曲草稿創作!XIX.AI 精心策劃了一套極具影響力且經過嚴格真實世界測試的變革性合集,旨在提供最佳的創作體驗。您可以找到詳細的免費與付費版對比、精準的排名以及必試選項,這些工具旨在幫助您輕鬆創作出令人驚豔的歌曲草稿,並顯著提升您的創意生產力。立即探索,發現您的完美工具!

8 個工具
xix.ai
聊天機器人 最適合面試練習的 AI 對話訓練工具
最適合面試練習的 AI 對話訓練工具

2026 年最新、最受好評的 AI 面試對話訓練工具,盡在 XIX.AI!這份精心精選的清單收錄了多款功能強大、顛覆傳統的工具,這些工具均經過嚴格的實戰測試,能提供精準的回饋。 您將在此找到免費版與付費版的比較分析,以及詳細的排名榜單,助您挑選必試的選項,從而提升自信與技能。立即探索,發掘助您在面試中脫穎而出的完美工具!

12 個工具
xix.ai
設計與藝術 最適合進行創意實驗的 AI 風格轉移工具
最適合進行創意實驗的 AI 風格轉移工具

2026 年最新、最佳且評價最高的 AI 風格轉移工具,助您進行創意實驗!XIX.AI 精心精選了一系列強大且具革命性的必試工具,這些工具經實際測試與嚴格評比,能帶來卓越成果。這些頂尖解決方案能加速內容創作並開啟無盡的創意可能性,協助創作者顯著提升生產力。 立即探索,找出最適合您的工具,並從今天開始創作吧!

9 個工具
xix.ai
評論 (0)
0/500
OR