27B 數學 SOTA 與 3 秒情緒克隆:有道開源「紫月 4」多模態與語音合成引擎
網易有道近日宣布,其「孔子4」大型模型已全面升級至 4.0 版。如今「孔子4」已全面支援多模態功能,可整合文字、圖像及語音互動。 有道同時將其核心的多模態與文字轉語音(TTS)模型開源,而翻譯模型則經過深度技術改造,在品質與效率方面均有所提升。
該多模態模型在視覺與數學領域均達到當前最佳水準(SOTA),並在純文字數學題目上展現出卓越表現
根據公告,這款擁有 270 億參數的開源「孔子4」多模態模型,已將教育場景中基於視覺輸入的數學處理能力提升至業界領先水準(SOTA)。 在規模相近的模型中,Confucius4 特別擅長處理包含圖表的高階視覺數學與物理題目。它在中文純文字數學題目上也展現顯著進步,準確度達 81.4%,位居業界領先地位。

▲ 在同規模模型中,Confucius4 於多項視覺數學基準測試中取得業界最佳成績
圖片來源:https://huggingface.co/netease-youdao/Confucius4
更關鍵的突破在於實務上的成本效益。據相關負責人表示,該新模型採用了精煉的推理鏈重構方案。透過彙整大量高品質且簡潔的推理樣本進行深度優化,將推理鏈的輸出長度壓縮了 43.2%。
這意味著它能以更少的標記數和更短的推理路徑更快地給出答案,大幅降低企業與開發者在實際商業情境中的推理成本。

▲ Confucius4 在多項視覺數學基準測試中顯著減少了輸出標記數
圖片來源:https://huggingface.co/netease-youdao/Confucius4
此外,Confucius4 研究團隊針對中國學生在現實生活中面臨的作業、考試及解題情境,對模型進行了深度優化。這使它能夠應對真實的學習挑戰,成為更具同理心的數位助理。
開源語音合成(TTS):支援 14 種語言,3 秒內即可複製原聲,跨語言無口音問題
除了多模態模型外,語音合成(TTS)引擎也已開源。該引擎基於尖端的「語音編碼器 + 大型語言模型(LLM)」架構,為開發者和內容創作者提供零樣本、低門檻的語音克隆與情緒合成能力。
目前,該引擎全面支援 14 種語言:中文、英文、日文、韓文、德文、法文、西班牙文、印尼文、義大利文、泰文、葡萄牙文、俄文、馬來文及越南文。 該系統無需額外訓練,即可自然地將發言人的聲音轉移至不同語言,在維持聲音一致性的同時,確保合成結果聽起來像母語般流暢,且在跨語言克隆過程中不會滲入口音。
在語音克隆方面,Confucius4 實現了完整的「上傳即克隆」功能。使用者只需提供任何音訊素材,系統便能在三秒內複製原始聲音。 根據公告,該引擎在克隆任務上的準確度超過 97%,克隆聲音與原始聲音的相似度超過 85%。它既能保留發聲者獨特的嗓音特徵,又能精準重現其情感語調,其全面能力在該領域名列前茅。
此外,此開源模型在真實的多語言情境中展現出強大的穩健性,能處理各種合成需求,包括日常對話、新聞播報、企業宣傳以及複雜的情感表達。
翻譯模型品質全面升級,推論速度提升 80%
作為有道根基最深厚的技术资产之一,翻译模型在本次更新中也获得了重大的技术升级,进一步提升了其在翻译任务中的表现。
在數據方面,孔子團隊蒐集並清理了數十億條多語言語料,並聘請具備 TEM-8 認證的專業人員進行多維度人工評審,從源頭確保語料庫的高品質。
在演算法方面,該模型採用創新的「多專家 OPD」模式,透過更聰明的「柔性策略」來發揮各專家之所長。同時,透過強化學習引入格式獎勵與語言偵測機制,有效解決機器翻譯中常見的「脫離語境翻譯」及「混語輸出」等問題。
為滿足高頻率、高並發的工業應用需求,更新後的翻譯模型配備了高效的加速機制,可直接將整體推論速度提升 80%。 結合自動化大型模型評估與隨機人工抽樣這套客製化解決方案,新一代翻譯模型在文字、圖像及文件翻譯等多種情境中,均展現出極高的速度與品質水準。
回顧有道在 AI 領域的發展歷程,從最初推出首個教育專用大模型「孔子」,到推出顛覆傳統口語練習方法的「虛擬口語教練 Hi Echo」,再到將「孔子 2.0」與「孔子 3.0」全面整合至軟硬體生態系統中, 有道始終引領著AI在真實場景中的賦能應用。2026年,有道透過「龍蝦AI」、「有道寶」、「有道會議助手」及「Thinkflow」等一系列AI代理產品,加速推動AI應用,實現了前瞻性的全場景AI代理矩陣。
「孔子4.0」的升級與核心模型的全面開源,不僅大幅降低了開發者在多模態與語音合成領域的門檻,更展現出一種生態閉環——基礎核心技術滋養著上層的智能代理矩陣。 有道期望,在全全球開發者與開源社群的共同貢獻下,這個全模態大模型生態系統將為各行各業帶來真正的生產力轉型。
附錄:開源網址:
「Confucius4」多模態模型:https://huggingface.co/netease-youdao/Confucius4
「Confucius4」語音合成(TTS)模型:https://github.com/netease-youdao/Confucius4-TTS
相關文章
Vbot VITA Power 完成近 5 億元 Pre-A 輪融資,首批具身智慧產品開啟大規模交付
Vbot微塔動力作為具身智慧領域的先行者,已完成近5億元人民幣的Pre-A輪融資。東方嘉富、華泰紫金和復星銳正領投,上汽資本(上汽集團)及現有股東跟投。此次投資標誌著全球消費級具身智慧領域單筆最大融資事件。5月8日,Vbot推出首款產品“超級狗”並啟動量產交付。首批500臺已發貨,標誌著具身機器人從實驗室走向日常環境。Vbot的機器狗於2025年12月釋出,是全球首款無需遙控的智慧四足機器人。其核心功能——全場景陪伴、自主搬運和AI拍攝——推動了強勁的預售需求。在有限的預售視窗期內,該產品獲得了
百度文音推出 PaddleOCR-VL-1.6,準確度達 96.33%,在文件解析領域創下新的 SOTA 紀錄
百度已正式推出 PaddleOCR-VL-1.6,這是 ERNIE 大型模型的一款專用變體。 在權威的 OmnicDocBench v1.6 評測中,該模型以 96.33% 的準確率脫穎而出,表現優於 Gemini-3-Pro、GPT-5.2 及 GLM-OCR 等領先模型。 此成就樹立了業界新的 SOTA 標竿,並在綜合性能方面位居全球首位,標誌著多模態大型模型在理解複雜文件及分析真實世界情境方
Anthropic 推出面向中小企業的 Claude 技能包
Anthropic 於週三正式推出面向中小企業的 Claude,推出一套專為中小企業(SMB)量身定製的自動化工具套件。該舉措旨在降低技術門檻,使沒有專職 IT 人員的本地企業能夠利用生成式 AI 帶來的生產力提升。AI 行業的競爭焦點正從大型企業和開發者社羣轉向那些驅動經濟卻在 AI 採用方面滯後的 underserved 市場。與業務流程無縫整合該套餐的突出特點是其強大的整合能力。使用者可以在 Anthropic 的自動化平臺中啟用特定技能,以與主流商業軟體無縫連線:財務與支付: 相容 Qui
相關專題推薦
評論 (1)
0/500
網易有道近日宣布,其「孔子4」大型模型已全面升級至 4.0 版。如今「孔子4」已全面支援多模態功能,可整合文字、圖像及語音互動。 有道同時將其核心的多模態與文字轉語音(TTS)模型開源,而翻譯模型則經過深度技術改造,在品質與效率方面均有所提升。
該多模態模型在視覺與數學領域均達到當前最佳水準(SOTA),並在純文字數學題目上展現出卓越表現
根據公告,這款擁有 270 億參數的開源「孔子4」多模態模型,已將教育場景中基於視覺輸入的數學處理能力提升至業界領先水準(SOTA)。 在規模相近的模型中,Confucius4 特別擅長處理包含圖表的高階視覺數學與物理題目。它在中文純文字數學題目上也展現顯著進步,準確度達 81.4%,位居業界領先地位。

▲ 在同規模模型中,Confucius4 於多項視覺數學基準測試中取得業界最佳成績
圖片來源:https://huggingface.co/netease-youdao/Confucius4
更關鍵的突破在於實務上的成本效益。據相關負責人表示,該新模型採用了精煉的推理鏈重構方案。透過彙整大量高品質且簡潔的推理樣本進行深度優化,將推理鏈的輸出長度壓縮了 43.2%。
這意味著它能以更少的標記數和更短的推理路徑更快地給出答案,大幅降低企業與開發者在實際商業情境中的推理成本。

▲ Confucius4 在多項視覺數學基準測試中顯著減少了輸出標記數
圖片來源:https://huggingface.co/netease-youdao/Confucius4
此外,Confucius4 研究團隊針對中國學生在現實生活中面臨的作業、考試及解題情境,對模型進行了深度優化。這使它能夠應對真實的學習挑戰,成為更具同理心的數位助理。
開源語音合成(TTS):支援 14 種語言,3 秒內即可複製原聲,跨語言無口音問題
除了多模態模型外,語音合成(TTS)引擎也已開源。該引擎基於尖端的「語音編碼器 + 大型語言模型(LLM)」架構,為開發者和內容創作者提供零樣本、低門檻的語音克隆與情緒合成能力。
目前,該引擎全面支援 14 種語言:中文、英文、日文、韓文、德文、法文、西班牙文、印尼文、義大利文、泰文、葡萄牙文、俄文、馬來文及越南文。 該系統無需額外訓練,即可自然地將發言人的聲音轉移至不同語言,在維持聲音一致性的同時,確保合成結果聽起來像母語般流暢,且在跨語言克隆過程中不會滲入口音。
在語音克隆方面,Confucius4 實現了完整的「上傳即克隆」功能。使用者只需提供任何音訊素材,系統便能在三秒內複製原始聲音。 根據公告,該引擎在克隆任務上的準確度超過 97%,克隆聲音與原始聲音的相似度超過 85%。它既能保留發聲者獨特的嗓音特徵,又能精準重現其情感語調,其全面能力在該領域名列前茅。
此外,此開源模型在真實的多語言情境中展現出強大的穩健性,能處理各種合成需求,包括日常對話、新聞播報、企業宣傳以及複雜的情感表達。
翻譯模型品質全面升級,推論速度提升 80%
作為有道根基最深厚的技术资产之一,翻译模型在本次更新中也获得了重大的技术升级,进一步提升了其在翻译任务中的表现。
在數據方面,孔子團隊蒐集並清理了數十億條多語言語料,並聘請具備 TEM-8 認證的專業人員進行多維度人工評審,從源頭確保語料庫的高品質。
在演算法方面,該模型採用創新的「多專家 OPD」模式,透過更聰明的「柔性策略」來發揮各專家之所長。同時,透過強化學習引入格式獎勵與語言偵測機制,有效解決機器翻譯中常見的「脫離語境翻譯」及「混語輸出」等問題。
為滿足高頻率、高並發的工業應用需求,更新後的翻譯模型配備了高效的加速機制,可直接將整體推論速度提升 80%。 結合自動化大型模型評估與隨機人工抽樣這套客製化解決方案,新一代翻譯模型在文字、圖像及文件翻譯等多種情境中,均展現出極高的速度與品質水準。
回顧有道在 AI 領域的發展歷程,從最初推出首個教育專用大模型「孔子」,到推出顛覆傳統口語練習方法的「虛擬口語教練 Hi Echo」,再到將「孔子 2.0」與「孔子 3.0」全面整合至軟硬體生態系統中, 有道始終引領著AI在真實場景中的賦能應用。2026年,有道透過「龍蝦AI」、「有道寶」、「有道會議助手」及「Thinkflow」等一系列AI代理產品,加速推動AI應用,實現了前瞻性的全場景AI代理矩陣。
「孔子4.0」的升級與核心模型的全面開源,不僅大幅降低了開發者在多模態與語音合成領域的門檻,更展現出一種生態閉環——基礎核心技術滋養著上層的智能代理矩陣。 有道期望,在全全球開發者與開源社群的共同貢獻下,這個全模態大模型生態系統將為各行各業帶來真正的生產力轉型。
附錄:開源網址:
「Confucius4」多模態模型:https://huggingface.co/netease-youdao/Confucius4
「Confucius4」語音合成(TTS)模型:https://github.com/netease-youdao/Confucius4-TTS
Vbot VITA Power 完成近 5 億元 Pre-A 輪融資,首批具身智慧產品開啟大規模交付
Vbot微塔動力作為具身智慧領域的先行者,已完成近5億元人民幣的Pre-A輪融資。東方嘉富、華泰紫金和復星銳正領投,上汽資本(上汽集團)及現有股東跟投。此次投資標誌著全球消費級具身智慧領域單筆最大融資事件。5月8日,Vbot推出首款產品“超級狗”並啟動量產交付。首批500臺已發貨,標誌著具身機器人從實驗室走向日常環境。Vbot的機器狗於2025年12月釋出,是全球首款無需遙控的智慧四足機器人。其核心功能——全場景陪伴、自主搬運和AI拍攝——推動了強勁的預售需求。在有限的預售視窗期內,該產品獲得了
百度文音推出 PaddleOCR-VL-1.6,準確度達 96.33%,在文件解析領域創下新的 SOTA 紀錄
百度已正式推出 PaddleOCR-VL-1.6,這是 ERNIE 大型模型的一款專用變體。 在權威的 OmnicDocBench v1.6 評測中,該模型以 96.33% 的準確率脫穎而出,表現優於 Gemini-3-Pro、GPT-5.2 及 GLM-OCR 等領先模型。 此成就樹立了業界新的 SOTA 標竿,並在綜合性能方面位居全球首位,標誌著多模態大型模型在理解複雜文件及分析真實世界情境方
Anthropic 推出面向中小企業的 Claude 技能包
Anthropic 於週三正式推出面向中小企業的 Claude,推出一套專為中小企業(SMB)量身定製的自動化工具套件。該舉措旨在降低技術門檻,使沒有專職 IT 人員的本地企業能夠利用生成式 AI 帶來的生產力提升。AI 行業的競爭焦點正從大型企業和開發者社羣轉向那些驅動經濟卻在 AI 採用方面滯後的 underserved 市場。與業務流程無縫整合該套餐的突出特點是其強大的整合能力。使用者可以在 Anthropic 的自動化平臺中啟用特定技能,以與主流商業軟體無縫連線:財務與支付: 相容 Qui





首頁






