阿里巴巴推出「Qwen-UI-Agent」,一款適用於真實世界的多模態基礎模型
阿里巴巴正式推出「Qwen-UI-Agent」,這是一款專為在真實世界環境中運作而設計的 GUI 代理基礎模型。該模型涵蓋行動裝置、桌面電腦、網頁及深度搜尋環境,不僅超越傳統的模擬測試,更能跨複雜實體裝置無縫運作。

超越業界領先者的表現
Qwen-UI-Agent 在權威性基準測試與實際環境中均展現出卓越能力:
行動裝置表現:在 MobileWorld 評測中取得 82.1% 的亮眼成績,表現優於多款國際主流旗艦模型。 在其涵蓋超過 100 台實際裝置的自訂基準測試 MobileWorld-Real 中,成功率達 92.2%,並在 Android 日常任務中取得近乎完美的結果。桌面效能:在 OSWorld-Verified 測試中獲得 79.5% 的得分,相較於基準模型,該模型在多項任務中顯著減少了執行步驟。網頁與通用能力:在 WebArena 網頁測試中,該模型於所有對比模型中名列第一。其通用能力與代理能力均超越基礎訓練模型,使其能輕鬆處理長尾請求。彌合模擬與現實之間的鴻溝
為彌合模擬與實際應用之間的鴻溝,Qwen-UI-Agent 採用了一個包含超過 100 部實體手機及 150 多個應用程式的即時行動裝置環境。此架構支援任務建立、軌跡蒐集及模型訓練。 研究團隊還推出了 MobileWorld-Real,這是一套包含超過 400 項任務的實機基準測試,可根據實際裝置效能進行精確的模型選型。

簡化指令與強健安全性
除了標準的圖形使用者介面(GUI)操作外,該模型還能直接執行命令列指令。透過在單次決策中輸出批次動作,它能縮短執行路徑並提升效率。 整個流程中整合了全面的安全機制:該模型會拒絕並終止涉及非法或高風險請求的任務。對於支付、資料刪除或隱私授權等敏感操作,系統會在關鍵步驟暫停,等待使用者確認。
此外,該模型支援超過 100 步的軌跡線上強化學習。結合自適應課程學習,它能持續提升處理具挑戰性長期任務的能力。
專案首頁:https://tongyi-mai.github.io/Qwen-UI-Agent/
相關文章
DeepSeek 釋出 V4 預覽版,使百萬級長上下文對所有人開放
DeepSeek 已正式推出並開源其最新模型系列的預覽版 DeepSeek-V4。透過結構創新,該系列實現了標準化的 1M(一百萬 token)超長上下文處理,並在 Agent 協作、世界知識和邏輯推理方面領先於國內及開源模型。雙版本佈局:Pro 追求卓越,Flash 追求效率DeepSeek-V4 提供兩種規格,以滿足不同的應用需求:DeepSeek-V4-Pro(1.6T 引數,啟用 49B): 效能媲美頂級閉源模型。在 Agentic Coding 評估中取得最佳開源結果,輸出質量接近
Chrome 和 Edge 悄然將本地 AI 模型儲存需求提升至 20GB,隨著瀏覽器演變為 AI 推理引擎
Google Chrome 和 Microsoft Edge 已將本地 AI 模型的磁碟空間要求提高至 20GB。這些瀏覽器在後臺靜默下載模型,以啟用裝置端 AI 功能。今年 5 月,人們發現 Chrome 會自動下載約 4GB 的 AI 模型,以便在本地執行功能,而不是將所有資料傳送到 Google 的伺服器。此後,Google 悄悄更新了其官方幫助文件,將所需的空閒磁碟空間從 4GB 增加到約 20GB。雖然這個數字代表的是下載前提條件,但實際模型使用量可能會更低。Edge 的要求在很大程
智譜AI在5個月內實現15倍增長後,以程式設計為重點,目標年收入達10億美元
多個獨立訊息源證實,智譜的年度經常性收入(ARR)在2026年7月已達到10億美元。該公司尚未對這些報道發表評論。AI程式設計和影片生成已成為生成式AI增長最快的商業領域。在國際市場上,Anthropic的Claude Code在釋出僅六個月後便實現了10億美元的ARR,從而推高了其估值。智譜ARR的快速增長表明,國內大模型公司正在成功探索新的變現策略。據報道,智譜的ARR在短短五個月內從10億美元飆升至100億美元,而Anthropic實現這一里程碑則耗時15個月。內部人士指出,智譜在2026年1
相關專題推薦
評論 (0)
0/500
阿里巴巴正式推出「Qwen-UI-Agent」,這是一款專為在真實世界環境中運作而設計的 GUI 代理基礎模型。該模型涵蓋行動裝置、桌面電腦、網頁及深度搜尋環境,不僅超越傳統的模擬測試,更能跨複雜實體裝置無縫運作。

超越業界領先者的表現
Qwen-UI-Agent 在權威性基準測試與實際環境中均展現出卓越能力:
行動裝置表現:在 MobileWorld 評測中取得 82.1% 的亮眼成績,表現優於多款國際主流旗艦模型。 在其涵蓋超過 100 台實際裝置的自訂基準測試 MobileWorld-Real 中,成功率達 92.2%,並在 Android 日常任務中取得近乎完美的結果。桌面效能:在 OSWorld-Verified 測試中獲得 79.5% 的得分,相較於基準模型,該模型在多項任務中顯著減少了執行步驟。網頁與通用能力:在 WebArena 網頁測試中,該模型於所有對比模型中名列第一。其通用能力與代理能力均超越基礎訓練模型,使其能輕鬆處理長尾請求。彌合模擬與現實之間的鴻溝
為彌合模擬與實際應用之間的鴻溝,Qwen-UI-Agent 採用了一個包含超過 100 部實體手機及 150 多個應用程式的即時行動裝置環境。此架構支援任務建立、軌跡蒐集及模型訓練。 研究團隊還推出了 MobileWorld-Real,這是一套包含超過 400 項任務的實機基準測試,可根據實際裝置效能進行精確的模型選型。

簡化指令與強健安全性
除了標準的圖形使用者介面(GUI)操作外,該模型還能直接執行命令列指令。透過在單次決策中輸出批次動作,它能縮短執行路徑並提升效率。 整個流程中整合了全面的安全機制:該模型會拒絕並終止涉及非法或高風險請求的任務。對於支付、資料刪除或隱私授權等敏感操作,系統會在關鍵步驟暫停,等待使用者確認。
此外,該模型支援超過 100 步的軌跡線上強化學習。結合自適應課程學習,它能持續提升處理具挑戰性長期任務的能力。
專案首頁:https://tongyi-mai.github.io/Qwen-UI-Agent/
DeepSeek 釋出 V4 預覽版,使百萬級長上下文對所有人開放
DeepSeek 已正式推出並開源其最新模型系列的預覽版 DeepSeek-V4。透過結構創新,該系列實現了標準化的 1M(一百萬 token)超長上下文處理,並在 Agent 協作、世界知識和邏輯推理方面領先於國內及開源模型。雙版本佈局:Pro 追求卓越,Flash 追求效率DeepSeek-V4 提供兩種規格,以滿足不同的應用需求:DeepSeek-V4-Pro(1.6T 引數,啟用 49B): 效能媲美頂級閉源模型。在 Agentic Coding 評估中取得最佳開源結果,輸出質量接近
Chrome 和 Edge 悄然將本地 AI 模型儲存需求提升至 20GB,隨著瀏覽器演變為 AI 推理引擎
Google Chrome 和 Microsoft Edge 已將本地 AI 模型的磁碟空間要求提高至 20GB。這些瀏覽器在後臺靜默下載模型,以啟用裝置端 AI 功能。今年 5 月,人們發現 Chrome 會自動下載約 4GB 的 AI 模型,以便在本地執行功能,而不是將所有資料傳送到 Google 的伺服器。此後,Google 悄悄更新了其官方幫助文件,將所需的空閒磁碟空間從 4GB 增加到約 20GB。雖然這個數字代表的是下載前提條件,但實際模型使用量可能會更低。Edge 的要求在很大程
智譜AI在5個月內實現15倍增長後,以程式設計為重點,目標年收入達10億美元
多個獨立訊息源證實,智譜的年度經常性收入(ARR)在2026年7月已達到10億美元。該公司尚未對這些報道發表評論。AI程式設計和影片生成已成為生成式AI增長最快的商業領域。在國際市場上,Anthropic的Claude Code在釋出僅六個月後便實現了10億美元的ARR,從而推高了其估值。智譜ARR的快速增長表明,國內大模型公司正在成功探索新的變現策略。據報道,智譜的ARR在短短五個月內從10億美元飆升至100億美元,而Anthropic實現這一里程碑則耗時15個月。內部人士指出,智譜在2026年1





首頁






