DeepSeek 推出具備多模態理解能力的廣泛影像辨識模式,目前正處於內部測試階段
DeepSeek 已開始對其大規模圖像識別模式進行內部測試,這標誌著這款國產大型模型已全面邁入多模態文字與圖像的時代。 繼四月底進行小規模測試後,該公司於 5 月 9 日大幅擴大「圖像識別模式」的開放範圍,目前多數測試帳號皆可透過聊天介面中的專用入口使用此功能。 儘管仍標示為「內部測試」,但該功能出現在輸入欄上方,與「快速模式」及「專家模式」並列的事實,顯示多模態理解現已成為產品陣容的核心部分。

與基本的 OCR 文字擷取不同,DeepSeek 的最新升級著重於深度影像辨識與語義理解。 在實際測試中,此模式能對視覺資訊進行邏輯分析,讓使用者僅需上傳圖片,即可執行複雜的跨媒體互動。此舉填補了 DeepSeek 在多模態能力上的缺口,並使其與 GPT-4o 等國際頂尖模型的差距大幅縮小。
相關文章
Universal Robots 推出第七代機器人,用於實體人工智慧部署
圖片來源:Universal Robots 產品與產業行銷總監 Will HealyUniversal Robots 產品與產業行銷總監 Will Healy 強調,在 Gen 7 發布之後,人工智慧驅動的機器人必須將技術進步置於複雜性之上。在國際製造技術展(IMTS)上,泰瑞達機器人(Teradyne Robotics)旗下子公司 Universal Robots 正式發表了專為人工智慧時代設計
官方確認,涉及手持掃帚行人的AI生成影象已被撤下
山西臨汾一處公告欄上的公益廣告因畫面怪異而引發公眾關注。行人姿態怪異,掃帚似乎從環衛工人的垃圾袋中伸出。扭曲的細節暗示了人工智慧生成的痕跡,促使當地當局於8月26日派遣人員採取緊急措施。管理委員會的建設部門確認,在25日晚進行了緊急檢查,隨後迅速移除了該問題廣告。側重文字的審查忽視了視覺錯誤8月27日,當地官員確認該廣告由合作廣告公司使用人工智慧工具製作,目前已被下架。工作人員承認,審查過程側重於文字標語,未能核實視覺準確性。目前該區域正在對所有戶外廣告進行全面審計,並計劃立即替換任何類似有
GPT 5.5 領跑 AI 安全競賽,DeepSeek 在成本效益方面位居榜首
Kasra Rahjerdi,一名安全研究人員,最近釋出了一份重要報告,詳細闡述了對主要大型語言模型的安全推理能力進行的實際測試。他透過構建一個故意存在漏洞的書評應用程式實現了這一目標。在該場景中,模擬了現實世界中的漏洞,Rahjerdi 在應用程式檔案中嵌入了 Google 移動後端服務的憑據。這些模型的任務是解壓並識別這些憑據,從而直接訪問資料庫。頂級模型對比在嚴格的兩小時時間限制和 10 美元預算約束下,各模型的表現水平各不相同。GPT-5.5 成為表現最強的模型,成功完成了 10 次嘗試
相關專題推薦
評論 (0)
0/500
DeepSeek 已開始對其大規模圖像識別模式進行內部測試,這標誌著這款國產大型模型已全面邁入多模態文字與圖像的時代。 繼四月底進行小規模測試後,該公司於 5 月 9 日大幅擴大「圖像識別模式」的開放範圍,目前多數測試帳號皆可透過聊天介面中的專用入口使用此功能。 儘管仍標示為「內部測試」,但該功能出現在輸入欄上方,與「快速模式」及「專家模式」並列的事實,顯示多模態理解現已成為產品陣容的核心部分。

與基本的 OCR 文字擷取不同,DeepSeek 的最新升級著重於深度影像辨識與語義理解。 在實際測試中,此模式能對視覺資訊進行邏輯分析,讓使用者僅需上傳圖片,即可執行複雜的跨媒體互動。此舉填補了 DeepSeek 在多模態能力上的缺口,並使其與 GPT-4o 等國際頂尖模型的差距大幅縮小。
Universal Robots 推出第七代機器人,用於實體人工智慧部署
圖片來源:Universal Robots 產品與產業行銷總監 Will HealyUniversal Robots 產品與產業行銷總監 Will Healy 強調,在 Gen 7 發布之後,人工智慧驅動的機器人必須將技術進步置於複雜性之上。在國際製造技術展(IMTS)上,泰瑞達機器人(Teradyne Robotics)旗下子公司 Universal Robots 正式發表了專為人工智慧時代設計
官方確認,涉及手持掃帚行人的AI生成影象已被撤下
山西臨汾一處公告欄上的公益廣告因畫面怪異而引發公眾關注。行人姿態怪異,掃帚似乎從環衛工人的垃圾袋中伸出。扭曲的細節暗示了人工智慧生成的痕跡,促使當地當局於8月26日派遣人員採取緊急措施。管理委員會的建設部門確認,在25日晚進行了緊急檢查,隨後迅速移除了該問題廣告。側重文字的審查忽視了視覺錯誤8月27日,當地官員確認該廣告由合作廣告公司使用人工智慧工具製作,目前已被下架。工作人員承認,審查過程側重於文字標語,未能核實視覺準確性。目前該區域正在對所有戶外廣告進行全面審計,並計劃立即替換任何類似有
GPT 5.5 領跑 AI 安全競賽,DeepSeek 在成本效益方面位居榜首
Kasra Rahjerdi,一名安全研究人員,最近釋出了一份重要報告,詳細闡述了對主要大型語言模型的安全推理能力進行的實際測試。他透過構建一個故意存在漏洞的書評應用程式實現了這一目標。在該場景中,模擬了現實世界中的漏洞,Rahjerdi 在應用程式檔案中嵌入了 Google 移動後端服務的憑據。這些模型的任務是解壓並識別這些憑據,從而直接訪問資料庫。頂級模型對比在嚴格的兩小時時間限制和 10 美元預算約束下,各模型的表現水平各不相同。GPT-5.5 成為表現最強的模型,成功完成了 10 次嘗試





首頁






