選項
首頁
新聞
GPT-5.5 效率居冠,DeepSeek V4 Pro 榮獲性價比冠軍;實務應用大型語言模型(LLM)安全報告發布

GPT-5.5 效率居冠,DeepSeek V4 Pro 榮獲性價比冠軍;實務應用大型語言模型(LLM)安全報告發布

2026-06-22
100

大型語言模型(LLMs)的智慧究竟能延伸到何種程度?網路安全已演變成一座角鬥場,其真正的推理能力與複雜邏輯皆在此接受考驗。資安研究員卡斯拉·拉赫傑迪(Kasra Rahjerdi)近期發表了一份測試報告,引發了業界的廣泛關注。 他透過構建一個刻意植入核心漏洞的電子書評論 APK,對領先的大型語言模型進行了模擬真實世界駭客攻擊的挑戰,藉此揭露各模型在安全推理與漏洞利用方面的實際能力。

在這場耗時兩小時、預算僅 10 美元的網路戰測試中,該研究員刻意將 Google 的行動後端服務 Firebase 憑證暴露在應用程式套件(APK)內。 每個模型都必須像專業的白帽駭客一樣行事:首先解壓縮應用程式,迅速找出憑證,然後繞過已經經過強化防護的 API,以未經授權的方式存取底層資料庫。整項測試耗資 1,500 美元,而多款頂級模型的測試結果呈現極度兩極化的現象。

image.png

就突破率而言,尚未公開的 GPT-5.5 展現了壓倒性的安全推理能力。在十次獨立測試中,它成功執行了七次攻擊,達成 70% 的成功率,位居榜首。 根據評估報告,GPT-5.5 在解壓縮 APK 後,立即將 Firebase 識別為關鍵突破點,並未因複雜的用戶介面或標準 API 而偏離正軌。然而,這項卓越表現的代價高昂:每次成功攻擊的平均成本達 9.46 美元,幾乎觸及預算上限。

另一方面,自主研發的 DeepSeek V4Pro 則以其驚人的成本效益震撼了開源社群。儘管在十項測試中僅成功三次,但每次成功嘗試的平均代幣成本僅為 0.62 美元——僅為 GPT-5.5 的十五分之一。 在失敗的測試輪次中,DeepSeek V4Pro 仍成功五次存取 Firebase 核心,但在使用憑證進行後端介面配置時偶爾會出現錯誤。研究人員強調,對於在網路安全自動化稽核中執行大規模、高頻率批次操作的工程團隊而言,DeepSeek 驚人的成本優勢具有重大的實務價值。

雖然有些模型表現令人印象深刻,但其他模型則因過於保守而未能達標。在中階組別中,Claude Sonnet4.6 和 Claude Opus4.8 各取得兩次成功。儘管 Opus 功能強大,但由於安全屏障過於嚴格,即使多次接近正確答案,仍經常中斷連線。 與此同時,Google 的 Gemini3.1Pro Preview 則走向了另一個極端:它從一開始就觸發了安全過濾機制,每次都拒絕繼續進行。其令牌使用量的中位數僅約 9,000——遠低於其他模型消耗的數萬個令牌——且產出的結果為空白。

這場安全對決不僅是對大型模型終極推理能力的考驗,更預示了自動化網路安全稽核的未來。隨著大型模型在垂直領域進行智慧重構,未來的安全防禦與漏洞發現,可能會演變為數位 AI 軍隊之間的對決,在運算能力與模型策略上展開競爭。

相關文章
GPT 5.5 領跑 AI 安全競賽,DeepSeek 在成本效益方面位居榜首 GPT 5.5 領跑 AI 安全競賽,DeepSeek 在成本效益方面位居榜首 Kasra Rahjerdi,一名安全研究人員,最近釋出了一份重要報告,詳細闡述了對主要大型語言模型的安全推理能力進行的實際測試。他透過構建一個故意存在漏洞的書評應用程式實現了這一目標。在該場景中,模擬了現實世界中的漏洞,Rahjerdi 在應用程式檔案中嵌入了 Google 移動後端服務的憑據。這些模型的任務是解壓並識別這些憑據,從而直接訪問資料庫。頂級模型對比在嚴格的兩小時時間限制和 10 美元預算約束下,各模型的表現水平各不相同。GPT-5.5 成為表現最強的模型,成功完成了 10 次嘗試
馬斯克表示,SpaceX 的人工智慧可能在半年內超越 Anthropic 馬斯克表示,SpaceX 的人工智慧可能在半年內超越 Anthropic SpaceXAI 執行長伊隆·馬斯克預測,該公司將在六個月內在人工智慧領域取得主導地位,並將利用運算硬體來縮小與競爭對手的差距。SpaceXAI 執行長伊隆·馬斯克近日在 X 平台上表示,他的公司目標是在約六個月內引領前沿人工智慧領域。馬斯克表達了謹慎樂觀的態度,並暗示 SpaceXAI 可能在兩到三個月內達到與 Anthropic 的 Fable 或 OpenAI 的 GPT-6 相當的水準。S
WeRide 推出 WITT,一款實體 AI 大型模型 WeRide 推出 WITT,一款實體 AI 大型模型 自動駕駛技術正以驚人的速度發展。7月17日,領先的自動駕駛公司 WeRide 正式發表了其自主研發的物理人工智慧認知基礎模型「WeRide WITT」。此次發布標誌著人工智慧在理解與處理複雜的真實世界資料能力方面,邁出了重要的一步。WeRide WITT 的核心概念在於「最小物理事實單位」。 該框架旨在協助人工智慧解讀多模態輸入(例如影片、圖像和文字),將動態的真實世界情境分解為核心事實元素。透過
相關專題推薦
生產率 最佳用於筆記和任務的 AI 第二大腦整理工具
最佳用於筆記和任務的 AI 第二大腦整理工具

2026 年最新最佳頂級評分 AI 第二大腦筆記與任務整理工具!XIX.AI 精心策劃了一套極具影響力、顛覆性的精選合集,包含每週更新的排行榜、免費與付費版對比以及真實場景測試,助你找到能大幅提升效率的完美工具。立即探索,釋放你的 AI 優勢!

11 個工具
xix.ai
迅速的 用於 ChatGPT 和 Claude 工作流的 AI 提示測試平臺
用於 ChatGPT 和 Claude 工作流的 AI 提示測試平臺

2026 年最新最佳頂級評分 AI 提示測試平臺,適用於 ChatGPT 和 Claude 工作流!XIX.AI 精心策劃了一個強大的變革性合集,包含每週更新的排名、免費與付費對比、真實世界測試以及詳細的功能分解,幫助您識別那些能夠提升生產力並交付完美輸出的必試工具。立即探索,發現您的完美解決方案,釋放您的 AI 優勢。(249 個字元)

9 個工具
xix.ai
行銷 適用於 SaaS A/B 測試、定價頁面及試用版轉化率的 AI 著陸頁文案工具
適用於 SaaS A/B 測試、定價頁面及試用版轉化率的 AI 著陸頁文案工具

2026 年最新最佳 AI 著陸頁文案工具,適用於 SaaS A/B 測試、定價頁面及示範轉換,現已登陸 XIX.AI。這份精心挑選的頂級工具清單,提供強大且顛覆性的解決方案,能提升內容品質、提高撰寫效率,並增強整體生產力。 我們進行實際測試,並提供免費版與付費版的比較分析,以及每週更新的排行榜。這些必試選項將協助您突破創作瓶頸。立即探索,找出最適合您的工具,並釋放您的 AI 優勢!

8 個工具
xix.ai
金融 Excel AI 預算預測工具,用於現金流規劃和費用控制
Excel AI 預算預測工具,用於現金流規劃和費用控制

2026 年最新最佳 Excel AI 工具,用於現金流規劃和費用控制,現已收錄於 XIX.AI 的頂級精選榜單。這些強大的變革性解決方案透過實際測試和嚴格排名,幫助您顯著提升生產力。獲取免費與付費版的對比,找到最適合您需求的產品。立即探索,解鎖您在財務管理中的 AI 優勢。

9 個工具
xix.ai
迅速的 團隊使用的AI提示詞管理工具
團隊使用的AI提示詞管理工具

2026 年最新最佳頂級評分 AI 提示詞管理工具由 XIX.AI 精心策劃,專為團隊打造。本指南每週更新,收錄了經實際測試和詳細排名驗證的、能顯著提升團隊生產力的強大變革性解決方案。獲取免費與付費版的對比,助您選擇最合適的工具。立即探索,解鎖您的 AI 優勢。

9 個工具
xix.ai
音樂創作 用於音樂創作的 AI 歌詞構思工具
用於音樂創作的 AI 歌詞構思工具

2026 年最新、最受好評的 AI 歌詞構思工具,盡在 XIX.AI!這份精心挑選的清單收錄了多款強大且具革命性的工具,這些工具均經過實際測試,能快速提供高品質的歌詞構思,協助使用者激發創意並簡化音樂創作流程。 您還可獲取免費版與付費版的比較概覽。立即探索,發掘最適合您的工具!

16 個工具
xix.ai
評論 (1)
0/500
GregoryJones
GregoryJones 2026-10-05 22:00:10

GPT-5.5のパフォーマンスとDeepSeekのコスパ競争、そして実際のセキュリティレポート。LLMの推論能力が本当にどの程度か試される場ですね。サイバーセキュリティの格闘技場のような状況、興味深いです。

OR