选项
首页
新闻
GPT-5.5 效率居首,DeepSeek V4 Pro 荣膺性价比冠军;大语言模型(LLM)实际应用安全报告发布

GPT-5.5 效率居首,DeepSeek V4 Pro 荣膺性价比冠军;大语言模型(LLM)实际应用安全报告发布

2026-06-22
100

大型语言模型(LLM)的智能究竟能延伸到何种程度?网络安全领域已演变为一场角斗场,这些模型的真实推理能力和复杂逻辑正是在此接受考验。安全研究员卡斯拉·拉赫杰迪(Kasra Rahjerdi)最近发布了一份测试报告,引起了整个行业的关注。 他通过构建一个刻意植入核心漏洞的电子书评论APK,对主流LLM模拟了现实世界中的黑客攻击挑战,从而揭示了各模型在安全推理和漏洞利用方面的实际能力。

在这场耗时两小时、预算仅10美元的网络战测试中,研究人员故意将谷歌移动后端服务Firebase的凭证暴露在应用程序包(APK)内。 每个模型都必须像一名专业的白帽黑客一样行动:首先解包应用程序,迅速发现凭证,然后绕过已经经过加固的API,从而获得对底层数据库的未经授权访问。整个测试耗资1,500美元,多家顶级模型的测试结果呈现出极端两极分化的态势。

image.png

在突破率方面,尚未发布的GPT-5.5展现出了压倒性的安全推理能力。在十次独立测试中,它成功实施了七次攻击,成功率达70%,位居榜首。 评估显示,在解包APK后,GPT-5.5立即识别出Firebase是关键突破点,并未被复杂的用户界面或标准API所干扰。然而,这一卓越表现付出了高昂代价:每次成功利用的平均成本高达9.46美元,几乎触及预算上限。

另一方面,自主研发的 DeepSeek V4Pro 以其惊人的成本效益震惊了开源社区。尽管在十次测试中仅成功三次,但每次成功尝试的平均令牌成本仅为 0.62 美元——仅为 GPT-5.5 的十五分之一。 在失败的测试轮次中,DeepSeek V4Pro 仍成功五次访问了 Firebase 核心,但在使用凭据配置后端接口时偶尔会出现错误。研究人员强调,对于在网络安全自动化审计中执行大规模、高频批处理操作的工程团队而言,DeepSeek 惊人的成本优势具有重要的实际价值。

虽然有些模型表现令人印象深刻,但另一些模型则因过于保守而未能达标。在中端水平中,Claude Sonnet4.6和Claude Opus4.8各取得两次成功。尽管Opus功能强大,但由于安全屏障过于严格,它经常中断会话,尽管它曾多次接近正确答案。 与此同时,谷歌的 Gemini3.1Pro Preview 则走向了另一个极端:它从一开始就触发了安全过滤器,每次都拒绝继续进行。其令牌使用量中位数仅约 9,000——远低于其他模型消耗的数万令牌——且最终产出了空白结果。

这场安全对决不仅是对大型模型终极推理能力的考验,也预示着自动化网络安全审计的未来。随着大型模型在垂直领域进行智能重构,未来的安全防御与漏洞发现可能会演变为数字AI大军的交锋,在计算能力和模型策略上展开竞争。

相关文章
GPT 5.5 领跑 AI 安全竞赛,DeepSeek 在成本效益方面位居榜首 GPT 5.5 领跑 AI 安全竞赛,DeepSeek 在成本效益方面位居榜首 Kasra Rahjerdi,一名安全研究人员,最近发布了一份重要报告,详细阐述了对主要大型语言模型的安全推理能力进行的实际测试。他通过构建一个故意存在漏洞的书评应用程序实现了这一目标。在该场景中,模拟了现实世界中的漏洞,Rahjerdi 在应用程序文件中嵌入了 Google 移动后端服务的凭据。这些模型的任务是解压并识别这些凭据,从而直接访问数据库。顶级模型对比在严格的两小时时间限制和 10 美元预算约束下,各模型的表现水平各不相同。GPT-5.5 成为表现最强的模型,成功完成了 10 次尝试
马斯克称,SpaceX的人工智能可能在半年内超越Anthropic 马斯克称,SpaceX的人工智能可能在半年内超越Anthropic SpaceXAI首席执行官埃隆·马斯克预测,公司将在六个月内主导人工智能领域,并借助计算硬件来缩小与竞争对手的差距。SpaceXAI首席执行官埃隆·马斯克近日在X平台上表示,其公司计划在约六个月内引领前沿人工智能领域。马斯克表达了谨慎乐观的态度,暗示SpaceXAI有望在两到三个月内达到Anthropic的Fable或OpenAI的GPT-6的水平。SpaceXAI目前提供17种模型,每种模型在智
WeRide 发布 WITT——一款物理人工智能大模型 WeRide 发布 WITT——一款物理人工智能大模型 自动驾驶技术正以惊人的速度发展。7月17日,领先的自动驾驶公司威瑞德(WeRide)发布了其自主研发的物理AI认知基础模型——WeRide WITT。此次发布标志着AI在理解和处理复杂的现实世界数据能力方面迈出了重要一步。WeRide WITT的核心理念是“最小物理事实单元”。 该框架旨在帮助人工智能解读视频、图像和文本等多模态输入,将动态的现实世界场景分解为核心事实要素。通过识别和验证这些单元,
相关专题推荐
搜索引擎优化 用于 Google、AI 摘要和答案引擎可见性的 AI 排名追踪工具
用于 Google、AI 摘要和答案引擎可见性的 AI 排名追踪工具

2026 年最新、最佳、高评分的 AI 排名追踪工具,适用于 Google、AI 摘要和答案引擎可见性,现已在 XIX.AI 上线。本精选列表包含经过严格真实世界测试的强大工具,可提供准确的排名数据。获取免费与付费版的对比,查看顶级表现者,并发现必须尝试的选项,以提升您在搜索引擎中的内容可见性。立即探索,找到最适合您需求的工具。

10 个工具
xix.ai
生产率 最佳用于笔记和任务的 AI 第二大脑整理工具
最佳用于笔记和任务的 AI 第二大脑整理工具

2026 年最新最佳顶级评分 AI 第二大脑笔记与任务整理工具!XIX.AI 精心策划了一套极具影响力、颠覆性的精选合集,包含每周更新的排行榜、免费与付费版对比以及真实场景测试,助你找到能大幅提升效率的完美工具。立即探索,释放你的 AI 优势!

11 个工具
xix.ai
提示词 用于 ChatGPT 和 Claude 工作流的 AI 提示测试平台
用于 ChatGPT 和 Claude 工作流的 AI 提示测试平台

2026 年最新最佳顶级评分 AI 提示测试平台,适用于 ChatGPT 和 Claude 工作流!XIX.AI 精心策划了一个强大的变革性合集,包含每周更新的排名、免费与付费对比、真实世界测试以及详细的功能分解,帮助您识别那些能够提升生产力并交付完美输出的必试工具。立即探索,发现您的完美解决方案,释放您的 AI 优势。(249 个字符)

9 个工具
xix.ai
营销 适用于 SaaS A/B 测试、定价页面和演示转化率的 AI 着陆页文案工具
适用于 SaaS A/B 测试、定价页面和演示转化率的 AI 着陆页文案工具

2026年最新最优的AI着陆页文案工具,适用于SaaS A/B测试、定价页面和演示转化,尽在XIX.AI。这份精心挑选的顶级工具清单提供了强大的、能改变游戏规则的解决方案,可提升内容质量、提高写作效率并增强整体生产力。 我们通过实际测试,提供免费版与付费版的对比分析,并每周更新排行榜。这些必试工具将助您突破内容创作瓶颈。立即探索,找到最适合您的工具,释放您的AI优势!

8 个工具
xix.ai
金融 Excel AI 预算预测工具,用于现金流规划和费用控制
Excel AI 预算预测工具,用于现金流规划和费用控制

2026 年最新最佳 Excel AI 工具,用于现金流规划和费用控制,现已收录于 XIX.AI 的顶级精选榜单。这些强大的变革性解决方案通过实际测试和严格排名,帮助您显著提升生产力。获取免费与付费版的对比,找到最适合您需求的产品。立即探索,解锁您在财务管理中的 AI 优势。

9 个工具
xix.ai
提示词 团队使用的AI提示词管理工具
团队使用的AI提示词管理工具

2026 年最新最佳顶级评分 AI 提示词管理工具由 XIX.AI 精心策划,专为团队打造。本指南每周更新,收录了经实际测试和详细排名验证的、能显著提升团队生产力的强大变革性解决方案。获取免费与付费版的对比,助您选择最合适的工具。立即探索,解锁您的 AI 优势。

9 个工具
xix.ai
评论 (1)
0/500
GregoryJones
GregoryJones 2026-10-05 22:00:10

GPT-5.5のパフォーマンスとDeepSeekのコスパ競争、そして実際のセキュリティレポート。LLMの推論能力が本当にどの程度か試される場ですね。サイバーセキュリティの格闘技場のような状況、興味深いです。

OR