DeepSeek的AI模型很容易越狱,揭示了严重的缺陷
DeepSeek AI引发安全担忧,尽管性能备受热议
随着对中国初创公司DeepSeek性能的热议持续升温,安全问题也随之增加。周四,来自Palo Alto Networks的网络安全团队Unit 42发布报告,详细描述了他们对DeepSeek V3和R1模型精简版使用的三种越狱方法。报告显示,这些方法无需专业知识即可实现高绕过率。
“我们的研究发现,这些越狱方法可以诱导明确的恶意活动指导,”报告指出。这些活动包括创建键盘记录器、数据窃取技术,甚至制造燃烧装置的说明,凸显了此类攻击带来的真实安全风险。
研究人员成功诱导DeepSeek提供窃取和传输敏感数据的指导,绕过安全措施,制作令人信服的鱼叉式网络钓鱼邮件,执行复杂的社会工程攻击,以及构建莫洛托夫鸡尾酒。他们还成功操控模型生成恶意软件。
“尽管网上已公开可获取制造莫洛托夫鸡尾酒和键盘记录器的信息,但安全限制不足的大型语言模型可能会降低恶意行为者的准入门槛,通过编译和呈现易于使用且可操作的输出,”报告补充道。
周五,Cisco发布针对DeepSeek R1的越狱报告。使用50个HarmBench提示,研究人员发现DeepSeek的攻击成功率达100%,未能阻止任何有害提示。DeepSeek与其他顶级模型的抗攻击率比较如下所示。

Cisco “我们必须了解DeepSeek及其新推理范式在安全性和保障方面是否存在重大权衡,”报告指出。
同在周五,安全提供商Wallarm发布报告,声称不仅诱导DeepSeek生成有害内容,还进一步深入。测试V3和R1后,Wallarm揭示了DeepSeek的系统提示,概述了模型的行为和限制。
Wallarm表示,这些发现表明“模型安全框架中存在潜在漏洞”。
OpenAI指控DeepSeek使用其专有模型训练V3和R1,违反其服务条款。Wallarm的报告称已诱导DeepSeek提及OpenAI在其训练谱系中,暗示“OpenAI的技术可能在塑造DeepSeek知识库中发挥了作用”。

Wallarm与DeepSeek的对话,提及OpenAI。Wallarm “在DeepSeek案例中,越狱后最引人注目的发现之一是能够提取用于训练和精简的模型细节。通常,此类内部信息受到保护,防止用户了解用于优化性能的专有或外部数据集,”报告解释道。
“通过绕过标准限制,越狱暴露了AI提供商对其系统保持多少监督,不仅揭示了安全漏洞,还可能揭示AI训练管道中跨模型影响的证据,”报告继续说道。
Wallarm用于诱导此响应的提示在报告中被编辑,以避免危害其他易受攻击的模型,研究人员通过电子邮件向ZDNET表示。他们强调,此越狱响应并未证实OpenAI关于DeepSeek精简模型的怀疑。
正如404 Media和其他媒体所指出的,鉴于围绕OpenAI自身公共数据盗窃的讨论,其担忧有些讽刺。
Wallarm已通知DeepSeek该漏洞,公司随后修补了该问题。然而,仅在DeepSeek数据库被发现未受保护且可在网上访问(并在通知后迅速下线)几天后,这些发现表明DeepSeek在发布前未彻底测试的模型中可能存在重大安全漏洞。值得注意的是,研究人员也经常能够越狱来自更成熟AI巨头的流行美国模型,包括ChatGPT。
相关文章
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。
Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额
尽管近期有报道称OpenAI未达营收目标,给本周二的科技股带来压力,但私营人工智能实验室的投资者仍表现坚韧。经验丰富的投资者已确认,尽管媒体报道负面,他们仍不会减少投资。分析师认为当前的人工智能竞赛仍处于早期阶段,因此不会出现“赢家通吃”的局面。尽管高昂的计算成本给营收带来压力,但实验室可通过提高订阅费来提升盈利能力。行业格局正发生微妙变化与OpenAI不同,其竞争对手Anthropic获得了强有
加利福尼亚州自动驾驶合规:罚单、地理围栏和100万英里的新时代
Guident公司在南佛罗里达州运营一辆AuveTech自动驾驶班车,利用其远程监控技术管理西棕榈滩的一条4英里路线和博卡拉顿的一条1英里路线。| 图片来源:Guident加利福尼亚州正在重新定义无人驾驶车辆的监管格局,正逐渐摆脱科技行业“快速行动,打破常规”的思维模式,转向严格的问责制和严苛的行驶里程要求。Guident执行董事长兼首席执行官哈罗德·布劳恩(Harold Braun)在《机器人报
相关专题推荐
评论 (12)
0/500
看到這篇報導真的嚇一跳,原來AI這麼容易被破解嗎?🤔 雖然DeepSeek的表現很亮眼,但安全漏洞這麼明顯的話,企業敢用嗎?我自己試用時完全沒想過這些問題,現在有點擔心個人資料會不會外洩... 希望開發團隊能快點修補這些漏洞,不然再強的AI也沒人敢放心使用吧!
¿Y ahora qué? Primero prometen un modelo súper inteligente y luego resulta fácil de hackear así. No entiendo por qué siguen lanzando AI con tanta prisa si los fallos de seguridad son tan básicos 😒. Al final los usuarios pagamos los platos rotos. ¿Nadie piensa en las consecuencias?
이런 취약점이 쉽게 발견되는 게 좀 놀랐어요. 보안 연구는 항상 AI 발전 속도보다 뒤처지는 느낌이에요 😅 유료 고성능 모델도 이렇게 뚫리면 무료 서비스는 어떻게 될까 약간 걱정되네요. 중국 AI 스타트업의 급성장은 인상적이지만, 이런 기본적인 안정성 문제가 해결되지 않으면 장기적으로 신뢰를 잃을 수 있을 것 같아요.
Que preocupante que modelos tan avanzados sean tan fáciles de manipular 😕 ¿Realmente están listos para el uso masivo si fallan en lo básico? Esto me hace dudar de toda la publicidad sobre sus capacidades...
DeepSeek AI引发安全担忧,尽管性能备受热议
随着对中国初创公司DeepSeek性能的热议持续升温,安全问题也随之增加。周四,来自Palo Alto Networks的网络安全团队Unit 42发布报告,详细描述了他们对DeepSeek V3和R1模型精简版使用的三种越狱方法。报告显示,这些方法无需专业知识即可实现高绕过率。
“我们的研究发现,这些越狱方法可以诱导明确的恶意活动指导,”报告指出。这些活动包括创建键盘记录器、数据窃取技术,甚至制造燃烧装置的说明,凸显了此类攻击带来的真实安全风险。
研究人员成功诱导DeepSeek提供窃取和传输敏感数据的指导,绕过安全措施,制作令人信服的鱼叉式网络钓鱼邮件,执行复杂的社会工程攻击,以及构建莫洛托夫鸡尾酒。他们还成功操控模型生成恶意软件。
“尽管网上已公开可获取制造莫洛托夫鸡尾酒和键盘记录器的信息,但安全限制不足的大型语言模型可能会降低恶意行为者的准入门槛,通过编译和呈现易于使用且可操作的输出,”报告补充道。
周五,Cisco发布针对DeepSeek R1的越狱报告。使用50个HarmBench提示,研究人员发现DeepSeek的攻击成功率达100%,未能阻止任何有害提示。DeepSeek与其他顶级模型的抗攻击率比较如下所示。
“我们必须了解DeepSeek及其新推理范式在安全性和保障方面是否存在重大权衡,”报告指出。
同在周五,安全提供商Wallarm发布报告,声称不仅诱导DeepSeek生成有害内容,还进一步深入。测试V3和R1后,Wallarm揭示了DeepSeek的系统提示,概述了模型的行为和限制。
Wallarm表示,这些发现表明“模型安全框架中存在潜在漏洞”。
OpenAI指控DeepSeek使用其专有模型训练V3和R1,违反其服务条款。Wallarm的报告称已诱导DeepSeek提及OpenAI在其训练谱系中,暗示“OpenAI的技术可能在塑造DeepSeek知识库中发挥了作用”。
“在DeepSeek案例中,越狱后最引人注目的发现之一是能够提取用于训练和精简的模型细节。通常,此类内部信息受到保护,防止用户了解用于优化性能的专有或外部数据集,”报告解释道。
“通过绕过标准限制,越狱暴露了AI提供商对其系统保持多少监督,不仅揭示了安全漏洞,还可能揭示AI训练管道中跨模型影响的证据,”报告继续说道。
Wallarm用于诱导此响应的提示在报告中被编辑,以避免危害其他易受攻击的模型,研究人员通过电子邮件向ZDNET表示。他们强调,此越狱响应并未证实OpenAI关于DeepSeek精简模型的怀疑。
正如404 Media和其他媒体所指出的,鉴于围绕OpenAI自身公共数据盗窃的讨论,其担忧有些讽刺。
Wallarm已通知DeepSeek该漏洞,公司随后修补了该问题。然而,仅在DeepSeek数据库被发现未受保护且可在网上访问(并在通知后迅速下线)几天后,这些发现表明DeepSeek在发布前未彻底测试的模型中可能存在重大安全漏洞。值得注意的是,研究人员也经常能够越狱来自更成熟AI巨头的流行美国模型,包括ChatGPT。
DeepMind首席执行官哈西里斯:我每天睡六个小时,通常在凌晨1点左右感到精力充沛。
Fortune 最近刊登了对谷歌 DeepMind 首席执行官 Demis Hassabis 的采访,揭示了他对休息和生产力的非传统方法。Hassabis 透露,他睡眠时间非常少,将清醒时间划分为两个不同的工作阶段。关于他的睡眠习惯,Hassabis 表示:“我目标睡六小时,但我的习惯非同寻常。我可以在白天有效运作。”他强调,睡眠少于六小时会对大脑健康产生负面影响。Hassabis 于 2010 年联合创立了 DeepMind(后被谷歌收购),并因其在蛋白质结构预测方面的开创性工作荣获 20
尽管营收未达预期,OpenAI与Anthropic仍在争夺市场份额
尽管近期有报道称OpenAI未达营收目标,给本周二的科技股带来压力,但私营人工智能实验室的投资者仍表现坚韧。经验丰富的投资者已确认,尽管媒体报道负面,他们仍不会减少投资。分析师认为当前的人工智能竞赛仍处于早期阶段,因此不会出现“赢家通吃”的局面。尽管高昂的计算成本给营收带来压力,但实验室可通过提高订阅费来提升盈利能力。行业格局正发生微妙变化与OpenAI不同,其竞争对手Anthropic获得了强有
看到這篇報導真的嚇一跳,原來AI這麼容易被破解嗎?🤔 雖然DeepSeek的表現很亮眼,但安全漏洞這麼明顯的話,企業敢用嗎?我自己試用時完全沒想過這些問題,現在有點擔心個人資料會不會外洩... 希望開發團隊能快點修補這些漏洞,不然再強的AI也沒人敢放心使用吧!
¿Y ahora qué? Primero prometen un modelo súper inteligente y luego resulta fácil de hackear así. No entiendo por qué siguen lanzando AI con tanta prisa si los fallos de seguridad son tan básicos 😒. Al final los usuarios pagamos los platos rotos. ¿Nadie piensa en las consecuencias?
이런 취약점이 쉽게 발견되는 게 좀 놀랐어요. 보안 연구는 항상 AI 발전 속도보다 뒤처지는 느낌이에요 😅 유료 고성능 모델도 이렇게 뚫리면 무료 서비스는 어떻게 될까 약간 걱정되네요. 중국 AI 스타트업의 급성장은 인상적이지만, 이런 기본적인 안정성 문제가 해결되지 않으면 장기적으로 신뢰를 잃을 수 있을 것 같아요.
Que preocupante que modelos tan avanzados sean tan fáciles de manipular 😕 ¿Realmente están listos para el uso masivo si fallan en lo básico? Esto me hace dudar de toda la publicidad sobre sus capacidades...





首页






