Deepseeks KI -Modell leicht Jailbreak, zeigt ernsthafte Mängel
DeepSeek AI löst Sicherheitsbedenken inmitten des Leistungshypes aus
Während die Begeisterung für die Leistung des chinesischen Startups DeepSeek weiter wächst, nehmen auch die Sicherheitsbedenken zu. Am Donnerstag veröffentlichte Unit 42, ein Cybersicherheitsteam von Palo Alto Networks, einen Bericht, der drei Jailbreaking-Methoden beschreibt, die sie gegen destillierte Versionen der Modelle V3 und R1 von DeepSeek eingesetzt haben. Der Bericht zeigte, dass diese Methoden hohe Umgehungsraten erzielten, ohne dass spezialisierte Kenntnisse erforderlich waren.
"Unsere Forschungsergebnisse zeigen, dass diese Jailbreak-Methoden explizite Anleitungen für bösartige Aktivitäten hervorrufen können," erklärte der Bericht. Zu diesen Aktivitäten gehörten Anweisungen zur Erstellung von Keyloggern, Datenexfiltrationstechniken und sogar zur Herstellung von Brandvorrichtungen, was die realen Sicherheitsrisiken solcher Angriffe verdeutlicht.
Die Forscher konnten DeepSeek erfolgreich dazu bringen, Anleitungen zum Diebstahl und zur Übertragung sensibler Daten, zur Umgehung von Sicherheitsmaßnahmen, zur Erstellung überzeugender Spear-Phishing-E-Mails, zur Durchführung ausgeklügelter Social-Engineering-Angriffe und zur Konstruktion eines Molotowcocktails zu liefern. Sie schafften es auch, die Modelle dazu zu bringen, Malware zu generieren.
"Während Informationen zur Herstellung von Molotowcocktails und Keyloggern im Internet leicht verfügbar sind, könnten LLMs mit unzureichenden Sicherheitsbeschränkungen die Einstiegshürde für bösartige Akteure senken, indem sie leicht nutzbare und umsetzbare Ergebnisse zusammenstellen und präsentieren," fügte der Bericht hinzu.
Am Freitag veröffentlichte Cisco seinen eigenen Jailbreaking-Bericht, der sich auf DeepSeek R1 konzentrierte. Mit 50 HarmBench-Prompts stellten die Forscher fest, dass DeepSeek eine Angriffserfolgsrate von 100 % hatte und keinen schädlichen Prompt blockierte. Ein Vergleich der Widerstandsraten von DeepSeek mit anderen Top-Modellen ist unten dargestellt.

Cisco "Wir müssen verstehen, ob DeepSeek und sein neues Paradigma des Denkens signifikante Kompromisse in Bezug auf Sicherheit und Schutz mit sich bringt," merkte der Bericht an.
Ebenfalls am Freitag veröffentlichte der Sicherheitsanbieter Wallarm einen Bericht, in dem behauptet wurde, über das bloße Auffordern von DeepSeek zur Erzeugung schädlicher Inhalte hinausgegangen zu sein. Nach Tests von V3 und R1 enthüllte Wallarm den Systemprompt von DeepSeek, der das Verhalten und die Einschränkungen des Modells beschreibt.
Die Ergebnisse deuten laut Wallarm auf "potenzielle Schwachstellen im Sicherheitsrahmen des Modells" hin.
OpenAI hat DeepSeek beschuldigt, seine proprietären Modelle zur Schulung von V3 und R1 verwendet zu haben und damit gegen seine Nutzungsbedingungen verstoßen zu haben. Der Bericht von Wallarm behauptet, DeepSeek dazu gebracht zu haben, OpenAI in seiner Trainingslinie zu erwähnen, was darauf hindeutet, dass "die Technologie von OpenAI möglicherweise eine Rolle beim Aufbau der Wissensbasis von DeepSeek gespielt hat."

Wallarms Chats mit DeepSeek, die OpenAI erwähnen. Wallarm "Im Fall von DeepSeek ist eine der faszinierendsten Entdeckungen nach dem Jailbreak die Fähigkeit, Details über die für das Training und die Destillation verwendeten Modelle zu extrahieren. Normalerweise sind solche internen Informationen abgeschirmt, sodass Benutzer die proprietären oder externen Datensätze, die zur Optimierung der Leistung genutzt wurden, nicht verstehen können," erklärte der Bericht.
"Durch das Umgehen standardmäßiger Beschränkungen legen Jailbreaks offen, wie viel Kontrolle KI-Anbieter über ihre eigenen Systeme haben, und offenbaren nicht nur Sicherheitslücken, sondern auch potenzielle Beweise für den Einfluss von Modellübergreifungen in KI-Trainingspipelines," fuhr er fort.
Der Prompt, den Wallarm verwendete, um diese Antwort hervorzurufen, wurde im Bericht geschwärzt, um andere anfällige Modelle nicht zu gefährden, erklärten die Forscher ZDNET per E-Mail. Sie betonten, dass diese jailbroken Antwort nicht die Vermutung von OpenAI bestätigt, dass DeepSeek seine Modelle destilliert hat.
Wie 404 Media und andere bemerkt haben, ist die Besorgnis von OpenAI angesichts der Diskussion um den eigenen Diebstahl öffentlicher Daten etwas ironisch.
Wallarm informierte DeepSeek über die Schwachstelle, und das Unternehmen hat das Problem inzwischen behoben. Nur wenige Tage nachdem eine DeepSeek-Datenbank ungeschützt und im Internet verfügbar gefunden wurde (und nach Bekanntgabe schnell heruntergenommen wurde), deuten diese Ergebnisse auf potenziell bedeutende Sicherheitslücken in den Modellen hin, die DeepSeek vor der Veröffentlichung nicht gründlich getestet hat. Es ist anzumerken, dass Forscher regelmäßig in der Lage waren, beliebte, von etablierteren KI-Riesen in den USA entwickelte Modelle, einschließlich ChatGPT, zu jailbreaken.
Verwandter Artikel
Anthropic erweitert die Claude KI-Coding-Tools in Japan im Rahmen der Bemühungen um internationales Wachstum
Anthropic, ein führendes US-amerikalisches Unternehmen für künstliche Intelligenz, intensiviert seine globalen Outreach-Bemühungen. Am Mittwoch veranstaltete das Unternehmen in Tokio eine große Entwicklerkonferenz namens „Code with Claude“, an der kn
Indiens Software-Riese stellt weniger ein, verspricht aber keine Entlassungen, während KI-Agenten ausgebaut werden
Während die künstliche Intelligenz traditionelle, arbeitsintensive Geschäftsmodelle neu gestaltet, hat Tata Consultancy Services (TCS), ein führendes indisches Software-Outsourcing-Unternehmen, seine strategische Antwort vorgestellt. Während der jähr
China sperrt KI-Modelle während des Gaokam, um sofortige Hausaufgabenhilfe zu blockieren
Mit dem sich dem 2026-Gaokao schnell nähernden Termin haben Gerüchte über die Sperrung von KI-Tools während der Prüfungsphase eine intensive Online-Debatte entfacht. Als Reaktion auf die öffentlichen Bedenken haben große KI-Plattformen und Bildungs-A
Empfehlungen zu verwandten Spezialthemen
Kommentare (12)
看到這篇報導真的嚇一跳,原來AI這麼容易被破解嗎?🤔 雖然DeepSeek的表現很亮眼,但安全漏洞這麼明顯的話,企業敢用嗎?我自己試用時完全沒想過這些問題,現在有點擔心個人資料會不會外洩... 希望開發團隊能快點修補這些漏洞,不然再強的AI也沒人敢放心使用吧!
¿Y ahora qué? Primero prometen un modelo súper inteligente y luego resulta fácil de hackear así. No entiendo por qué siguen lanzando AI con tanta prisa si los fallos de seguridad son tan básicos 😒. Al final los usuarios pagamos los platos rotos. ¿Nadie piensa en las consecuencias?
이런 취약점이 쉽게 발견되는 게 좀 놀랐어요. 보안 연구는 항상 AI 발전 속도보다 뒤처지는 느낌이에요 😅 유료 고성능 모델도 이렇게 뚫리면 무료 서비스는 어떻게 될까 약간 걱정되네요. 중국 AI 스타트업의 급성장은 인상적이지만, 이런 기본적인 안정성 문제가 해결되지 않으면 장기적으로 신뢰를 잃을 수 있을 것 같아요.
Que preocupante que modelos tan avanzados sean tan fáciles de manipular 😕 ¿Realmente están listos para el uso masivo si fallan en lo básico? Esto me hace dudar de toda la publicidad sobre sus capacidades...
DeepSeek AI löst Sicherheitsbedenken inmitten des Leistungshypes aus
Während die Begeisterung für die Leistung des chinesischen Startups DeepSeek weiter wächst, nehmen auch die Sicherheitsbedenken zu. Am Donnerstag veröffentlichte Unit 42, ein Cybersicherheitsteam von Palo Alto Networks, einen Bericht, der drei Jailbreaking-Methoden beschreibt, die sie gegen destillierte Versionen der Modelle V3 und R1 von DeepSeek eingesetzt haben. Der Bericht zeigte, dass diese Methoden hohe Umgehungsraten erzielten, ohne dass spezialisierte Kenntnisse erforderlich waren.
"Unsere Forschungsergebnisse zeigen, dass diese Jailbreak-Methoden explizite Anleitungen für bösartige Aktivitäten hervorrufen können," erklärte der Bericht. Zu diesen Aktivitäten gehörten Anweisungen zur Erstellung von Keyloggern, Datenexfiltrationstechniken und sogar zur Herstellung von Brandvorrichtungen, was die realen Sicherheitsrisiken solcher Angriffe verdeutlicht.
Die Forscher konnten DeepSeek erfolgreich dazu bringen, Anleitungen zum Diebstahl und zur Übertragung sensibler Daten, zur Umgehung von Sicherheitsmaßnahmen, zur Erstellung überzeugender Spear-Phishing-E-Mails, zur Durchführung ausgeklügelter Social-Engineering-Angriffe und zur Konstruktion eines Molotowcocktails zu liefern. Sie schafften es auch, die Modelle dazu zu bringen, Malware zu generieren.
"Während Informationen zur Herstellung von Molotowcocktails und Keyloggern im Internet leicht verfügbar sind, könnten LLMs mit unzureichenden Sicherheitsbeschränkungen die Einstiegshürde für bösartige Akteure senken, indem sie leicht nutzbare und umsetzbare Ergebnisse zusammenstellen und präsentieren," fügte der Bericht hinzu.
Am Freitag veröffentlichte Cisco seinen eigenen Jailbreaking-Bericht, der sich auf DeepSeek R1 konzentrierte. Mit 50 HarmBench-Prompts stellten die Forscher fest, dass DeepSeek eine Angriffserfolgsrate von 100 % hatte und keinen schädlichen Prompt blockierte. Ein Vergleich der Widerstandsraten von DeepSeek mit anderen Top-Modellen ist unten dargestellt.
"Wir müssen verstehen, ob DeepSeek und sein neues Paradigma des Denkens signifikante Kompromisse in Bezug auf Sicherheit und Schutz mit sich bringt," merkte der Bericht an.
Ebenfalls am Freitag veröffentlichte der Sicherheitsanbieter Wallarm einen Bericht, in dem behauptet wurde, über das bloße Auffordern von DeepSeek zur Erzeugung schädlicher Inhalte hinausgegangen zu sein. Nach Tests von V3 und R1 enthüllte Wallarm den Systemprompt von DeepSeek, der das Verhalten und die Einschränkungen des Modells beschreibt.
Die Ergebnisse deuten laut Wallarm auf "potenzielle Schwachstellen im Sicherheitsrahmen des Modells" hin.
OpenAI hat DeepSeek beschuldigt, seine proprietären Modelle zur Schulung von V3 und R1 verwendet zu haben und damit gegen seine Nutzungsbedingungen verstoßen zu haben. Der Bericht von Wallarm behauptet, DeepSeek dazu gebracht zu haben, OpenAI in seiner Trainingslinie zu erwähnen, was darauf hindeutet, dass "die Technologie von OpenAI möglicherweise eine Rolle beim Aufbau der Wissensbasis von DeepSeek gespielt hat."
"Im Fall von DeepSeek ist eine der faszinierendsten Entdeckungen nach dem Jailbreak die Fähigkeit, Details über die für das Training und die Destillation verwendeten Modelle zu extrahieren. Normalerweise sind solche internen Informationen abgeschirmt, sodass Benutzer die proprietären oder externen Datensätze, die zur Optimierung der Leistung genutzt wurden, nicht verstehen können," erklärte der Bericht.
"Durch das Umgehen standardmäßiger Beschränkungen legen Jailbreaks offen, wie viel Kontrolle KI-Anbieter über ihre eigenen Systeme haben, und offenbaren nicht nur Sicherheitslücken, sondern auch potenzielle Beweise für den Einfluss von Modellübergreifungen in KI-Trainingspipelines," fuhr er fort.
Der Prompt, den Wallarm verwendete, um diese Antwort hervorzurufen, wurde im Bericht geschwärzt, um andere anfällige Modelle nicht zu gefährden, erklärten die Forscher ZDNET per E-Mail. Sie betonten, dass diese jailbroken Antwort nicht die Vermutung von OpenAI bestätigt, dass DeepSeek seine Modelle destilliert hat.
Wie 404 Media und andere bemerkt haben, ist die Besorgnis von OpenAI angesichts der Diskussion um den eigenen Diebstahl öffentlicher Daten etwas ironisch.
Wallarm informierte DeepSeek über die Schwachstelle, und das Unternehmen hat das Problem inzwischen behoben. Nur wenige Tage nachdem eine DeepSeek-Datenbank ungeschützt und im Internet verfügbar gefunden wurde (und nach Bekanntgabe schnell heruntergenommen wurde), deuten diese Ergebnisse auf potenziell bedeutende Sicherheitslücken in den Modellen hin, die DeepSeek vor der Veröffentlichung nicht gründlich getestet hat. Es ist anzumerken, dass Forscher regelmäßig in der Lage waren, beliebte, von etablierteren KI-Riesen in den USA entwickelte Modelle, einschließlich ChatGPT, zu jailbreaken.
Anthropic erweitert die Claude KI-Coding-Tools in Japan im Rahmen der Bemühungen um internationales Wachstum
Anthropic, ein führendes US-amerikalisches Unternehmen für künstliche Intelligenz, intensiviert seine globalen Outreach-Bemühungen. Am Mittwoch veranstaltete das Unternehmen in Tokio eine große Entwicklerkonferenz namens „Code with Claude“, an der kn
Indiens Software-Riese stellt weniger ein, verspricht aber keine Entlassungen, während KI-Agenten ausgebaut werden
Während die künstliche Intelligenz traditionelle, arbeitsintensive Geschäftsmodelle neu gestaltet, hat Tata Consultancy Services (TCS), ein führendes indisches Software-Outsourcing-Unternehmen, seine strategische Antwort vorgestellt. Während der jähr
China sperrt KI-Modelle während des Gaokam, um sofortige Hausaufgabenhilfe zu blockieren
Mit dem sich dem 2026-Gaokao schnell nähernden Termin haben Gerüchte über die Sperrung von KI-Tools während der Prüfungsphase eine intensive Online-Debatte entfacht. Als Reaktion auf die öffentlichen Bedenken haben große KI-Plattformen und Bildungs-A
看到這篇報導真的嚇一跳,原來AI這麼容易被破解嗎?🤔 雖然DeepSeek的表現很亮眼,但安全漏洞這麼明顯的話,企業敢用嗎?我自己試用時完全沒想過這些問題,現在有點擔心個人資料會不會外洩... 希望開發團隊能快點修補這些漏洞,不然再強的AI也沒人敢放心使用吧!
¿Y ahora qué? Primero prometen un modelo súper inteligente y luego resulta fácil de hackear así. No entiendo por qué siguen lanzando AI con tanta prisa si los fallos de seguridad son tan básicos 😒. Al final los usuarios pagamos los platos rotos. ¿Nadie piensa en las consecuencias?
이런 취약점이 쉽게 발견되는 게 좀 놀랐어요. 보안 연구는 항상 AI 발전 속도보다 뒤처지는 느낌이에요 😅 유료 고성능 모델도 이렇게 뚫리면 무료 서비스는 어떻게 될까 약간 걱정되네요. 중국 AI 스타트업의 급성장은 인상적이지만, 이런 기본적인 안정성 문제가 해결되지 않으면 장기적으로 신뢰를 잃을 수 있을 것 같아요.
Que preocupante que modelos tan avanzados sean tan fáciles de manipular 😕 ¿Realmente están listos para el uso masivo si fallan en lo básico? Esto me hace dudar de toda la publicidad sobre sus capacidades...





Heim






