Cybersecurity-Experten kritisieren die Schutzvorrichtungen in Anthropys Fable

Anthropic hat am Dienstag sein neuestes Modell Fabel vorgestellt und es als eine öffentliche, eingeschränkte Version seines hocherwarteten, auf Cybersicherheit spezialisierten Modells Mythos positioniert.
Die Einschränkungen haben jedoch bei mehreren Cybersicherheitsforschern und -experten Unzufriedenheit ausgelöst, die ihre Bedenken online geäußert haben.
„[Fabel] blockiert jede Anfrage, die irgendwie mit Cybersicherheit zusammenhängt, einschließlich harmloser Aufgaben wie dem Lesen eines Blogbeitags“, erklärte Valentina „Chompie“ Palmiotti, eine bekannte Sicherheitsforscherin bei IBM X-Force.
Wenn ein Benutzerprompt diese Sicherheitsfilter auslöst, stoppt Fabel das Gespräch und zeigt eine Nachricht an, dass seine „Sicherheitsprotokolle diese Eingabe für Cybersicherheits- oder Biologiethemen markiert haben.“
Diese Einschränkungen zielen darauf ab, das Risiko zu mindern, dass Fabel zur Erstellung von Malware oder zur Ausnutzung von Software genutzt wird – eine anhaltende Sorge für Anthropic. Die biologischen Einschränkungen resultieren aus ähnlichen Bedenken bezüglich der Entwicklung biologischer Waffen.
Bei der Veröffentlichung von Mythos im April beschränkte Anthropic den Zugriff auf eine ausgewählte Gruppe von Unternehmen und Organisationen im Rahmen von Project Glasswing, einer Initiative, die darauf abzielt, das Modell zur Sicherung kritischer Software und Infrastruktur einzusetzen. Letzte Woche erweiterte Anthropic den Mythos-Zugriff auf Hunderte von Organisationen in 15 Ländern.
Trotz dieser guten Absichten bleiben viele Cybersicherheitsexperten frustriert über die scheinbar willkürliche Natur der Einschränkungen. Matt Suiche, ein erfahrener Cybersicherheitsexperte, sagte gegenüber TechCrunch, dass „wenn man ihn bittet, sicheren Code zu schreiben, er dies als cybersicherheitsbezogene Arbeit und nicht als Best Practices der Softwareentwicklung interpretiert, was zu einer Herabstufung führt.“ Fabel ist so konfiguriert, dass es bei Auslösung der Schutzmechanismen zu Claude Opus 4.8 zurückkehrt. „Es scheint, dass es auf Schlüsselwörtern basiert, sodass jeder Begriff im Lexikon der ‚Cybersicherheit‘ die Filter auslöst“, bemerkte er.
Kontaktieren Sie uns
Haben Sie weitere Einblicke darin, wie Hacker KI nutzen oder wie Cybersicherheitsfirmen KI integrieren? Wir freuen uns über Ihre Beiträge. Von einem persönlichen Gerät und Netzwerk aus können Sie Lorenzo Franceschi-Bicchierai sicher über Signal unter +1 917 257 1382, über Telegram und Keybase @lorenzofb oder per E-Mail erreichen.
„Allerdings ist es verständlich, dass wir uns noch in den frühen Phasen befinden und sie ihre Schutzmechanismen verfeinern. Ich bin zuversichtlich, dass sie sich entwickeln werden, wenn Anthropic und andere Entwickler von Frontier-Modellen enger mit der neuen Generation von Cybersicherheitsfirmen zusammenarbeiten“, sagte Suiche, ein technisches Mitarbeitermitglied bei Tolmo, einem KI-Cybersicherheitsstart-up. „Es ist vorzuziehen, anfangs übermäßig einzuschränken und die Schutzmechanismen im Laufe der Zeit zu lockern.“
Ein anderer Forscher beschwerte sich auf X, dass „selbst die Anfrage nach einer Codeüberprüfung“ die Sicherheitsfilter von Fabel auslöst.
Anthropic reagierte nicht sofort auf eine Anfrage nach einer Stellungnahme.
Neben den Modellschutzmechanismen verlangt Anthropic von Cybersicherheitsexperten, sich für sein Cybersicherheits-Verifizierungsprogramm zu bewerben. Genehmigte Antragsteller haben bei der Nutzung von Claude für Cybersicherheitsaufgaben weniger Einschränkungen. OpenAI bietet ein vergleichbares Programm namens Trusted Access for Cyber an.
Verwandter Artikel
Das Weiße Haus verzichtet auf die KI-Bezeichnung „Superintelligenz“
Laden des Players…Diese Woche versammelte das Weiße Haus fast alle großen Tech-CEOs in einem Raum – darunter Zuckerberg, Bezos, Musk und Anthreps Dario Amodei – um ein KI-Sicherheitsversprechen zu unterzeichnen, das Präsident Donald Trump als „moral
Anthropic stellt Sonnet 5.5 als schnelleren und günstigeren Arbeitspartner vor
Amidst the ongoing competition among AI models, Anthropic has launched the latest iteration of Sonnet, its mid-range offering, promising substantially improved speed and lower costs compared to the previous version.Anthropic positions Sonnet 5.5 as
Anthropics jüngster Konflikt mit der Trump-Regierung könnte ihr tatsächlich nutzen, wie Verkaufsdaten nahelegen
Anthropic erlebt einen bemerkenswerten Monat.Laut Ramp überholte das KI-Unternehmen OpenAI erstmals beim Marktanteil für Unternehmensausgaben und schloss den Mai mit einer Finanzierungsrunde in Höhe von 65 Milliarden US-Dollar bei einer Bewertung vo
Empfehlungen zu verwandten Spezialthemen
Kommentare (0)

Anthropic hat am Dienstag sein neuestes Modell Fabel vorgestellt und es als eine öffentliche, eingeschränkte Version seines hocherwarteten, auf Cybersicherheit spezialisierten Modells Mythos positioniert.
Die Einschränkungen haben jedoch bei mehreren Cybersicherheitsforschern und -experten Unzufriedenheit ausgelöst, die ihre Bedenken online geäußert haben.
„[Fabel] blockiert jede Anfrage, die irgendwie mit Cybersicherheit zusammenhängt, einschließlich harmloser Aufgaben wie dem Lesen eines Blogbeitags“, erklärte Valentina „Chompie“ Palmiotti, eine bekannte Sicherheitsforscherin bei IBM X-Force.
Wenn ein Benutzerprompt diese Sicherheitsfilter auslöst, stoppt Fabel das Gespräch und zeigt eine Nachricht an, dass seine „Sicherheitsprotokolle diese Eingabe für Cybersicherheits- oder Biologiethemen markiert haben.“
Diese Einschränkungen zielen darauf ab, das Risiko zu mindern, dass Fabel zur Erstellung von Malware oder zur Ausnutzung von Software genutzt wird – eine anhaltende Sorge für Anthropic. Die biologischen Einschränkungen resultieren aus ähnlichen Bedenken bezüglich der Entwicklung biologischer Waffen.
Bei der Veröffentlichung von Mythos im April beschränkte Anthropic den Zugriff auf eine ausgewählte Gruppe von Unternehmen und Organisationen im Rahmen von Project Glasswing, einer Initiative, die darauf abzielt, das Modell zur Sicherung kritischer Software und Infrastruktur einzusetzen. Letzte Woche erweiterte Anthropic den Mythos-Zugriff auf Hunderte von Organisationen in 15 Ländern.
Trotz dieser guten Absichten bleiben viele Cybersicherheitsexperten frustriert über die scheinbar willkürliche Natur der Einschränkungen. Matt Suiche, ein erfahrener Cybersicherheitsexperte, sagte gegenüber TechCrunch, dass „wenn man ihn bittet, sicheren Code zu schreiben, er dies als cybersicherheitsbezogene Arbeit und nicht als Best Practices der Softwareentwicklung interpretiert, was zu einer Herabstufung führt.“ Fabel ist so konfiguriert, dass es bei Auslösung der Schutzmechanismen zu Claude Opus 4.8 zurückkehrt. „Es scheint, dass es auf Schlüsselwörtern basiert, sodass jeder Begriff im Lexikon der ‚Cybersicherheit‘ die Filter auslöst“, bemerkte er.
Kontaktieren Sie uns
Haben Sie weitere Einblicke darin, wie Hacker KI nutzen oder wie Cybersicherheitsfirmen KI integrieren? Wir freuen uns über Ihre Beiträge. Von einem persönlichen Gerät und Netzwerk aus können Sie Lorenzo Franceschi-Bicchierai sicher über Signal unter +1 917 257 1382, über Telegram und Keybase @lorenzofb oder per E-Mail erreichen.
„Allerdings ist es verständlich, dass wir uns noch in den frühen Phasen befinden und sie ihre Schutzmechanismen verfeinern. Ich bin zuversichtlich, dass sie sich entwickeln werden, wenn Anthropic und andere Entwickler von Frontier-Modellen enger mit der neuen Generation von Cybersicherheitsfirmen zusammenarbeiten“, sagte Suiche, ein technisches Mitarbeitermitglied bei Tolmo, einem KI-Cybersicherheitsstart-up. „Es ist vorzuziehen, anfangs übermäßig einzuschränken und die Schutzmechanismen im Laufe der Zeit zu lockern.“
Ein anderer Forscher beschwerte sich auf X, dass „selbst die Anfrage nach einer Codeüberprüfung“ die Sicherheitsfilter von Fabel auslöst.
Anthropic reagierte nicht sofort auf eine Anfrage nach einer Stellungnahme.
Neben den Modellschutzmechanismen verlangt Anthropic von Cybersicherheitsexperten, sich für sein Cybersicherheits-Verifizierungsprogramm zu bewerben. Genehmigte Antragsteller haben bei der Nutzung von Claude für Cybersicherheitsaufgaben weniger Einschränkungen. OpenAI bietet ein vergleichbares Programm namens Trusted Access for Cyber an.
Das Weiße Haus verzichtet auf die KI-Bezeichnung „Superintelligenz“
Laden des Players…Diese Woche versammelte das Weiße Haus fast alle großen Tech-CEOs in einem Raum – darunter Zuckerberg, Bezos, Musk und Anthreps Dario Amodei – um ein KI-Sicherheitsversprechen zu unterzeichnen, das Präsident Donald Trump als „moral
Anthropic stellt Sonnet 5.5 als schnelleren und günstigeren Arbeitspartner vor
Amidst the ongoing competition among AI models, Anthropic has launched the latest iteration of Sonnet, its mid-range offering, promising substantially improved speed and lower costs compared to the previous version.Anthropic positions Sonnet 5.5 as
Anthropics jüngster Konflikt mit der Trump-Regierung könnte ihr tatsächlich nutzen, wie Verkaufsdaten nahelegen
Anthropic erlebt einen bemerkenswerten Monat.Laut Ramp überholte das KI-Unternehmen OpenAI erstmals beim Marktanteil für Unternehmensausgaben und schloss den Mai mit einer Finanzierungsrunde in Höhe von 65 Milliarden US-Dollar bei einer Bewertung vo





Heim






