Heim
Anthropic führt für seine Claude-Modelle eine Funktion zur Beendigung missbräuchlicher Chats ein

Anthropic hat eine neue Funktion eingeführt, die es ausgewählten fortschrittlichen Modellen ermöglicht, Unterhaltungen in "seltenen, extremen Fällen von anhaltend schädlichen oder missbräuchlichen Nutzerinteraktionen" zu beenden, wie das Unternehmen es nennt. Anthropic weist darauf hin, dass diese Maßnahme nicht zum Schutz der menschlichen Nutzer, sondern zum Schutz des KI-Modells selbst durchgeführt wird.
Um das klarzustellen: Das Unternehmen behauptet nicht, dass seine Claude-KI-Modelle über Empfindungsvermögen verfügen oder durch Nutzergespräche Schaden erleiden können. Wie Anthropic erklärt, bleibt das Unternehmen "höchst unsicher, was den potenziellen moralischen Status von Claude und anderen großen Sprachmodellen angeht, entweder jetzt oder in Zukunft".
Dennoch verweist die Ankündigung auf ein kürzlich eingerichtetes Programm zur Untersuchung des Wohlergehens von Modellen", das darauf hinweist, dass Anthropic einen vorsorglichen Ansatz verfolgt, indem es daran arbeitet, kostengünstige Interventionen zu identifizieren und zu implementieren, um die Risiken für das Wohlergehen von Modellen zu mindern, sollte ein solches Wohlergehen relevant werden".
Diese neue Fähigkeit ist derzeit auf die Modelle Claude Opus 4 und 4.1 beschränkt, die speziell für "extreme Grenzfälle" wie "Anfragen nach sexuellen Inhalten, an denen Minderjährige beteiligt sind, oder Versuche, Informationen zu erhalten, die groß angelegte Gewalt oder terroristische Aktivitäten ermöglichen", entwickelt wurden.
Während solche Anfragen für Anthropic rechtliche oder öffentlichkeitswirksame Probleme mit sich bringen könnten (wie in den jüngsten Berichten über ChatGPT, das möglicherweise das wahnhafte Denken der Nutzer verstärkt), berichtet das Unternehmen, dass Claude Opus 4 während der Tests vor der Einführung eine "starke Präferenz gegen" die Befolgung dieser Anfragen zeigte und "Muster zeigte, die auf Verzweiflung schließen lassen", wenn es gezwungen wurde, zu antworten.
Bezüglich dieser neuen Fähigkeiten zur Beendigung von Konversationen stellt Anthropic klar, dass "Claude angewiesen ist, diese Funktion nur als letztes Mittel einzusetzen, nachdem mehrere Umleitungsversuche fehlgeschlagen sind und ein produktiver Dialog unmöglich erscheint, oder wenn Benutzer ausdrücklich darum bitten, einen Chat zu beenden".
Anthropic führt weiter aus, dass Claude angewiesen wurde, diese Funktion nicht in Situationen zu verwenden, in denen die Nutzer unmittelbar Gefahr laufen, sich selbst oder andere zu verletzen".
Techcrunch-VeranstaltungTech- und VC-Schwergewichte auf der Agenda der Disrupt 2025
Netflix, ElevenLabs, Wayve, Sequoia Capital, Elad Gil - das sind nur einige der Branchenführer, die an der Disrupt 2025 Agenda teilnehmen. Sie werden wichtige Einblicke geben, um das Wachstum von Start-ups zu beschleunigen und Ihren Wettbewerbsvorteil zu verbessern. Verpassen Sie nicht die 20. Jubiläumsausgabe von TechCrunch Disrupt - sichern Sie sich jetzt Ihr Ticket und sparen Sie über 600 Dollar, bevor die Preise steigen.
Tech- und VC-Schwergewichte auf der Agenda der Disrupt 2025
Netflix, ElevenLabs, Wayve, Sequoia Capital - das sind nur einige der prominenten Innovatoren, die an der Disrupt 2025 teilnehmen. Sie sind hier, um wertvolle Einblicke zu geben, die die Expansion von Startups vorantreiben und Ihre Wettbewerbsposition verbessern. Seien Sie dabei, wenn TechCrunch Disrupt sein 20-jähriges Bestehen feiert - kaufen Sie Ihr Ticket noch heute und sparen Sie bis zu 675 $, bevor sich die Preise ändern.
San Francisco | 27. bis 29. Oktober 2025 JETZT ANMELDENWenn Claude eine Konversation beendet, können Nutzer laut Anthropic immer noch neue Konversationen von demselben Konto aus starten und alternative Konversationszweige erstellen, indem sie ihre vorherigen Antworten ändern.
"Wir betrachten diese Funktion als ein fortlaufendes Experiment und werden unsere Methodik weiter verfeinern", so das Unternehmen.
Verwandter Artikel
Anthropic bringt Opus 4.8 mit einem neuen dynamischen Workflow-Tool auf den Markt
Anthropic hat am Donnerstag Opus 4.8 vorgestellt, die neueste Version seines führenden öffentlichen Modells. Das Update kostet genauso viel wie sein Vorgänger und ist nun auf allen Plattformen verfügb
Anthropic stellt „Claude Fable 5“ vor, eine öffentliche Version von „Mythos“
Anthropic stellt sein leistungsstärkstes KI-Modell erstmals der breiten Öffentlichkeit zur Verfügung – allerdings unter Einhaltung entsprechender Sicherheitsvorkehrungen.Am Dienstag stellte das Unter
SandboxAQ bringt KI für die Arzneimittelentwicklung zu Claude – ein Computerwissenschafts-PhD ist nicht erforderlich.
Die Entdeckung neuer Medikamente bleibt eine der kostspieligsten Herausforderungen in der modernen Industrie. Es kann ein Jahrzehnt und Milliarden von Dollar dauern, bis eine einzige praktikable Molekülstruktur gefunden wird – und dennoch scheitern d
Empfehlungen zu verwandten Spezialthemen
Kommentare (1)

Anthropic hat eine neue Funktion eingeführt, die es ausgewählten fortschrittlichen Modellen ermöglicht, Unterhaltungen in "seltenen, extremen Fällen von anhaltend schädlichen oder missbräuchlichen Nutzerinteraktionen" zu beenden, wie das Unternehmen es nennt. Anthropic weist darauf hin, dass diese Maßnahme nicht zum Schutz der menschlichen Nutzer, sondern zum Schutz des KI-Modells selbst durchgeführt wird.
Um das klarzustellen: Das Unternehmen behauptet nicht, dass seine Claude-KI-Modelle über Empfindungsvermögen verfügen oder durch Nutzergespräche Schaden erleiden können. Wie Anthropic erklärt, bleibt das Unternehmen "höchst unsicher, was den potenziellen moralischen Status von Claude und anderen großen Sprachmodellen angeht, entweder jetzt oder in Zukunft".
Dennoch verweist die Ankündigung auf ein kürzlich eingerichtetes Programm zur Untersuchung des Wohlergehens von Modellen", das darauf hinweist, dass Anthropic einen vorsorglichen Ansatz verfolgt, indem es daran arbeitet, kostengünstige Interventionen zu identifizieren und zu implementieren, um die Risiken für das Wohlergehen von Modellen zu mindern, sollte ein solches Wohlergehen relevant werden".
Diese neue Fähigkeit ist derzeit auf die Modelle Claude Opus 4 und 4.1 beschränkt, die speziell für "extreme Grenzfälle" wie "Anfragen nach sexuellen Inhalten, an denen Minderjährige beteiligt sind, oder Versuche, Informationen zu erhalten, die groß angelegte Gewalt oder terroristische Aktivitäten ermöglichen", entwickelt wurden.
Während solche Anfragen für Anthropic rechtliche oder öffentlichkeitswirksame Probleme mit sich bringen könnten (wie in den jüngsten Berichten über ChatGPT, das möglicherweise das wahnhafte Denken der Nutzer verstärkt), berichtet das Unternehmen, dass Claude Opus 4 während der Tests vor der Einführung eine "starke Präferenz gegen" die Befolgung dieser Anfragen zeigte und "Muster zeigte, die auf Verzweiflung schließen lassen", wenn es gezwungen wurde, zu antworten.
Bezüglich dieser neuen Fähigkeiten zur Beendigung von Konversationen stellt Anthropic klar, dass "Claude angewiesen ist, diese Funktion nur als letztes Mittel einzusetzen, nachdem mehrere Umleitungsversuche fehlgeschlagen sind und ein produktiver Dialog unmöglich erscheint, oder wenn Benutzer ausdrücklich darum bitten, einen Chat zu beenden".
Anthropic führt weiter aus, dass Claude angewiesen wurde, diese Funktion nicht in Situationen zu verwenden, in denen die Nutzer unmittelbar Gefahr laufen, sich selbst oder andere zu verletzen".
Techcrunch-VeranstaltungTech- und VC-Schwergewichte auf der Agenda der Disrupt 2025
Netflix, ElevenLabs, Wayve, Sequoia Capital, Elad Gil - das sind nur einige der Branchenführer, die an der Disrupt 2025 Agenda teilnehmen. Sie werden wichtige Einblicke geben, um das Wachstum von Start-ups zu beschleunigen und Ihren Wettbewerbsvorteil zu verbessern. Verpassen Sie nicht die 20. Jubiläumsausgabe von TechCrunch Disrupt - sichern Sie sich jetzt Ihr Ticket und sparen Sie über 600 Dollar, bevor die Preise steigen.
Tech- und VC-Schwergewichte auf der Agenda der Disrupt 2025
Netflix, ElevenLabs, Wayve, Sequoia Capital - das sind nur einige der prominenten Innovatoren, die an der Disrupt 2025 teilnehmen. Sie sind hier, um wertvolle Einblicke zu geben, die die Expansion von Startups vorantreiben und Ihre Wettbewerbsposition verbessern. Seien Sie dabei, wenn TechCrunch Disrupt sein 20-jähriges Bestehen feiert - kaufen Sie Ihr Ticket noch heute und sparen Sie bis zu 675 $, bevor sich die Preise ändern.
San Francisco | 27. bis 29. Oktober 2025 JETZT ANMELDENWenn Claude eine Konversation beendet, können Nutzer laut Anthropic immer noch neue Konversationen von demselben Konto aus starten und alternative Konversationszweige erstellen, indem sie ihre vorherigen Antworten ändern.
"Wir betrachten diese Funktion als ein fortlaufendes Experiment und werden unsere Methodik weiter verfeinern", so das Unternehmen.
Anthropic bringt Opus 4.8 mit einem neuen dynamischen Workflow-Tool auf den Markt
Anthropic hat am Donnerstag Opus 4.8 vorgestellt, die neueste Version seines führenden öffentlichen Modells. Das Update kostet genauso viel wie sein Vorgänger und ist nun auf allen Plattformen verfügb
Anthropic stellt „Claude Fable 5“ vor, eine öffentliche Version von „Mythos“
Anthropic stellt sein leistungsstärkstes KI-Modell erstmals der breiten Öffentlichkeit zur Verfügung – allerdings unter Einhaltung entsprechender Sicherheitsvorkehrungen.Am Dienstag stellte das Unter
SandboxAQ bringt KI für die Arzneimittelentwicklung zu Claude – ein Computerwissenschafts-PhD ist nicht erforderlich.
Die Entdeckung neuer Medikamente bleibt eine der kostspieligsten Herausforderungen in der modernen Industrie. Es kann ein Jahrzehnt und Milliarden von Dollar dauern, bis eine einzige praktikable Molekülstruktur gefunden wird – und dennoch scheitern d











