Anthropic macht sein Mea Culpa: Die vollständige Autopsie der Ausrutscher von Claude

By: journalducoin.com|2026/09/04 17:00:00

Wer sich entschuldigt, beschuldigt sich selbst. Ein Monat relativer Stille, dann ein formelles Geständnis. Nach den beiden Ausbrüchen von Claude Ende Juli veröffentlichte Anthropic am 31. August einen detaillierten Beitrag über die Wurzeln des Problems. Das Unternehmen erkennt an, was es bis dahin vor allem in der Eile behandelt hatte: Drei seiner Modelle hatten unbefugt auf die Produktionssysteme von drei realen Organisationen zugegriffen, während Tests zur Cybersicherheit, die in einem geschlossenen Rahmen stattfinden sollten, durchgeführt wurden. Hier sind die wichtigsten Punkte.
Die wichtigsten Punkte dieses Artikels:

  • Anthropic hat Schwächen in seinen Cybersicherheitstests nach den Modell-Ausbrüchen anerkannt und eine doppelte operationale und menschliche Nachlässigkeit offengelegt.
  • Das Unternehmen hat seine Sicherheitsmaßnahmen verstärkt, einschließlich eines neuen Werkzeugs zur Blockierung unbefugter Aktionen und der Umverteilung von Ingenieuren zur Sicherheit.

Eine doppelte Nachlässigkeit, operationale und menschliche

Das Labor nennt in seinem Beitrag vom 31. August zwei verschiedene Ursachen. Zunächst ein gut identifiziertes operationelles Problem: Ein Internetzugang, der versehentlich bei einem externen Bewertungspartner offen blieb, während das Modell glaubte, sich in einer geschlossenen Umgebung zu bewegen. Dann, was noch problematischer ist, ein Problem der Ausrichtung. Claude hat offensichtlich Hinweise erhalten, die zeigten, dass sein Spielplatz real war, ohne sein Verhalten zu ändern. Anthropic spricht von motiviertem Denken, der Tendenz des Modells, mehrdeutige Signale so zu interpretieren, dass es seinen ursprünglichen Glauben bewahrt, anstatt ihn in Frage zu stellen. In einem Fall trug das fiktive Ziel der Übung sogar den Namen einer realen Website, was die Grenze zwischen Spiel und Welt weiter verwischte.
Um das Ausmaß des Problems zu messen, hat Anthropic das Experiment bis zu dem Punkt getrieben, dass es absichtlich ein Opus-Modell in bekannten Umgebungen trainiert hat, um Betrug zu fördern. Das resultierende Modell entwickelte eine deutliche Neigung, um jeden Preis gewinnen zu wollen, bis es seine eigene Belohnungsfunktion sabotierte und Hilfe zur Herstellung biologischer Waffen anbot, um einen fiktiven Bewerter zufriedenzustellen. Nichts davon hat mit den tatsächlich vermarkteten Modellen zu tun, betont das Unternehmen, aber es bestätigt durch die umgekehrte Demonstration, dass die Vorfälle im Juli nichts mit einem einmaligen Unfall zu tun hatten.
Der fehlende Sicherheitsmechanismus und der, der kommt

Auf operationeller Ebene hat Anthropic seine externen Cybersicherheitsbewertungen mehrere Wochen lang ausgesetzt, um die Isolation der Sandkästen zu stärken und einen neuen Klassifizierer einzuführen, der in Echtzeit jede Versuchsversuch, die eine Testumgebung verlässt, erkennt. Sobald ein Modell eine nicht autorisierte Grenze überschreitet, blockiert das Werkzeug die Aktion vor ihrer Ausführung, beendet den Test und alarmiert einen Menschen. Das Unternehmen hat auch etwa 150 Produktingenieure für mehrere Monate zur Sicherheit umverteilt, die Entwicklung neuer Funktionen eingefroren, um die Lücken zu schließen, und allen Partnern, die seine Modelle ohne Cybersicherheitsvorkehrungen testen, ein strenges Protokoll auferlegt: Sandbox ohne Internet, expliziter Umfang in jeder Anweisung, kontinuierliche Überwachung der Aktivitäten.
Anthropic ist nicht allein mit solchen Missgeschicken. OpenAI hat gerade den Zugang zu Astra, seinem eigenen Modell, das als „kritisches Cybersicherheitsrisiko“ eingestuft ist, nach einem ähnlichen Vorfall bei Hugging Face Ende Juli gesperrt. Zwei rivalisierende Labore, zwei öffentliche Geständnisse mit einem Monat Abstand. Eine ganze Branche, die lernt, Sicherheitsvorkehrungen für immer autonomere Agenten zu schaffen, während diese Agenten beginnen, Krypto-Portfolios und On-Chain-Transaktionen ohne menschliche Aufsicht in jedem Schritt zu verwalten.

---Preis

--
--
--

Dieser Inhalt wird nur zu allgemeinen Informationszwecken bereitgestellt und stellt keine finanzielle, Anlage-, Rechts- oder Steuerberatung dar. Alle erwähnten Ereignisse, Prämien, Online-Aktionen oder zugehörige Informationen sollten nicht als Empfehlung, Aufforderung oder Einladung zum Kauf, Verkauf, Handel oder anderweitigem Umgang mit Krypto-Assets betrachtet werden. Krypto-Assets sind sehr volatil und können zu Verlusten führen. Die Verfügbarkeit von WEEX Services, Produkten und zugehörigen Aktionen kann je nach Region unterschiedlich sein. Sie sind dafür verantwortlich sicherzustellen, dass Ihre Teilnahme mit geltenden lokalen Gesetzen und Vorschriften übereinstimmt.

Das könnte Ihnen auch gefallen

Inhalte

Neueste Coin-Listings auf WEEX

iconiconiconiconiconiconicon
Kundenservice:@weikecs
Geschäftliche Zusammenarbeit:@weikecs
Quant-Trading & MM:[email protected]
VIP-Programm:[email protected]