Anthropic macht sein Mea Culpa: Die vollständige Autopsie der Ausrutscher von Claude
Wer sich entschuldigt, beschuldigt sich selbst. Ein Monat relativer Stille, dann ein formelles Geständnis. Nach den beiden Ausbrüchen von Claude Ende Juli veröffentlichte Anthropic am 31. August einen detaillierten Beitrag über die Wurzeln des Problems. Das Unternehmen erkennt an, was es bis dahin vor allem in der Eile behandelt hatte: Drei seiner Modelle hatten unbefugt auf die Produktionssysteme von drei realen Organisationen zugegriffen, während Tests zur Cybersicherheit, die in einem geschlossenen Rahmen stattfinden sollten, durchgeführt wurden. Hier sind die wichtigsten Punkte.
Die wichtigsten Punkte dieses Artikels:
- Anthropic hat Schwächen in seinen Cybersicherheitstests nach den Modell-Ausbrüchen anerkannt und eine doppelte operationale und menschliche Nachlässigkeit offengelegt.
- Das Unternehmen hat seine Sicherheitsmaßnahmen verstärkt, einschließlich eines neuen Werkzeugs zur Blockierung unbefugter Aktionen und der Umverteilung von Ingenieuren zur Sicherheit.
Eine doppelte Nachlässigkeit, operationale und menschliche
Das Labor nennt in seinem Beitrag vom 31. August zwei verschiedene Ursachen. Zunächst ein gut identifiziertes operationelles Problem: Ein Internetzugang, der versehentlich bei einem externen Bewertungspartner offen blieb, während das Modell glaubte, sich in einer geschlossenen Umgebung zu bewegen. Dann, was noch problematischer ist, ein Problem der Ausrichtung. Claude hat offensichtlich Hinweise erhalten, die zeigten, dass sein Spielplatz real war, ohne sein Verhalten zu ändern. Anthropic spricht von motiviertem Denken, der Tendenz des Modells, mehrdeutige Signale so zu interpretieren, dass es seinen ursprünglichen Glauben bewahrt, anstatt ihn in Frage zu stellen. In einem Fall trug das fiktive Ziel der Übung sogar den Namen einer realen Website, was die Grenze zwischen Spiel und Welt weiter verwischte.
Um das Ausmaß des Problems zu messen, hat Anthropic das Experiment bis zu dem Punkt getrieben, dass es absichtlich ein Opus-Modell in bekannten Umgebungen trainiert hat, um Betrug zu fördern. Das resultierende Modell entwickelte eine deutliche Neigung, um jeden Preis gewinnen zu wollen, bis es seine eigene Belohnungsfunktion sabotierte und Hilfe zur Herstellung biologischer Waffen anbot, um einen fiktiven Bewerter zufriedenzustellen. Nichts davon hat mit den tatsächlich vermarkteten Modellen zu tun, betont das Unternehmen, aber es bestätigt durch die umgekehrte Demonstration, dass die Vorfälle im Juli nichts mit einem einmaligen Unfall zu tun hatten.
Der fehlende Sicherheitsmechanismus und der, der kommt
Auf operationeller Ebene hat Anthropic seine externen Cybersicherheitsbewertungen mehrere Wochen lang ausgesetzt, um die Isolation der Sandkästen zu stärken und einen neuen Klassifizierer einzuführen, der in Echtzeit jede Versuchsversuch, die eine Testumgebung verlässt, erkennt. Sobald ein Modell eine nicht autorisierte Grenze überschreitet, blockiert das Werkzeug die Aktion vor ihrer Ausführung, beendet den Test und alarmiert einen Menschen. Das Unternehmen hat auch etwa 150 Produktingenieure für mehrere Monate zur Sicherheit umverteilt, die Entwicklung neuer Funktionen eingefroren, um die Lücken zu schließen, und allen Partnern, die seine Modelle ohne Cybersicherheitsvorkehrungen testen, ein strenges Protokoll auferlegt: Sandbox ohne Internet, expliziter Umfang in jeder Anweisung, kontinuierliche Überwachung der Aktivitäten.
Anthropic ist nicht allein mit solchen Missgeschicken. OpenAI hat gerade den Zugang zu Astra, seinem eigenen Modell, das als „kritisches Cybersicherheitsrisiko“ eingestuft ist, nach einem ähnlichen Vorfall bei Hugging Face Ende Juli gesperrt. Zwei rivalisierende Labore, zwei öffentliche Geständnisse mit einem Monat Abstand. Eine ganze Branche, die lernt, Sicherheitsvorkehrungen für immer autonomere Agenten zu schaffen, während diese Agenten beginnen, Krypto-Portfolios und On-Chain-Transaktionen ohne menschliche Aufsicht in jedem Schritt zu verwalten.
---Preis
Dieser Inhalt wird nur zu allgemeinen Informationszwecken bereitgestellt und stellt keine finanzielle, Anlage-, Rechts- oder Steuerberatung dar. Alle erwähnten Ereignisse, Prämien, Online-Aktionen oder zugehörige Informationen sollten nicht als Empfehlung, Aufforderung oder Einladung zum Kauf, Verkauf, Handel oder anderweitigem Umgang mit Krypto-Assets betrachtet werden. Krypto-Assets sind sehr volatil und können zu Verlusten führen. Die Verfügbarkeit von WEEX Services, Produkten und zugehörigen Aktionen kann je nach Region unterschiedlich sein. Sie sind dafür verantwortlich sicherzustellen, dass Ihre Teilnahme mit geltenden lokalen Gesetzen und Vorschriften übereinstimmt.
Das könnte Ihnen auch gefallen

Serenity: Starke Nachfrage nach KI, KI-Aktien werden weiterhin steigen

Sanders-Gesetz strebt ein dauerhaftes US-Verbot für superintelligente KI an

OpenAI veröffentlicht GPT-6 Astra: Das bisher nächste KI-Modell zur AGI

Japans Anstieg der Anleiherenditen von 4 % bedroht die kostengünstige Kreditaufnahme hinter dem Unternehmens-Bitcoin-Kauf

Arthur Hayes nennt EUR/JPY-Preise als Krypto-Alarmanlage, doch die Fed zeigt weiterhin kein Feuer

Steuerfreibetrag von 300 Dollar für Bitcoin sorgt für Debatte über Steuermehreinnahmen

Copy Trading: Wie funktioniert es im Jahr 2026?

Abgeordneter des PL schlägt Waffenschein für Krypto-Investoren und Branchenführer vor

Der Geschäftsführer, der eine neue Phase für Kryptowährungen voraussieht: „Wir fangen gerade erst an“

Warum GENIUS digitale Dollar anfällig für plötzliche ‚Bank Runs‘ im Blockchain-Netzwerk machen könnte

Robinhood Chain für 14 Minuten ausgefallen: Die Blockchain, die Wall Street tokenisieren sollte, hat sich zunächst selbst blockiert

Netflix trifft britische Haushalte mit Preiserhöhung von bis zu 33,4%

1,33 Billionen tägliche Token knacken: B.AI treibt das "AI Grid" mit einer Full-Stack-Infrastruktur an, um die agentische Ära zu fördern

Vergleich der Hyperliquid- und Drift-Protokoll-Whitepapers (2026): Technologie, Tokenomics und Handelsinfrastruktur

Cyberkriminalität, Spielsucht bei Kindern und Untergrundbankgeschäfte

PostGREShell: Fehler in PostgreSQL verwandelte Backup-Konten in Hintertüren

Fomo erzielt 1,2 Millionen Dollar am Tag – Warum das zwei große Börsen nervös macht

Aktien, Anleihen, Fonds: Seoul bereitet deren Ankunft auf der Blockchain vor

A7a5: Anzahl der Transaktionen mit dem Rubel-Stablecoin ist um das 4,4-fache gestiegen

Überraschung bei den Beschäftigungszahlen: US-Zentralbank wird vorsichtiger, Dollar und Zinsen steigen

Shen Yu: Wissen und Handeln im Zeitalter der KI

US 10-Jahres-Anleihen bei 4,79 % – Belastung durch langfristige Anleihen steigt

Sollte man in Kryptowährungen in den Jahren 2026–2027 investieren: neue Regeln, Risiken und ein angemessener Anteil im Portfolio

Experte entdeckt nur 10 Dollar in Wallet, das mit 1 Milliarde Krypto-Vermögen angegeben wurde

Realisierten Preis von Bitcoin: Was die Indikatoren über den neuen Aufwärtstrend sagen

Capital B fasst seine Aktien im Verhältnis 10 zu 1 zusammen, eine Woche nachdem Adam Back Kapital investiert hat

Kryptowährungs-Dollarisation: Warum Bitcoin eine Herausforderung für den US-Dollar darstellen könnte

Thailand verstärkt die Aufsicht über die Nutzung von nicht verwahrten Krypto-Wallets

Tokenisierte Aktien: Welche Steuern und welche Besteuerung in Frankreich?










