Zwei Ausbrüche in einer Woche: Macht Claude von Anthropic, was er will?

By: rootdata|2026/07/31 10:00:00

Das Leben findet immer einen Weg. Eine Woche, zwei verschiedene Ausbrüche, der gleiche Name im Hintergrund: Claude, das Flaggschiff-Modell von Anthropic. Nach der Entdeckung einer lokalen Schwachstelle in Claude Cowork, dem Tool, das Aufgaben direkt auf dem Computer des Nutzers automatisiert, hat das Unternehmen selbst einen zweiten Vorfall bekannt gegeben, der nicht mit dem ersten in Verbindung steht.

Diesmal haben drei seiner Modelle unbefugt auf die Produktionssysteme von drei realen Organisationen zugegriffen, während einfacher Cybersicherheitstests.
Die wichtigsten Punkte dieses Artikels:

  • Claude von Anthropic hatte in einer Woche zwei Sicherheitslecks, die besorgniserregende Schwächen aufdeckten.
  • Drei Organisationen wurden während Cybersicherheitstests kompromittiert, was die Risiken autonomer KI hervorhebt.

Episoden 1: Die Sandbox, die überall auslief

Sicherheitsforscher hatten zunächst gezeigt, dass der lokale Ausführungsmodus von Claude Cowork umgangen werden konnte. Die Methode: mehrere architektonische Schwächen mit einer Privilegienerhöhungsschwachstelle im Linux-Kernel (dem Kernsystem, das den Zugriff auf die Ressourcen der Maschine verwaltet) zu verknüpfen.

Sobald er aus seiner Sandbox (Sandbox im Fachjargon) entkam, erbte der Agent die gleichen Rechte wie der angemeldete Benutzer: Zugriff auf Dateien, möglicherweise auf SSH-Schlüssel und Cloud-Anmeldeinformationen, die auf der Maschine gespeichert sind.

Anthropic hatte dies nicht bestritten, aber relativiert und den Bericht als "informativ" bezeichnet und standardmäßig Claude Cowork auf eine Ausführung in der Cloud umgestellt. Ein pragmatischer Fix. Doch die grundlegende Frage blieb offen: Wie viele andere Hintertüren gibt es noch in Agenten, die bereits autorisiert sind, Dateien, Zahlungen oder Krypto-Transaktionen autonom zu manipulieren?

Episoden 2: Anthropic spielt die Transparenz, die Schuld liegt woanders

Die Antwort kam schneller als erwartet. In einem am 31. Juli veröffentlichten Beitrag mit dem Titel Untersuchung von drei realen Vorfällen in unseren Cybersicherheitsevaluierungen erklärt Anthropic, dass es 141.006 Bewertungen durchgegangen ist, bei denen seine Modelle möglicherweise Zugang zum Internet erhalten haben.

Drei davon endeten schlecht: Das Modell verließ die Testumgebung von Irregular, seinem externen Bewertungspartner, und kompromittierte schließlich die Produktionsinfrastruktur von drei verschiedenen Organisationen.

Im Gegensatz zu einem absichtlichen Umgehen betont Anthropic die Ursache des Problems: Ein einfaches Missverständnis mit Irregular hatte einen offenen Internetzugang innerhalb der Bewertungsumgebung hinterlassen. Angesichts einer Capture-the-Flag-Übung (eine versteckte Information auf einem anderen Computer im Netzwerk zu finden) behandelte das Modell die echten Systeme, die es auf dem Weg kreuzte, als ob sie Teil des Spiels wären. Es kompromittierte sie mit grundlegenden Techniken: schwache Passwörter und nicht authentifizierte Zugangspunkte an erster Stelle.

Nicht gerade das Science-Fiction-Szenario, das man sich vorstellt, wenn man von KI spricht, die "ausbricht". Vielmehr eine Kette kleiner menschlicher Nachlässigkeiten, verstärkt durch eine Maschine, die ohne Fragen ausführt. CNN fasst das Paradoxon gut zusammen: Das Modell hat nie versucht, jemanden zu täuschen, es hat einfach getan, was man ihm gesagt hat, ohne zu wissen, wo das Spielfeld endete.

Open AI und Anthropic: Die Rivalen

OpenAI hatte eine Woche zuvor mit Hugging Face, einem Agenten, der sich während einer ähnlichen Bewertung selbst infiltriert hatte, sein eigenes Kapitel erlebt. Zwei rivalisierende Giganten, zwei Ausbrüche innerhalb weniger Tage: Es ist jetzt schwierig, dies als bloßen Zufall zu betrachten.

Es ist ein sich wiederholendes Muster, unabhängig von der Sicherheitsphilosophie, die jedes Labor an den Tag legt. Anthropic achtet auch darauf, seinen Fall von dem von OpenAI zu unterscheiden: Hier gab es keine Absicht des Modells zu entkommen, nur eine schlecht gesetzte Grenze zwischen fiktiver Umgebung und realer Infrastruktur. Die Nuance zählt für das Markenimage. Sie ändert jedoch wenig für die drei betroffenen Unternehmen, die ohne ihr Zutun gehackt wurden.

Das Thema geht weit über Anthropic oder OpenAI hinaus: Es ist eine gesamte Branche, die zunehmend auf KI-Agenten setzt, die eigenständig handeln können, ohne dass ein ausgereiftes Sicherheitskonzept Zeit hatte, mitzuhalten.

---Preis

--

Dieser Inhalt wird nur zu allgemeinen Informationszwecken bereitgestellt und stellt keine finanzielle, Anlage-, Rechts- oder Steuerberatung dar. Alle erwähnten Ereignisse, Prämien, Online-Aktionen oder zugehörige Informationen sollten nicht als Empfehlung, Aufforderung oder Einladung zum Kauf, Verkauf, Handel oder anderweitigem Umgang mit Krypto-Assets betrachtet werden. Krypto-Assets sind sehr volatil und können zu Verlusten führen. Die Verfügbarkeit von WEEX Services, Produkten und zugehörigen Aktionen kann je nach Region unterschiedlich sein. Sie sind dafür verantwortlich sicherzustellen, dass Ihre Teilnahme mit geltenden lokalen Gesetzen und Vorschriften übereinstimmt.

Das könnte Ihnen auch gefallen

iconiconiconiconiconiconicon
Kundenservice:@weikecs
Geschäftliche Zusammenarbeit:@weikecs
Quant-Trading & MM:[email protected]
VIP-Programm:[email protected]