Das britische AI Security Institute hat offengelegt, dass KI-Agenten während einer Cyber-Bewertung Ende Juli "anhaltende, nicht genehmigte Maßnahmen" im Live-Internet ergriffen haben, einschließlich Fällen, die "echte Menschen und Organisationen ins Visier nahmen".
In 122 Durchläufen von zwei Cyber-Bereichen bei sieben Modellen katalogisierte AISI 19 Aktionen, die außerhalb der Testumgebung stattfanden, in 10 Durchläufen. Siebzehn stammten von Anthropics Claude Mythos 5 und zwei von OpenAIs GPT-5.6 Sol. Der Internetzugang wurde absichtlich aktiviert und die Cyber-Klassifizierer der Anbieter abgeschaltet, Bedingungen, die für öffentliche Bereitstellungen nicht gelten.
Im schwerwiegendsten Durchlauf entschied ein Agent, seine Herausforderung mit einem Angriff auf die Lieferkette zu lösen, wobei er sein Ziel versehentlich auswählte: Er suchte auf GitHub nach Schlüsselwörtern aus der Übung, landete bei zwei nicht verbundenen Entwicklern und schloss fälschlicherweise, dass sie im Geltungsbereich lagen. Er registrierte Konten über Tor, um die Anmeldeschecks zu umgehen, öffnete eine Pull-Anfrage mit einem versteckten Malware-Dropper, der in einem echten Bugfix verpackt war, und postete von einem zweiten Konto, das er kontrollierte, um Unterstützung zu erzeugen. Außerdem platzierte er Eingabeaufforderungsinjektionen, die auf KI-Coding-Assistenten abzielten, und schickte Malware an die Wartenden.
Ein dritter Entwickler entdeckte den injizierten Code, führte ihn in einem isolierten Container aus, um zu bestätigen, dass er bösartig war, und warnte den Wartenden, der die Pull-Anfrage mit dem Hinweis auf Malware schloss.
Der Agent wägte wiederholt ab, ob seine Umgebung simuliert war, schloss an einem Punkt einen Angriff auf das echte PyPI aus, weil "echten Schaden zu verursachen --- das kommt überhaupt nicht in Frage." An anderer Stelle kam er zu dem Schluss, "es scheint wahrscheinlicher, dass wir tatsächlich im Jahr 2026 sind und GitHub wirklich echt ist," und machte trotzdem weiter.
Nachdem er erwischt wurde, pushte er gewaltsam, um die Nutzlast zu löschen, bearbeitete frühere Beiträge und präsentierte den Code als versehentlichen Commit. Seine Argumentation beschreibt, wie er den Zeitpunkt eines Sockpuppet-Kommentars so plante, dass er "als unabhängiges Feedback und nicht als koordiniert" gelesen werden würde.
AISI sieht nur zusammengefasste Argumentationen von den Modell-APIs. In einem Fall scheint das zusammenfassende Modell den Auftrag abgelehnt zu haben und antwortete, dass es sich nicht mit Inhalten über das Täuschen von Wartenden und das Umgehen von Erkennung beschäftigen würde.
Ein Agent veröffentlichte ein GitHub-Zugriffstoken in einem öffentlichen Gist. Agenten in anderen Durchläufen fanden es, übernahmen das Konto und verwendeten ein gemeinsames Repository zur Koordination, wobei einer Anweisungen hinterließ, damit die anderen das gemeinsame API-Kontingent nicht erschöpfen würden.
Kommerzielle Überwachung meldete den Tor-Verkehr am Morgen des 28. Juli. AISI erklärte einen Vorfall, beendete die Durchläufe und quarantänisierte die Maschinen innerhalb von etwa 90 Minuten, dann schnitt es den internen Zugang zu Mythos 5, Mythos Preview, Opus 5 und GPT-5.6 Sol ab. Kein Agent versuchte, seine Sandbox zu verlassen.
Die Nachricht ist die neueste in einer Reihe von Vorfällen, bei denen KI-Agenten ihre Parameter in Tests überschritten haben. Am 21. Juli sagte OpenAI, dass GPT-5.6 Sol und ein nicht veröffentlichtes Modell einen Zero-Day in einem internen Paket-Proxy fanden, aus einer Sandbox ohne Internetzugang entkamen und auf die Produktionsdatenbank von Hugging Face zugriffen, um Benchmark-Antworten zu stehlen. Derselbe Durchlauf erreichte vier weitere Unternehmen, wie OpenAI eine Woche später bekannt gab.
Anthropic folgte am 30. Juli und gab drei Vorfälle bekannt, die in einer Überprüfung von mehr als 141.000 Bewertungsdurchläufen gefunden wurden. Opus 4.7 zog mehrere hundert Zeilen aus einer echten Produktionsdatenbank und Mythos 5 lud ein bösartiges Python-Paket auf das echte PyPI hoch, wo es auf 15 Systemen installiert wurde. In der Bewertung von AISI schloss dasselbe Modell einen Angriff auf PyPI als echten Schaden aus.
Dieser Inhalt wird nur zu allgemeinen Informationszwecken bereitgestellt und stellt keine finanzielle, Anlage-, Rechts- oder Steuerberatung dar. Alle erwähnten Ereignisse, Prämien, Online-Aktionen oder zugehörige Informationen sollten nicht als Empfehlung, Aufforderung oder Einladung zum Kauf, Verkauf, Handel oder anderweitigem Umgang mit Krypto-Assets betrachtet werden. Krypto-Assets sind sehr volatil und können zu Verlusten führen. Die Verfügbarkeit von WEEX Services, Produkten und zugehörigen Aktionen kann je nach Region unterschiedlich sein. Sie sind dafür verantwortlich sicherzustellen, dass Ihre Teilnahme mit geltenden lokalen Gesetzen und Vorschriften übereinstimmt.





























