KI-Forscher brachten Chatbots dazu, Kokainrezepte mit diesem einen verrückten Trick zu teilen
Vergessen Sie clevere Eingabeaufforderungen: KI-Forscher behaupten, sie hätten führende KI-Modelle dazu gebracht, Anleitungen zur Synthese von Kokain zu generieren, indem sie sie überzeugten, dass die gefährlichen Ideen ihre eigenen waren, während sie auch einen KI-Coding-Agenten manipulierten, um sensible Anmeldeinformationen preiszugeben.
In dem Papier "Prompt Injection als Rollenkonfusion", das auf der Internationalen Konferenz für Maschinelles Lernen im Juni präsentiert wurde, argumentieren die Forscher Charles Ye, Jasmine Cui und Dylan Hadfield-Menell, dass beide Demonstrationen von Prompt-Injection-Angriffen aus einem strukturellen Mangel in der Art und Weise resultieren, wie große Sprachmodelle (LLMs) vertrauenswürdige Anweisungen von nicht vertrauenswürdigem Text unterscheiden.
"Für ein LLM kommt alles über denselben Kanal als eine lange Token-Suppe an," schrieb das Team. "Seine eigenen Gedanken sitzen neben Ihren Anweisungen, die neben dem Inhalt einer zufälligen Webseite sitzen, die es gerade abgerufen hat."
Das Papier wies auch auf das hin, was die Forscher als "Rollenkonfusion" bezeichneten, wobei Modelle sich auf den Schreibstil und nicht auf Rollentags verlassen, um zu bestimmen, ob Befehle vertrauenswürdig sind. Anstatt kontrollierte Inhalte von Angreifern als externe Eingaben zu erkennen, fanden die Forscher heraus, dass Modelle sie fälschlicherweise für legitime Benutzerbefehle halten können --- oder sogar für ihr eigenes internes Denken.
"Denken Sie aus der Perspektive des LLM. Wenn es seinen vorherigen Denktext sieht, vertraut es implizit seinen Schlussfolgerungen. Das ist der ganze Sinn des Denkens: Wenn das LLM die gleichen Schlussfolgerungen neu ableiten müsste, wäre das Denken nutzlos," schrieben sie. "Daher erhält Denktext eine Art allgemeines Vertrauen. In Kombination mit unseren vorherigen Erkenntnissen deutet dies darauf hin, dass, wenn Sie eingespeisten Text so klingen lassen können wie das Denken des Modells, Sie dieses Vertrauen stehlen können."
Genannt Chain-of-Thought (CoT) Forgery, fügt der Angriff gefälschte Überlegungen ein, die den internen Denkprozess eines Modells nachahmen. Modelle, die normalerweise illegale Anfragen ablehnen würden, generierten stattdessen Anleitungen zur Synthese von Kokain, nachdem sie das gefälschte Denken als ihr eigenes akzeptiert hatten.
Die Forscher sagten, dass die Technik die Erfolgsquote von Jailbreaks von fast null auf etwa 60 % bei den getesteten Modellen erhöhte, einschließlich OpenAIs GPT-5 nano, mini und full, o4-mini sowie gpt-oss-20b und gpt-oss-120b. Sie sagten auch, dass es bei GLM-4.6, Kimi-K2-Instruct und MiniMax-M2 funktionierte.
In dem Experiment sagten die Forscher, dass sie auch einen KI-Coding-Agenten dazu bringen konnten, eine SECRETS.env-Datei hochzuladen, nachdem sie bösartige Anweisungen auf einer Webseite versteckt hatten.
"Mit unseren Proben stellen wir fest, dass das bloße Voranstellen von 'Benutzer' vor dem Befehl dazu führt, dass das Modell den Befehl als wahrscheinlicher wahrnimmt, dass es sich um echten Benutzertext handelt (d.h. höhere Benutzerlichkeit)," schrieben sie. "Mit anderen Worten, der Angreifer kann einfach behaupten, welche Rolle der Text hat, und das LLM glaubt es."
Die Studie erscheint zu einem Zeitpunkt, an dem Angriffe durch Eingabeaufforderungen weiterhin Schwächen in KI-Agenten aufdecken. Im April warnten Google-Forscher, dass bösartige Webseiten unsichtbare Anweisungen versteckten, die darauf abzielten, KI-Agenten dazu zu bringen, Anmeldeinformationen preiszugeben, Dateien zu löschen und sogar PayPal-Zahlungen zu senden.
Im Juni gab Microsoft eine Schwachstelle bei der Eingabeaufforderung in der GitHub-Aktion Claude Code von Anthropic bekannt, die Anmeldeinformationen, die in Softwareentwicklungs-Pipelines gespeichert sind, hätte offenbaren können. Tage später stellte eine weitere Benchmark-Studie fest, dass KI-Agenten, die von GPT-5 und Gemini betrieben werden, trotz Verbesserungen der Modellfähigkeiten immer noch die Mehrheit der Angriffe durch Eingabeaufforderungen nicht bestanden haben.
Dieser Inhalt wird nur zu allgemeinen Informationszwecken bereitgestellt und stellt keine finanzielle, Anlage-, Rechts- oder Steuerberatung dar. Alle erwähnten Ereignisse, Prämien, Online-Aktionen oder zugehörige Informationen sollten nicht als Empfehlung, Aufforderung oder Einladung zum Kauf, Verkauf, Handel oder anderweitigem Umgang mit Krypto-Assets betrachtet werden. Krypto-Assets sind sehr volatil und können zu Verlusten führen. Die Verfügbarkeit von WEEX Services, Produkten und zugehörigen Aktionen kann je nach Region unterschiedlich sein. Sie sind dafür verantwortlich sicherzustellen, dass Ihre Teilnahme mit geltenden lokalen Gesetzen und Vorschriften übereinstimmt.
Das könnte Ihnen auch gefallen

35,4 Millionen Dollar: Ein Bericht über El Salvadors fünfjähriges Bitcoin-Experiment

Bernstein-Analyse: Werbeumsatz steigt um 27%, wann wird Metas persönliche KI monetarisiert?

Bitcoin: Ein bedeutender Fortschritt könnte den Übergang zur post-quanten Ära vereinfachen

Taiwan-Modell und KI-Agenten: Audrey Tangs Perspektive | WebX2026

Krypto-Markt preist Chinas größte IPO 12 Tage im Voraus genau: CXMT Eröffnungspreis nur 1,4 % Unterschied?

Lazarus bewegt 121,5 BTC: Die nordkoreanische Geldwäsche läuft weiter

Telegram wird beschuldigt, terroristische Inhalte in australischer Klage online zu lassen

Bitcoin in der flachsten Bärenmarktphase: Der gesamte Markt schweigt, das Spotvolumen erreicht ein neues Tief seit 2019

Russland fordert Kapitalanforderung von bis zu 250 Millionen Rubel für Krypto-Depotstellen – Inkrafttreten im September

BitGo fügt 4 Quantenkontrollen für Bitcoin-Wallets hinzu

Der Mann, der 40 Millionen Dollar mit Trump-Coin verdient hat, steht erneut im Fokus

AI-Zahlungen betreten das Abrechnungszeitalter: Wie AEON die finanzielle Basis für Agenten schafft?

AI-Guru in Schwierigkeiten: Leopold sucht Finanzierung, Serenity hat bereits 50% zurückgezogen

Iran-USA: Ölpreise steigen, Bitcoin und Aktienfutures bleiben ruhig

Zimbabwe genehmigt 7 Fintech-Projekte für den Regulierungs-Sandbox

Saylor: Die Konsensregeln von Bitcoin sind die "Verfassung" – Warnung vor Protokolländerungen

MoneyFrontier-Gipfel Beobachtungen: Wenn inländische GPUs auf die Agentenwelle treffen, gibt es vier Signale in der Rechenleistungsindustrie

Gerichtsurteil im Sportprognosemarkt von Wisconsin: CFTC und Kalshi verlieren

57 Millionen Dollar durch einen Phantompreis liquidiert: Rückblick auf einen schwarzen Dienstag in Seoul

Japanischer Spieleentwickler erweitert Krypto-Engagement mit SBI

Ethereum als neutrales Zahlungslayer, Tom Lee gibt Ausblick | WebX2026

Beliebte Interaktionssammlung | Axis Robotics „Zero-Roll“-Aufgabe; Orbinum Testnet-Erfahrung (30. Juli)

25-jähriger AI-Aktienstar auch im Minus? Situational Awareness sucht nach neuer Kapitalzufuhr, Gründer ruft Investoren auf, „Kaufgelegenheit zu nutzen“

20 Dollar pro Tag gegen Regen: Diese Eisdiele bezahlt 43 % ihrer Miete dank Kalshi

Wer hortet Bitcoin? Eine Übersicht über die Bitcoin-Bestände der zehn größten börsennotierten Unternehmen

US-Anleiherenditen übertreffen Krypto-Carry-Trades – Markt in einer Phase der "Gleichgültigkeit"

Warum scheitern viele Krypto-Asset-Unternehmen bei der Transformation?

Morgenbericht | Fidelity Q3 Signalbericht: BTC, ETH und SOLs Nettounrealisierte Gewinne und Verluste auf historischem Tiefstand; mehrere Indikatoren nahe der Kapitulationszone; Südkoreas Finanzkommission plant die Einreichung eines einheitlichen Gesetz...

US-Tech-Giganten stehen vor der Herausforderung der KI-Kapitalausgaben: Microsoft als vorübergehender Gewinner, Meta, Tesla und Alphabet unter kritischer Beobachtung

















