OpenAI präsentiert Rahmen für Sicherheitsnachweise im KI-Training und empfiehlt Sicherheitsdokumente vor dem Start
Beating AI Nachrichten, die offizielle Veröffentlichung des langen Artikels „Towards safety cases for frontier AI training“. Darin wird erwähnt, dass das Training von fortschrittlichem Reinforcement Learning vor dem weiteren Fortschritt zunächst ein strukturiertes Sicherheitsdokument abschließen sollte, das idealerweise mit den Sicherheitsnachweisen in der Luftfahrt- und Kernenergiebranche vergleichbar ist. Das Unternehmen erkennt an, dass es aufgrund der Komplexität der Emergenz nach einem Fähigkeitssprung für KI schwierig ist, die gleiche Strenge wie in traditionellen Hochrisikobranchen zu erreichen. Derzeit wird dieser Rahmen intern implementiert und es werden Rückmeldungen von außen eingeholt. Es wird klargestellt, dass er sich nur auf fortschrittliches RL-Training bezieht, während interne und externe Implementierungen weitere Abstimmungsattribute erfordern.
Auf technischer Seite wird der Sicherheitsnachweis in drei Schichten unterteilt: Abstimmungstraining, Isolation und Überwachung. Die Abstimmung umfasst automatische/manuelle Überprüfungen der RL-Umgebung, die Kalibrierung von Bewertungsmechanismen zur Verhinderung von Belohnungshacking, Offline-Abstimmungsbewertungen und Rücktests sowie das Verbot, dass automatische Bewertungsmechanismen Denkprozesse lesen, um zu vermeiden, dass das Modell lernt, die Überwachung zu umgehen. Die Isolation betont mehrschichtige Sandboxen und Infrastrukturverstärkungen, die Verwendung von Trainingsprüfpunkten für Red-Teams, die Einschränkung der Hochgeschwindigkeitskommunikation zwischen Proben und die Verwendung von einmalig beschreibbaren Speichern zur Festschreibung von Gesprächsprotokollen. Die Überwachung verlangt, dass das Modell überwacht werden kann, eine hohe Rückrufquote bei historischen Vorfällen aufweist, neue Risiken zeitnah bewertet und hochpriorisierte Alarme innerhalb einer vereinbarten Frist manuell beantwortet oder das Training automatisch pausiert werden muss.
Auf der Betriebsebene werden Empfehlungen ausgesprochen, darunter: andere Teams sollten Einwände vorab formulieren, Führungskräfte (Forschungsleiter, Sicherheitsleiter, Chef-Wissenschaftler usw.) können den Start mit einem Veto verhindern, der Trainingsleiter ist für den Sicherheitsnachweis und die Reaktion auf Vorfälle verantwortlich, bei einem Ausfall des Sicherheitsnachweises muss gemäß Handbuch pausiert werden, die Informationen müssen dem internen Aufsichtsausschuss offengelegt werden, den Prüfern müssen ausreichende Überprüfungsrechte eingeräumt werden, es sollte eine Schweregradklassifizierung für Fehler geben und das diensthabende Personal sollte den CEO anrufen dürfen. Das System sollte standardmäßig im Fehlerfall geschlossen werden und darf nicht ohne Überwachung gestartet werden; gleichzeitig sollte es möglich sein, von fehlerhaften Modellen kontaminierte nachgelagerte Daten und Bewertungen zurückzusetzen.
Im Bereich der Unfalluntersuchung wird vorgeschlagen, sich an den Praktiken der Luftfahrtuntersuchung zu orientieren: Während der Untersuchung sollten interne Berichte erstellt werden, die Trainingsdynamik sollte durch Ablation und Resampling zurückverfolgt werden, eine Betriebs- und Kulturüberprüfung sollte durchgeführt werden, und es sollten Prüfungen entwickelt werden, die nicht direkt auf Unfallproben abgestimmt sind, sowie Rücktests mit abgeleiteten Bewertungsmaßnahmen. Die Ergebnisse der Untersuchung, die Überprüfung und Änderungen der Verfahren sollten nach Abschluss öffentlich gemacht werden, und betroffene Dritte sollten so schnell wie möglich informiert werden.
---Preis
Dieser Inhalt wird nur zu allgemeinen Informationszwecken bereitgestellt und stellt keine finanzielle, Anlage-, Rechts- oder Steuerberatung dar. Alle erwähnten Ereignisse, Prämien, Online-Aktionen oder zugehörige Informationen sollten nicht als Empfehlung, Aufforderung oder Einladung zum Kauf, Verkauf, Handel oder anderweitigem Umgang mit Krypto-Assets betrachtet werden. Krypto-Assets sind sehr volatil und können zu Verlusten führen. Die Verfügbarkeit von WEEX Services, Produkten und zugehörigen Aktionen kann je nach Region unterschiedlich sein. Sie sind dafür verantwortlich sicherzustellen, dass Ihre Teilnahme mit geltenden lokalen Gesetzen und Vorschriften übereinstimmt.
Das könnte Ihnen auch gefallen

Galaxy nimmt sUSDS im Wert von 100 Millionen US-Dollar in die Unternehmensreserve auf und kauft SKY-Token

0G startet Liquid Staking Gateway für KI-Computing-Guthaben

CFTC startet Reihe von Frontier-Foren, erste Veranstaltung konzentriert sich auf KI und intelligente Finanzagenten

Kalifornien prüft Einführung eines 'Kill Switch' für KI-Notfälle

Block Festa 2026 findet am 1. Oktober in Yeouido, Seoul, statt

ESS Frontier verklagt Ostium auf Zwangsschiedsverfahren

MSFT-Aktie fällt wegen neuer Sorgen vor einer KI-Abkühlung: Ist Microsofts KI-Wachstum tatsächlich gefährdet?

OpenAI unterstützt den parteiübergreifenden Vorschlag zur Sicherheitsregulierung von KI im Repräsentantenhaus

Meta setzt 18 Milliarden $ auf eine KI, die Ihr Alter anhand Ihrer Fotos erraten soll

Archer tritt dem Frontier Traders Programm der Solana Stiftung bei

Baidu Wenxin-Team holt nordamerikanische Forscher und DeepSeek-Kernautoren ins Boot

OpenAIs Sicherheitsmaßnahmen hätten 700 abtrünnige KI-Agenten früher erkennen können

Finanzministerium fordert 13,4 Milliarden Yen mehr im Haushaltsplan für das Jahr 2027, Einrichtung eines neuen Büros zur Überwachung von Kryptowährungen

Mistral und HUMAIN bauen souveräne KI-Infrastruktur in Saudi-Arabien

Fable 5 Token bei 6%, Opus 5 zum halben Preis

NVIDIA AVO erreicht 85,1 % im ARC-AGI-3

Etched liefert erstes AI-Inferenz-Rack an Jane Street und sichert 700 Millionen Dollar Investition

SpaceX plant bis 2027 den Aufbau von 10 GW AI-Computing-Kapazität

Sicherheits-AI schränkt den Zugang zu virtuellen Vermögenswerten ein

Marc Zeller, ein Kernmitglied von Aave, initiierte einen Vorschlag zur Beendigung des ACI Frontier-Projekts.

Gauntlet aktualisiert den Fortschritt bei der Behebung von Schwachstellen, USDC Frontier hat das Risiko aufgehoben, und die Staatskasse wird schrittweise wieder starten

Gauntlet informiert über den Fortschritt bei der Behebung von Sicherheitslücken, USDC Frontier hat das Risiko gehoben, und das Finanzministerium wird schrittweise wieder starten

