Meta entwickelt einen KI-Filter zur Auswahl von Experimenten vor dem GPU-Einsatz

By: www.diariobitcoin.com|2026/09/07 10:20:53

**Meta FAIR hat die AI Research Preference Models vorgestellt, ein System, das Experimente im maschinellen Lernen vor ihrer Ausführung klassifiziert, um den GPU-Verbrauch zu reduzieren. In Tests mit AIRS-Bench erhöhte das Tool die durchschnittliche Punktzahl von 0,684 auf 0,729 und erzielte vergleichbare Ergebnisse wie ein 24-stündiges Training in etwa 15 Stunden.


  • Die RPM vergleichen nicht ausgeführte Kandidaten und ermöglichen es dem Agenten, nur das vielversprechendste Experiment auszuwählen.
  • Die agentenbasierte Variante erreichte eine normalisierte durchschnittliche Punktzahl von 0,729 im Vergleich zu 0,684 ohne das System.
  • Beide Versionen erreichten das Ergebnis des 24-Stunden-Basismodells in etwa 15 Stunden Rechenzeit.

Die autonome Forschung mit künstlicher Intelligenz steht vor einem weniger auffälligen Problem als der Ideenfindungsprozess: deren Überprüfung kostet Zeit, Geld und Rechenkapazität. Ein Agent kann Dutzende von Modifikationen für ein maschinelles Lernmodell vorschlagen, aber jedes vollständige Training kann Stunden oder sogar Tage an GPU-Ressourcen verbrauchen, sodass die Vorauswahl eine der wichtigsten Entscheidungen im Prozess wird.

Ein Team von FAIR bei Meta, zusammen mit Forschern der Universität Oxford und des University College London, stellte die AI Research Preference Models, bekannt als RPM, vor. Das System versucht nicht, eine absolute Punktzahl vorherzusagen oder das endgültige Ergebnis eines Experiments genau zu prognostizieren, sondern ordnet noch nicht ausgeführte Kandidaten und wählt aus, welcher zuerst die kostspielige Trainingsphase durchlaufen sollte.

Ein Filter vor den Rechenkosten

Der Vorschlag basiert auf einer Einschränkung, die in Sprachmodellen festgestellt wurde: Obwohl sie über Pläne, Code und Suchhistorien nachdenken können, sind sie nicht zuverlässig, wenn es darum geht, direkt eine Ausführungsmetrik vorherzusagen. Daher nimmt das RPM eine engere Aufgabe an, indem es zwei Kandidaten vergleicht und entscheidet, welcher auf der Grundlage der verfügbaren Beweise vielversprechender erscheint.

Der Mechanismus wird in AIRA-dojo integriert, einer evolutionären Baum-Suchumgebung, die Eltern gierig auswählt und die Operatoren Draft, Improve und Debug verwendet. Anstatt ein Kind zu erzeugen, es auszuführen und den Prozess zu wiederholen, wendet der Agent einen Operator 15 Mal parallel an, sammelt die nicht getesteten Kandidaten und organisiert ein Ausscheidungsturnier durch paarweise Vergleiche.

Nur der Gewinner dieses Turniers gelangt in die Ausführungsphase, während jeder Vergleich Kontext von den erkundeten Knoten durch eine Breitensuche erhält. Dieser Kontext umfasst die vorherigen Experimente und die Validierungspunkte, die sie erzielt haben, Informationen, die dem Richter helfen, zwischen einer plausiblen Verbesserung, einer redundanten Variation und einem Fehler, der noch behoben werden kann, zu unterscheiden.

Der Ansatz verändert die zentrale Frage des Agenten. Anstatt ihn zu bitten, vorherzusagen, wie viel jede Vorschlag leisten wird, wird er gebeten zu bestimmen, welcher den nächsten Block an Ressourcen verbrauchen sollte, eine Entscheidung, die näher an der Bewertung ist, die Forscher vornehmen, wenn sie Hypothesen unter einem begrenzten Budget priorisieren müssen.

Zwei Versionen mit unterschiedlichen Kosten

Das Team bewertete eine Variante von RPM, die ausschließlich auf Inferenz basiert, und eine andere mit agentenbasierten Fähigkeiten. In der ersten Variante fungiert ein eingefrorenes Sprachmodell als Richter und prüft die Kandidatenpläne, den Code und die Suchhistorie, ohne zusätzliche Experimente durchzuführen, während eine optimierte Rubrik mit MIPROv2 von DSPy seine Entscheidungen leitet.

Diese Rubrik versucht, das Kriterium eines Hauptforschers nachzubilden: Sie toleriert korrigierbare Fehler, belohnt Ideen, die ausgedehnt werden können, und bestraft Richtungen, die bereits erkundete Arbeiten wiederholen. Die Offline-Genauigkeit dieser Version lag zwischen 57,7 % und 59,0 %, ein Hinweis darauf, dass die Auswahl im Vergleich zur Zufälligkeit verbessert wird, obwohl sie noch weit davon entfernt ist, ein perfektes Kriterium darzustellen.

Die agentenbasierte Version verwendet denselben Richter, ermöglicht jedoch das Arbeiten in einer isolierten Umgebung, die den Arbeitsbereich des Agenten klont und eine einzige H200 umfasst. Ihre Werkzeuge sind Python, Bash und submit_solution, mit denen sie Pilotversuche im kleinen Maßstab durchführt, bevor entschieden wird, ob es sinnvoll ist, in eine Richtung fortzufahren oder den Forschungszyklus zu beenden.

Das Design umfasst zwei Entscheidungen, die das Verhalten des Systems direkt beeinflussen. Um zu verhindern, dass es zu früh stoppt, wird das verbleibende Budget als 2.700 Sekunden angezeigt, obwohl die tatsächlich verfügbare Zeit 300 Sekunden beträgt, und die Piloten sind auf 30 mit einer Schwelle von 60 Sekunden begrenzt; außerdem greift der agentenbasierte Selektor nur in Draft und Improve ein, da Debug zu einer zufälligen Auswahl zurückkehrt, um die Uhr nicht mit zusätzlichen Bewertungen zu belasten.

Ergebnisse im Vergleich zur zufälligen Auswahl

Die Tests wurden in AIRS-Bench mit 20 öffentlichen Aufgaben zu Text und tabellarischen Daten durchgeführt, 24 Stunden Rechenzeit auf einer einzigen H200 pro Aufgabe und 10 Samen. Qwen3.6-27B fungierte sowohl für die Forschungsoperatoren als auch für das RPM als Rückgrat, eine Bedingung, die darauf abzielt, die Verbesserung der Auswahlschicht und nicht der Einbeziehung eines leistungsstärkeren Richters zuzuschreiben.

Die zufällige Auswahl, die als Referenz ohne RPM verwendet wurde, erzielte einen durchschnittlichen normalisierten Score von 0,684. Das ausschließlich auf Inferenz basierende Modell erhöhte diesen Wert auf 0,711, während die agentenbasierte Version 0,729 erreichte; die berechneten Höchstwerte mit einem Validierungsorakel und einem Testorakel lagen bei 0,748 bzw. 0,759.

Der Unterschied zeigte sich auch in der Geschwindigkeit, um das Ergebnis des Basis-Modells zu erreichen. Die Inferenzvariante erreichte den Endscore von 0,684 in 14,88 Stunden, was einer Beschleunigung um das 1,61-Fache entspricht, und das agentenbasierte System erreichte dies in 15,50 Stunden, mit einer Verbesserung um das 1,55-Fache im Vergleich zu den 24 Stunden Referenzzeit.

Der Vorteil beseitigt nicht alle Kosten: Die selbstgehostete Inferenz fügt 0,660 Stunden pro Ausführung hinzu. Nach Anpassung dieser Zeit lag die gemeldete Leistung für die entsprechende Version bei 0,708 nach 23,34 Stunden, was zeigt, dass der praktische Vorteil sowohl von der Qualität des Filters als auch von der Effizienz der Infrastruktur abhängt, die ihn ausführt.

Hervorzuhebende Ergebnisse und Grenzen des Vorschlags

Der Bericht schreibt zwei neue Referenzergebnisse den RPM-Varianten zu. In WinoGrande erreichte das agentenbasierte System 94,1 %, über den 90,4 %, die einem vorherigen agentenbasierten System namens AIRA₂ zugeschrieben wurden, während die ausschließlich auf Inferenz basierende Version 95,7 % in SVAMP erzielte, im Vergleich zu einem vorherigen menschlichen Ergebnis von 94,2 %.

Diese Zahlen bedeuten nicht, dass der Selektor die experimentelle Bewertung ersetzen kann, da das RPM weiterhin den gewählten Kandidaten ausführen und seine Leistung überprüfen muss. Sein Beitrag besteht darin, die Anzahl der Vorschläge zu reduzieren, die in diese Phase gelangen, ein wichtiger Unterschied in Szenarien, in denen die GPU-Kapazität bestimmt, wie viele Hypothesen ein Team erkunden kann.

Die Architektur zeigt auch, dass die Autonomie nicht nur davon abhängt, dem Agenten mehr Werkzeuge zur Verfügung zu stellen. Die Leistung verbessert sich, wenn das System das Budget organisiert, den Kontext vorheriger Tests bewahrt und Alternativen vergleicht, bevor Ressourcen gebunden werden, obwohl Designentscheidungen wie das überschätzte Budget und die Rückkehr von Debug zur Zufälligkeit noch experimentelle Kompromisse offenbaren.

Der Vorschlag ist teilweise umsetzbar: AIRA-dojo und AIRS-Bench sind Open Source, die verwendeten LLMs bleiben eingefroren und Qwen3.6-27B hat offene Gewichte. Der Einsatz einer H200, die Kosten der selbstgehosteten Inferenz und die Abhängigkeit von kurzen Piloten deuten jedoch darauf hin, dass die Übertragung dieser Ergebnisse auf andere Umgebungen eine unabhängige Messung von Infrastruktur, Aufgaben und Budgets erfordert.

MarkTechPost berichtete, dass die Arbeit von FAIR bei Meta in Zusammenarbeit mit der Universität Oxford und dem University College London entwickelt wurde und die RPM als Priorisierungsschicht für KI-Forschungsagenten präsentierte. Das relevanteste Ergebnis, über eine punktuelle Zahl hinaus, ist die Möglichkeit, die Auswahl von Experimenten zu einem expliziten Bestandteil des maschinellen Lernzyklus zu machen, anstatt sie der zufälligen Generierung oder der Intuition des Agenten zu überlassen.

Die Veröffentlichung wies auch darauf hin, dass die geschätzte Wahrscheinlichkeit der Verbesserung im Vergleich zur Konfiguration ohne RPM bei 0,5923 für die Inferenzvariante und 0,5913 für die agentenbasierte Variante lag, mit unteren Grenzen des 95%-Konfidenzintervalls von 0,5066 und 0,5018. Diese Daten deuten auf einen moderaten statistischen Vorteil hin und empfehlen, die Ergebnisse als vielversprechende Hinweise zu interpretieren, nicht als Garantie dafür, dass die Methode bei jedem Forschungsproblem gleich funktioniert.

Für Teams, die Modelle mit begrenzten Budgets trainieren, liegt der Reiz darin, mit den gleichen verfügbaren Stunden mehr nützliche Erkundungen zu erhalten. Die Idee muss sich jedoch noch in weiteren Aufgaben und Konfigurationen bewähren, bietet aber eine konkrete Antwort auf eine wachsende Spannung: Die Agenten können Experimente immer schneller generieren, während die Fähigkeit, diese durchzuführen, weiterhin begrenzt und kostspielig ist.

---Preis

--
--
--

Dieser Inhalt wird nur zu allgemeinen Informationszwecken bereitgestellt und stellt keine finanzielle, Anlage-, Rechts- oder Steuerberatung dar. Alle erwähnten Ereignisse, Prämien, Online-Aktionen oder zugehörige Informationen sollten nicht als Empfehlung, Aufforderung oder Einladung zum Kauf, Verkauf, Handel oder anderweitigem Umgang mit Krypto-Assets betrachtet werden. Krypto-Assets sind sehr volatil und können zu Verlusten führen. Die Verfügbarkeit von WEEX Services, Produkten und zugehörigen Aktionen kann je nach Region unterschiedlich sein. Sie sind dafür verantwortlich sicherzustellen, dass Ihre Teilnahme mit geltenden lokalen Gesetzen und Vorschriften übereinstimmt.

Das könnte Ihnen auch gefallen

iconiconiconiconiconiconicon
Kundenservice:@weikecs
Geschäftliche Zusammenarbeit:@weikecs
Quant-Trading & MM:[email protected]
VIP-Programm:[email protected]