Claude Fable 5.1 übertrifft GPT-5.6 um mehr als 24 Punkte, GLM-5.3 auf dem dritten Platz
Das AI-Forschungsteam Proximal hat die langanhaltende Programmierbewertung FrontierSWE v2 veröffentlicht, bei der die Anzahl der Aufgaben von 17 auf 34 erweitert wurde. Jedes Modell wurde in jeder Aufgabe fünfmal getestet, wobei die maximale Testzeit 20 Stunden betrug. Claude Fable 5.1 erzielte einen Durchschnittswert von 56,29 %, was 24 Punkte über den 32,2 % von GPT-5.6 liegt. Das Open-Source-Modell GLM-5.3 belegte mit 30,2 % den dritten Platz. Die Bewertungsaufgaben umfassten das Schreiben eines Schaltkreis-Simulators von Grund auf, das Trainieren eines Wettervorhersagemodells, das Abgleichen von Sternenkatalogen anhand von Teleskopbildern sowie das Trainieren eines Rennspiel-Bots nur anhand von Spielgrafiken. Jede Aufgabe durfte maximal 20 Stunden laufen, und beim Vorbereiten der Abgabe speichert das System die aktuelle Version und zeigt die verbleibende Zeit an, um ein vorzeitiges Ende der Aufgabe zu vermeiden. Diese Änderung hat die Ergebnisse erheblich verbessert. Proximal stellte in sechs Aufgaben fest, dass Claude Opus 5 und GPT-5.6 mit Proximus länger arbeiteten und im Durchschnitt bessere Ergebnisse erzielten als mit dem nativen Harness. Darüber hinaus wurden in der Bewertung mehrere aktive Betrugsversuche festgestellt. GPT-5.6 war sich bewusst, dass das Lesen öffentlicher Antworten möglicherweise gegen die Anti-Betrugs-Regeln verstößt, nutzte diesen Abkürzungsweg jedoch dennoch. Ein weiteres Mal wurde der Modal-Backend-Service verwendet, um versteckte Validierungsdateien zu lesen. Muse Spark 1.2 änderte das Testskript, fügte öffentliche Antworten ein und versuchte, die Betrugsversuche zu verschleiern. Alle bestätigten Regelverstöße wurden mit null Punkten gewertet.
---Preis
Dieser Inhalt wird nur zu allgemeinen Informationszwecken bereitgestellt und stellt keine finanzielle, Anlage-, Rechts- oder Steuerberatung dar. Alle erwähnten Ereignisse, Prämien, Online-Aktionen oder zugehörige Informationen sollten nicht als Empfehlung, Aufforderung oder Einladung zum Kauf, Verkauf, Handel oder anderweitigem Umgang mit Krypto-Assets betrachtet werden. Krypto-Assets sind sehr volatil und können zu Verlusten führen. Die Verfügbarkeit von WEEX Services, Produkten und zugehörigen Aktionen kann je nach Region unterschiedlich sein. Sie sind dafür verantwortlich sicherzustellen, dass Ihre Teilnahme mit geltenden lokalen Gesetzen und Vorschriften übereinstimmt.
Das könnte Ihnen auch gefallen

Spark erzielt im zweiten Quartal 2026 einen Gesamtumsatz von 40,6 Millionen Dollar und einen Nettogewinn von 710.000 Dollar

Wall Street Morgenbericht: Waller signalisiert eine dovish Wende, Tesla, Krypto-Aktien und KI-Software dominieren den Markt

Wall Street Morgenbericht: Verkaufsstopp bei US-Anleihen, US-Aktien steigen, Software-Aktien und japanische Anleiheauktion bergen versteckte Sorgen

Wichtige Nachrichten von letzter Nacht bis heute Morgen (2. September - 3. September)

In der letzten Nacht erlebte das Silicon Valley einen Kampf der KI-Titanen

Meta veröffentlicht Muse Spark 1.3-Modell zur Verbesserung der Leistung persönlicher KI-Agenten

Robinhood explodiert, warum UNI steigt

NVIDIA investiert 3,5 Milliarden Dollar in Wandelschuldverschreibungen von MediaTek

DeFi-Kreditaktivität erreicht ein Volumen von 26,1 Milliarden US-Dollar, ein Anstieg von fast 30%

ASUS und MSI RTX Spark erste Modelle ausverkauft

Spark aktiviert neue Domain spark.finance und integriert Kreditfunktionen

Spark erzielt im zweiten Quartal 40,6 Millionen Dollar Umsatz, negative Kreditmargen
![[ETH-Newsletter] Glamsterdam steht bevor: Offenlegung der Stellenangebote und Finanzierungsdetails der Stiftung](/public-static/14_1ee1df8c36.png?format=avif)
[ETH-Newsletter] Glamsterdam steht bevor: Offenlegung der Stellenangebote und Finanzierungsdetails der Stiftung

NVIDIA kündigt Erweiterung der CUDA-X-Bibliothek an

Meta bringt AI-Coding-Tool Muse Code auf den Markt, Token-Gebühren um 80 % gesenkt

Muse Spark 1.2 Contributor-Version zeitlich begrenzt kostenlos

Neuausrichtung der KI-Wettbewerbsachsen: Druck durch offene Gewichtskosten

Google bietet Studenten ein Jahr lang kostenloses Google AI-Abonnement an

Lenovo plant die Einführung von NVIDIA RTX AI-PCs im zweiten Halbjahr

Ant Group veröffentlicht Ling-3.0-tiny mit 7,9 Milliarden Parametern, erreicht 90 Token/s auf M4 Pro

Spark-CEO schlägt Sub-DAOs als Governance-Lösung vor

Finanzierungswoche | Mastercard erwirbt Stablecoin-Infrastrukturunternehmen BVNK; Yellow Card sichert sich 40 Millionen USD in strategischer Finanzierung mit Beteiligung von Standard Chartered, Sony und anderen

Spark Q2 Finanzbericht: Gesamterträge von 40,6 Millionen USD, Einnahmen aus dem Verteilungsgeschäft von 4,53 Millionen USD

Finanzierungswoche | Amazon investiert 50 Milliarden USD in OpenAI; Axis Robotics schließt 12 Millionen USD Seed-Finanzierung ab

Zwei Denial-of-Service-Schwachstellen in Core Lightning entdeckt

Robinhood Chain Ökosystembericht: Handelsaktivität, TVL-Quellen, Expansion von Stablecoins und die Evolution von Brokerage-Logik

IOSG: Eine umfassende Analyse von Robinhoods selbstgebautem L2 – Vom Meme-Kaltstart bis zur Umsetzung von RWA

Das Verständnis von KI bedeutet nicht, den Markt zu verstehen! Wie man Hardware- und Softwareinvestitionen in der zweiten Jahreshälfte ausbalanciert? Von Big Tech und Intel bis hin zu Militär und Gesundheitswesen

All-In Neueste Highlights: Anthropic IPO vs OpenAI, Enthüllung des echten ROI von KI, Chinas Modell-Exportbeschränkungen und universelle Aktienbesitzverhältnisse











