In der letzten Nacht erlebte das Silicon Valley einen Kampf der KI-Titanen

By: mp.weixin.qq.com|2026/09/03 01:51:00

Autor: Max, 01 Gründer

Redakteur: Max

In der letzten Nacht fanden drei bedeutende Ereignisse im Silicon Valley statt.

Google veröffentlichte Gemini 3.8 Flash, Meta brachte Muse Spark 1.3 auf den Markt, und ein zuvor nicht erwähntes Start-up, Mostik, wurde in einem prominenten Interview mit WIRED vorgestellt.

Wenn wir nur die ersten beiden Ereignisse betrachten, scheint es sich um eine weitere gewöhnliche Nacht der KI-Rangkämpfe zu handeln.

Google hatte gerade Gemini an die Spitze der DeepSWE-Rangliste geschoben, und einige Stunden später kündigte Meta noch höhere Punktzahlen an, wobei der Titel des Weltführers nur wenige Stunden hielt.

Bis 2026 könnten die Menschen sogar gegenüber solchen Ereignissen abgestumpft sein.

Modellveröffentlichungen, Benchmark-Updates, Feiern auf X für ein paar Stunden und dann warten auf das nächste Unternehmen, das den Rekord bricht.

Wenn wir jedoch diese drei Ereignisse von letzter Nacht miteinander verbinden, glaube ich, dass der wirklich bemerkenswerte Aspekt völlig außerhalb dieser Ranglisten liegt.

Die Wirtschaft der KI befindet sich im Wandel.

In den letzten Jahren war die häufigste Zahl, die wir bei den Kosten für KI betrachteten, wie viel es pro Million Tokens kostet.

Aber mit dem Aufkommen von Agenten wird diese Messung zunehmend unzureichend.

Die wirklichen Fragen in der Zukunft könnten nicht sein: "Wie viel kostet eine Million Tokens?", sondern vielmehr, wie viel es kostet, einen Fehler zu beheben, eine Forschungsaufgabe abzuschließen oder einen Agenten drei Stunden lang kontinuierlich arbeiten zu lassen.

In der letzten Nacht fielen die Inferenzkosten gleichzeitig aus mehreren völlig unterschiedlichen Richtungen.

Google packt an der Frontlinie liegende Fähigkeiten in immer günstigere Modelle, Meta ermöglicht es Agenten, dieselben Aufgaben mit weniger Tokens und Toolaufrufen zu erledigen, und Mostik geht noch einen Schritt weiter, indem es fragt:

Wenn beide Parteien in der Kommunikation KI sind, warum müssen Modelle dann weiterhin mit Sprachen kommunizieren, die für Menschen entwickelt wurden?

TEIL 01, Gemini schlägt zurück

Zuerst schauen wir uns Google an.

Google veröffentlichte ihr brandneues Flaggschiffmodell, Gemini 3.8 Flash, das sie als ihr leistungsstärkstes Modell für Schlussfolgerungen und Programmierung bezeichnen.

Dies ist auch das dritte Update der Flash-Serie in sechs Wochen, von 3.6 über 3.7 bis jetzt 3.8.

Früher wurde Flash als sehr einfach wahrgenommen: schneller, günstiger, aber mit Fähigkeiten, die leicht unter denen der stärksten Modelle lagen.

Google ändert nun allmählich diese Definition.

Diesmal konzentrieren sich die Kernverbesserungen von 3.8 Flash auf langfristige Programmierung und agentenbasierte Arbeitsabläufe.

Auf dem DeepSWE v1.1, das die langfristigen Software-Engineering-Fähigkeiten von KI misst, erreichte es etwa 74%.

Der größte Unterschied zwischen DeepSWE und traditionellen Code-Benchmarks besteht darin, dass es nicht nur eine Algorithmusfrage an das Modell stellt; es platziert tatsächlich den Agenten in einem Code-Repository.

Das Modell muss das Problem verstehen, nach Code suchen, Dateien ändern, Tools aufrufen, Tests durchführen und nach Fehlern weiterhin nach Gründen suchen.

Eine vollständige Aufgabe kann Dutzende oder sogar Hunderte von Schritten umfassen.

In solchen Tests erreichte Gemini 3.8 Flash einmal die weltweite Nummer eins.

Claude Opus 5 erzielte ebenfalls etwa 74%, GPT-5.6 Sol etwa 73%, und das zuvor führende Fable 5 etwa 70%.

Wenn wir nur die Fähigkeiten betrachten, gibt es keinen signifikanten Unterschied zwischen diesen Top-Modellen.

Was wirklich alarmierend ist, ist eine andere Zahl: Geld.

Der API-Einführungspreis für Gemini 3.8 Flash bleibt bei 0,75 $ pro 1M Tokens für Eingaben und 3,75 $ pro 1M Tokens für Ausgaben.

Die Durchführung einer vollständigen Aufgabe auf DeepSWE kostet im Durchschnitt nur 2,36 $.

Im Vergleich dazu hat Claude Opus 5, das ebenfalls etwa 74% erzielte, durchschnittliche Kosten von 11,84 $ pro Aufgabe; GPT-5.6 Sol, das etwa 73% erzielte, kostet ebenfalls durchschnittlich etwa 6,46 $.

Das bedeutet, dass die Ausführungskosten für das gleiche Niveau an Software-Engineering-Fähigkeiten um ein Vielfaches variieren können.

Dies wird im Agentenzeitalter sehr wichtig sein.

Im Chatbot-Zeitalter ist es für gewöhnliche Benutzer kaum wahrnehmbar, ob eine Antwort ein paar Cent mehr oder weniger kostet.

Aber Agenten sind völlig anders; ein Programmieragent könnte 100 Schritte kontinuierlich ausführen, ein Forschungsagent könnte Dutzende von Webseiten durchsuchen und Hunderte von Seiten Material lesen, und in Zukunft könnten Agenten in Unternehmen sogar mehrere Stunden lang kontinuierlich arbeiten.

Google erwähnte sogar, dass 3.8 Flash aktiv "härter arbeiten" wird, wenn es mit komplexen Aufgaben konfrontiert wird, indem es mehr Schlussfolgerungen und Toolaufrufe durchführt.

Google reduzierte nicht das "Denken" des Modells, um Geld zu sparen; vielmehr kann es sich aufgrund der bereits günstigen Tokens leisten, längere Schleifen auszuführen.

Deshalb glaube ich, dass der wirklich wichtige Aspekt von 3.8 Flash nicht darin besteht, dass es erneut die weltweite Nummer eins beansprucht hat.

Stattdessen bringt es Fähigkeiten, die zuvor nur in den teuersten Frontmodellen verfügbar waren, in den Preisbereich von Flash.

TEIL 02, Meta schlägt drei Stunden und dreißig Minuten später zurück

Während Google die Veröffentlichung von Gemini 3.8 Flash feierte, machte Meta plötzlich eine Rückkehr.

Meta veröffentlichte unerwartet das Modell Muse Spark 1.3.

Laut der veröffentlichten Bewertung von Meta erreichte Muse Spark 1.3 eine Punktzahl von 75,4% auf DeepSWE v1.1.

Diese Zahl übertrifft Gemini 3.8 Flash, Claude Opus 5 und GPT-5.6 Sol.

Noch erstaunlicher ist, dass Muse Spark 1.2 in diesem Test nur etwa 55% erzielte.

Von 1.2 zu 1.3 verbesserte ein kleines Versionsupdate die Punktzahl direkt um etwa 20 Prozentpunkte.

Ich glaube jedoch, dass der wirklich bemerkenswerte Aspekt von Meta diesmal nicht nur die 75,4% sind.

Es gibt zwei weitere Zahlen: Die Toolaufrufe sanken um etwa 20%, und der Tokenverbrauch sank um etwa 25%.

Dieses Detail kann leicht übersehen werden, ist aber sehr nah an der wichtigsten Frage nach der tatsächlichen Kommerzialisierung von Agenten.

Einer der verschwenderischsten Aspekte eines Agenten ist oft nicht das normale Schlussfolgern, sondern das Abweichen vom Kurs.

Wenn beispielsweise ein Programmieragent die Anforderungen bei Schritt 20 missversteht, könnte er weiterhin fünf Dateien ändern, drei Runden Tests durchführen und eine große Menge Code durchsuchen, nur um später zu erkennen, dass er auf dem falschen Weg war und von vorne beginnen muss.

Dutzende von Toolaufrufen und Tausende von Tokens können auf diese Weise verschwendet werden.

Wenn ein Modell also Unklarheiten in Aufgaben früher erkennen, wissen kann, wann es nicht weiterkommt, und den Benutzer früher fragen kann, reduziert es effektiv die Kosten.

Viele der in Muse Spark 1.3 verstärkten Fähigkeiten gehören zu dieser Kategorie: Es kann mehrere Arbeitsabläufe gleichzeitig in langen Threads aufrechterhalten, proaktiv Fragen stellen, wenn es auf mehrdeutige Aufgaben stößt, Hilfe bei unlösbaren Problemen anfordern, vor irreversiblen Aktionen bestätigen und ist weniger wahrscheinlich, anfängliche Einschränkungen nach vielen Runden langer Aufgaben zu vergessen.

Meta begann sogar, das Bewusstsein des Modells für seine eigenen Fähigkeiten zu betonen: zu wissen, was es tun kann und was nicht.

Diese Fähigkeiten mögen in der Chatbot-Ära nicht so attraktiv erscheinen wie ein Anstieg von 20 Punkten im Benchmark, aber im Agentenzeitalter können sie direkt in Geld übersetzt werden.

Jedes Mal, wenn ein Agent einen Fehler vermeidet, ist das eine Optimierung des Schlussfolgerns.

Daher ändern sich die Metriken für den Wettbewerb unter großen Modellen stillschweigend, wenn man Google und Meta zusammen betrachtet.

In Zukunft könnten die Menschen weniger daran interessiert sein, "wie viel kostet eine Million Tokens" und mehr an einer anderen Zahl:

Wie viel kostet es, eine echte Aufgabe von Anfang bis Ende auszuführen?

TEIL 03, Mostik, ein disruptiver Durchbruch

Wenn Google und Meta weiterhin untersuchen, wie man Aufgaben mit günstigeren und weniger Tokens abschließen kann, beginnt Mostik, eine grundlegendere Frage zu stellen:

Warum müssen diese Tokens überhaupt existieren?

Mostik bedeutet "Brücke" auf Russisch.

CEO Sasha Malysheva ist der Hauptentwickler dieses Ansatzes, und sein Chefwissenschaftler ist Stanislav Smirnov, Professor an der Universität Genf und Fields-Medaillengewinner von 2010.

Sie versuchen, etwas zu tun, das einfach klingt, aber extrem schwierig ist: zwei KI-Modelle zu ermöglichen, ohne natürliche Sprache zu kommunizieren.

Heute funktionieren die überwiegende Mehrheit der Multi-Agent-Systeme so:

Modell A erhält einige Informationen, generiert Hunderte oder sogar Tausende von Tokens und drückt seine Schlussfolgerungen in natürlicher Sprache aus; Modell B liest dann all diesen Text, interpretiert ihn neu und baut seine interne Darstellung auf, bevor es mit dem Schlussfolgern fortfährt.

Das Problem ist jedoch, dass das, was in großen Modellen wirklich berechnet wird, nicht Chinesisch oder Englisch ist, sondern:

Hochdimensionale kontinuierliche mathematische Darstellungen.

Das ist so, als könnten zwei Computer Daten direkt übertragen, aber Computer A druckt die Datei zuerst auf Hunderte von Seiten und Computer B verwendet dann eine Kamera, um sie Seite für Seite wieder zu scannen.

In der Vergangenheit hat jeder untersucht, wie man die Druckkosten senken kann, während Mostik einfach den Drucker wegwerfen möchte.

Sie versuchen, eine Brücke zwischen den internen Darstellungen verschiedener Modelle zu bauen, die es den Modellen ermöglicht, latente Darstellungen direkt auszutauschen, anstatt zuerst natürliche Sprache zu generieren.

Ein interessantes Experiment, das von den autoritativen Silicon Valley-Medien WIRED veröffentlicht wurde, zeigt, dass Mostik die Vollversion von GLM-5.2 753B mit Qwen 3.5, das nur 4B hat und auf mobilen Geräten laufen kann, verbindet.

Das resultierende hybride System hat Fähigkeiten, die zwischen den beiden Modellen liegen, aber die Inferenzkosten betragen nur 1/20 der vollständigen GLM-5.2.

Natürlich ist es noch zu früh zu sagen, dass Mostik die Modellkommunikation gelöst hat.

Latente Kommunikation selbst ist kein neues Konzept; es gab in den letzten Jahren zahlreiche Studien, die versuchten, Einbettungen, verborgene Zustände, KV-Caches und andere interne Darstellungen auszutauschen.

Die echte Herausforderung besteht darin, dass verschiedene Modelle unterschiedliche Architekturen, Parameter, Trainingsdaten und interne Koordinatensysteme haben. Wie man zwei Modelle dazu bringt, den latenten Raum des anderen wirklich zu verstehen, ist selbst ein sehr schwieriges Problem.

Smirnov selbst gibt zu, dass es derzeit an einer ausgereiften mathematischen Sprache fehlt, um die gemeinsamen Darstellungen zwischen verschiedenen Modellen zu beschreiben.

Aber die 1/20-Zahl begeistert mich dennoch.

Denn sie lässt mich ernsthaft über eine völlig andere zukünftige KI-Architektur nachdenken.

TEIL 04: In der Zukunft benötigen Sie nur ein 0.xB-Modell

In den letzten zwei Jahren, in denen wir über Edge-KI diskutiert haben, haben wir untersucht, wie man größere Modelle in Mobiltelefone einpassen kann: 7B, 4B, 3B, 1B, kontinuierlich destillierend, quantisierend und komprimierend.

Aber wenn Mostiks Ansatz wirklich am Ende funktionieren kann, denke ich, dass zukünftige Telefone möglicherweise überhaupt kein "Alleskönner"-Großmodell benötigen.

Ihr Gerät könnte nur ein kleines Modell von 0.xB oder ein paar B ausführen.

Es wäre günstig, in der Lage, kontinuierlich zu laufen, verantwortlich für das Verständnis, in welcher App Sie sich gerade befinden, was Sie gerade getan haben, den Zustand des Geräts und die meisten einfachen, hochfrequenten Aufgaben zu erledigen.

Wenn wirklich schwierige Probleme auftreten, kann es über latente Raumkommunikation auf ein entferntes großes Modell zugreifen.

Aber der entscheidende Unterschied besteht darin, dass es nicht alle Kontexte von hunderttausend Tokens wie heute in die Cloud senden muss, sodass das entfernte Modell alles von Grund auf lesen kann.

Es müsste möglicherweise nur einen hochkomprimierten latenten Zustand übertragen.

Nachdem das entfernte große Modell komplexe Schlussfolgerungen abgeschlossen hat, muss es nicht unbedingt Tausende von Tokens natürlicher Sprache für das lokale Modell generieren, sondern kann direkt neue interne Darstellungen zurückgeben.

Auf diese Weise ist das lokale kleine Modell für hochfrequente, kostengünstige, kontinuierliche Operationen verantwortlich, während das Cloud-Frontmodell nur niedrighäufige, aber wirklich schwierige Schlussfolgerungen behandelt, wobei eine Art Brücke eine effiziente Kommunikation dazwischen ermöglicht.

Wenn dies in Zukunft wirklich erreicht werden kann, könnte die Reduzierung der Inferenzkosten weit über die aktuellen API-Preise hinausgehen, die um 30% oder 50% sinken.

Es könnte die Art und Weise verändern, wie wir KI-Berechnungen selbst organisieren.

TEIL 05: Fazit

Wenn wir also auf die letzte Nacht zurückblicken, gab es oberflächlich betrachtet drei völlig unterschiedliche Nachrichten.

Google veröffentlichte Gemini 3.8 Flash, das an der Frontlinie liegende Fähigkeiten in den Preisbereich von Flash komprimiert;

Meta veröffentlichte Muse Spark 1.3, das es Agenten ermöglicht, mehr mit weniger Tokens und Toolaufrufen zu erreichen;

Mostik ging noch einen Schritt weiter und versuchte, die Notwendigkeit zu beseitigen, dass einige Tokens von Anfang an zwischen Modellen generiert werden müssen.

Sie alle deuten auf dieselbe Veränderung hin:

Intelligenz wird in einem erstaunlichen Tempo günstiger.

Und dieser Preisrückgang betrifft nicht mehr nur den Einheitspreis von APIs.

Die Kosten für Modelle sinken, die Menge an Berechnungen, die erforderlich sind, um Aufgaben abzuschließen, sinkt, und jetzt wird sogar die Art und Weise, wie Modelle Informationen austauschen, neu gestaltet.

Die Auswirkungen, die dies letztendlich haben könnte, sind möglicherweise viel größer als nur ein paar Prozentpunkte Anstieg in Benchmarks.

Denn viele Technologien explodieren wirklich nicht, wenn sie "zum ersten Mal nutzbar sind", sondern wenn sie "günstig genug sind, um sie beiläufig zu nutzen".

Heute ist es für eine gewöhnliche Person möglicherweise überhaupt nicht kosteneffektiv, einen Agenten Dutzende von Dollar ausgeben zu lassen, um eine Aufgabe zu erledigen.

Wenn es in Zukunft nur ein paar Cent kostet, könnten viele Anwendungen, die derzeit völlig unpraktisch erscheinen, plötzlich machbar werden.

Heute können wir nicht haben, dass Dutzende von Agenten 24 Stunden am Tag um eine Person herumlaufen; wenn die Inferenzkosten um ein oder zwei Größenordnungen sinken, könnte dies der Standardzustand werden.

Es ist jetzt sieben Uhr morgens, und ich hätte vor ein paar Stunden ins Bett gehen sollen.

Aber nachdem Gemini veröffentlicht wurde, folgte Meta ein paar Stunden später, und dann sah ich Mostiks 1/20-Experiment.

Ich lag im Bett und dachte über diese Dinge nach, über das 0.xB-Modell in meinem Telefon, über das große Modell in der Cloud und darüber, wie sie möglicherweise nicht einmal mehr in natürlicher Sprache kommunizieren müssen.

Je mehr ich darüber nachdachte, desto schwerer fiel es mir zu schlafen, also stand ich auf und beendete diesen Artikel.

Geminis 74%, Muse's 75,4%, und in ein paar Tagen könnten neue Zahlen herauskommen, die sie in den Schatten stellen.

Aber ich finde es wirklich schwer, diese Aufregung zu beruhigen.

Denn im Vergleich dazu, wer wieder die Weltführerschaft übernommen hat, mache ich mir zunehmend Sorgen um eine andere Frage:

Wie günstig kann eine solche intelligente KI letztendlich werden?

Sobald mächtige Intelligenz günstig genug wird, um jederzeit abgerufen zu werden, glaube ich, dass viele KI-Produkte, die heute sehr verrückt erscheinen, gerade erst anfangen könnten.

---Preis

--
--
--

Dieser Inhalt wird nur zu allgemeinen Informationszwecken bereitgestellt und stellt keine finanzielle, Anlage-, Rechts- oder Steuerberatung dar. Alle erwähnten Ereignisse, Prämien, Online-Aktionen oder zugehörige Informationen sollten nicht als Empfehlung, Aufforderung oder Einladung zum Kauf, Verkauf, Handel oder anderweitigem Umgang mit Krypto-Assets betrachtet werden. Krypto-Assets sind sehr volatil und können zu Verlusten führen. Die Verfügbarkeit von WEEX Services, Produkten und zugehörigen Aktionen kann je nach Region unterschiedlich sein. Sie sind dafür verantwortlich sicherzustellen, dass Ihre Teilnahme mit geltenden lokalen Gesetzen und Vorschriften übereinstimmt.

Das könnte Ihnen auch gefallen

iconiconiconiconiconiconicon
Kundenservice:@weikecs
Geschäftliche Zusammenarbeit:@weikecs
Quant-Trading & MM:[email protected]
VIP-Programm:[email protected]