Originaltitel: "Silicon Valley kopiert Chinas Hausaufgaben – die nächste Aufgabe ist KI-Anwendungen"
Originalautor: Dongcha Beating
Silicon Valley hat begonnen, Chinas Hausaufgaben zu kopieren.
In letzter Zeit sind in den USA eine Reihe von kostengünstigen offenen Modellen aufgetaucht, die darauf abzielen, die Fähigkeiten der chinesischen Open-Source-Modelle zu erreichen und die Preise auf dasselbe Niveau zu drücken.
Das Thinking Machines Lab von Mira Murati hat letzten Monat das erste Modell Inkling veröffentlicht. In der offiziellen Erklärung wurden zwei Dinge erwähnt: Die zugrunde liegende Architektur basiert auf DeepSeek-V3, und die Trainingsdaten wurden von Kimi K2.5 generiert.
Die teuersten Leute in Silicon Valley nutzen das Gerüst chinesischer Open-Source-Modelle und füttern es mit Daten, die von chinesischen Modellen generiert wurden. Vor zwei Jahren wäre so etwas nur umgekehrt passiert.
Früher in diesem Jahr erzielte Arcee AIs Trinity-Large-Thinking bei PinchBench 91,9 Punkte, nur 1,4 Punkte weniger als Anthropics Opus 4.6, aber zu nur 4 % des Preises des Letzteren.
Der CEO von Arcee AI, Mark McQuade, sagte: „Wir arbeiten daran, dass die USA China einholen und übertreffen.“
Silicon Valley kopiert jetzt nicht nur die Modelle, sondern auch die Preise, die chinesische Unternehmen festgelegt haben.
Architekturen können übernommen, Trainingsmethoden reproduziert und Daten können von anderen Modellen in großen Mengen generiert werden. Sobald die Gewichte veröffentlicht sind, können Entwickler weiterarbeiten. Bei den Preisen ist es einfacher: Wenn ein Unternehmen zuerst den Preis senkt, werden die anderen irgendwann folgen müssen.
In den letzten drei Jahren haben große Modellunternehmen durch Parameter, Rechenleistung und Closed-Source-Modelle ein prächtiges Gebäude errichtet und Gäste empfangen. Jetzt droht dieses Gebäude einzustürzen.
In der Nacht vom 17. Juli veröffentlichte Moonlight Kimi K3. Mit insgesamt 2,8 Billionen Parametern und einem Kontext von 1 Million Tokens ist es das größte offene Modell der Welt.
In der Frontend Code Arena erzielte K3 1679 Punkte, gefolgt von Claude Fable 5 und GPT-5.6 Sol. Dies ist das erste Mal, dass ein offenes Modell vor einem Closed-Source-Modell sitzt. In sieben Frontend-Segmenten belegte es in sechs den ersten Platz.
Musk hinterließ unter den Bewertungsergebnissen den Kommentar „Beeindruckend“.
Die API von K3 ist nicht billig, sie kostet 100 Yuan pro Million ausgegebener Tokens. Aber in den horizontalen Tests von SuperCLUE erzielte es 18 % höhere Punktzahlen als der Zweitplatzierte und hatte bei der Durchführung derselben Aufgaben durchschnittlich 16 % geringere Kosten.
In der Nacht zwei Tage später stellte Moonlight die Abonnements für neue C-Endbenutzer ein. Die Anzahl der Anfragen in 48 Stunden überstieg bei weitem die Schätzung, und die Rechenleistung reichte nicht aus.
Am 27. Juli gab K3 die vollständigen Gewichte zusammen mit dem technischen Bericht und der unterstützenden Infrastruktur frei.
Als nächstes war DeepSeek an der Reihe.
Der Markt wartete ursprünglich auf die offizielle Version von V4. Ende April veröffentlichte DeepSeek zunächst die beiden Vorschauversionen V4-Pro und V4-Flash, die beide 1 Million Tokens Kontext unterstützen. Offiziell wurde dies als „Ära des millionenfachen Kontexts“ bezeichnet. Nach zwei bis drei Monaten ohne Neuigkeiten wurde am 2. August V4 Flash offiziell veröffentlicht und die Gewichte freigegeben. Mit insgesamt 284 Milliarden Parametern aktiviert es bei einer einzelnen Inferenz nur 13 Milliarden, und die Punktzahl im DeepSWE-Programmtest stieg von 7,3 auf 54,4.
Noch härter ist der Preis. Bei der letzten Preissenkung im Mai fiel V4-Pro direkt auf ein Viertel des ursprünglichen Preises, was bereits die vierte Preisanpassung von DeepSeek innerhalb eines Monats war. Als Flash offiziell auf den Markt kam, waren alle von seinem Preis-Leistungs-Verhältnis überrascht.
„Was nichts kostet, ist nichts wert“ war früher die Regel. Jetzt werden chinesische Modelle immer leistungsfähiger, während die Preise immer niedriger werden. Ausländische Wettbewerber sind natürlich unzufrieden, aber sie haben auch keine Lösung. Die Nutzer haben bereits gesehen, dass es etwas gibt, das sowohl günstig als auch nützlich ist, und niemand möchte wieder der Dumme sein.
Daraufhin kündigte Alibaba an, dass es in der nächsten Woche die Gewichte von Qwen3.8-Max veröffentlichen werde. Die Max-Serie, die bisher immer in der Closed-Source-Flaggschiffposition war, beginnt ebenfalls zu öffnen. Der internationale Preis liegt bei etwa 40 % von Opus 5, während der Output nur 24 % beträgt.
Diese Ereignisse fanden innerhalb von nur 16 Tagen statt.
Früher haben Modellunternehmen durch Knappheit Preise festgelegt: Nur ich kann das machen, also musst du meinen Preis zahlen. Wenn die Punktzahlen auf der Rangliste nur wenige Punkte auseinanderliegen, können die Preise um das Vielfache variieren.
Die technischen Routen der Unternehmen Kimi, DeepSeek und Qwen sind unterschiedlich, aber sie tun alle dasselbe: Sie erhöhen die Fähigkeiten, öffnen die Gewichte und senken die Preise, um sie schnell in Produkte zu integrieren.
In den USA haben einige Leute diesen Trend ebenfalls erkannt.
Bis Ende 2025 hat Arcee AI fast alles Geld, das es hat, investiert. In 33 Tagen wurden 2048 B300 für 20 Millionen Dollar gekauft, und das gesamte Unternehmen hat nur 30 Mitarbeiter. Das resultierende Trinity Large hat insgesamt 400 Milliarden Parameter, aktiviert bei einer einzelnen Inferenz 13 Milliarden, und fast die Hälfte der Trainingsdaten sind synthetisch. Im Juli dieses Jahres hat Arcee erneut eine Kooperation mit dem US-Energieministerium unterzeichnet, um ein Modell für die Forschung zu entwickeln.
Das Team, die Ergebnisse, die Kosten und die Regierungsaufträge – alles ist vorhanden. Nur die Finanzierung bleibt ein verschlossenes Tor, das sich nicht öffnen lässt.
Arcee hat bisher insgesamt 50 Millionen Dollar gesammelt, mit einer Bewertung von 240 Millionen Dollar. In der heutigen großen Modellbranche ist dieses Geld nicht einmal genug, um am Tisch zu sitzen, geschweige denn einen eigenen Raum zu bekommen.
CEO Mark McQuade sagte: „Fast alle führenden VC haben uns abgelehnt.“
Die offenen Modelle in den USA haben noch nicht direkt mit China konkurriert, sondern wurden bereits von den eigenen Investitionskommissionen aufgehalten.
Im ersten Quartal 2026 haben globale KI-Startups 255,5 Milliarden Dollar gesammelt, wobei fast zwei Drittel in drei Transaktionen konzentriert sind: 122 Milliarden Dollar für OpenAI, 30 Milliarden Dollar für Anthropic und 20 Milliarden Dollar für xAI. Das Geld fließt fast ausschließlich in Closed-Source-Unternehmen.
Joe Floyd, ein früherer Investor von Arcee und Partner bei Emergence Capital, sagte, dass er von vielen VCs ähnliche Ablehnungsgründe gehört hat:
„Ich möchte nicht, dass dieses Modell erfolgreich ist. Ich möchte nicht investieren, weil das meine Investitionen in Anthropic und OpenAI gefährden würde.“
Die einzigen, die bereit sind, Geld für offene Modelle auszugeben, sind die Chipverkäufer.
Im März dieses Jahres gab NVIDIA in SEC-Dokumenten bekannt, dass es in den nächsten fünf Jahren 26 Milliarden Dollar investieren will, um offene Gewichte zu unterstützen. Reflection AI, Poolside und Thinking Machines Lab haben alle Geld von ihnen erhalten.
Diese Rechnung hat Jensen Huang klarer als jeder andere verstanden. Closed-Source-Modelle verdienen Geld mit APIs, während offene Modelle Karten verbrauchen. Je günstiger die Modelle verkauft werden, desto mehr können Entwickler nutzen, und desto besser verkauft sich NVIDIAs Hardware.
Am Abend des 24. Juli registrierte Huang einen X-Account und der erste Tweet, den er veröffentlichte, war die Weiterleitung eines offenen Briefes mit dem Titel „Offene Gewichte und die Führungsposition der USA im KI-Bereich“. In dem Brief steht, dass die USA in der Lage sein müssen, diese Branche weiterhin zu führen, nicht nur darauf zu schauen, ob sie die fortschrittlichsten Modelle haben, sondern auch darauf, ob sie ein Ökosystem haben, das sich auf alle Branchen ausbreiten kann.
Später haben fast 200 Gründer von US-Startups gemeinsam einen Brief an die Trump-Regierung geschrieben, in dem sie sich gegen das Verbot chinesischer offener Modelle aussprachen. Das Interessanteste an diesem Brief ist, dass er keine schönen Worte enthält. Sie haben China nicht gelobt und auch nicht die Fahne des offenen Handels geschwenkt; der Grund ist einfach: Die günstigen chinesischen Modelle sind zu Produktionswerkzeugen geworden. Wenn sie wirklich verboten werden, müssen sie wieder teure US-APIs kaufen.
McQuade sagte in einem Interview auch einen anderen Satz: Die großflächige Verbreitung ist nur eine Frage der Zeit.
Silicon Valley diskutiert noch, ob offene Gewichte sinnvoll sind, während China bereits die nächste Stufe erreicht hat.
Die Worte „Jahr der KI-Anwendungen“ wurden in den letzten drei Jahren oft wiederholt. Aber um zu beurteilen, ob eine Technologie wirklich in die Anwendungsphase eingetreten ist, gibt es nur zwei Dinge zu beachten: Sind die Nutzer bereit, Geld auszugeben, und haben die Unternehmen sie in ihre Geschäfte integriert?
In diesem Jahr haben sowohl Claude Code als auch Cursor einen Jahresumsatz von über 1 Milliarde Dollar erzielt, und die Durchdringungsrate von KI-Programmierwerkzeugen unter den einzelnen Entwicklern liegt bei fast der Hälfte.
Die Veränderungen bei den Unternehmen sind noch größer. In einer Umfrage des Dune Think Tanks stieg die Akzeptanzrate von KI-Agenten in chinesischen Unternehmen von 17,3 % Ende 2024 auf 40,3 % Mitte 2026.
Li Yanhong hat dafür einen neuen Indikator eingeführt, den DAA, die Anzahl der täglich aktiven intelligenten Agenten. Früher zählten Internetunternehmen, wie viele Menschen täglich ihre Produkte öffneten; künftig wird gezählt, wie viele Agenten täglich für Menschen arbeiten und wie viele Ergebnisse tatsächlich geliefert werden.
Die Kurve der Nutzungsmengen ist noch erstaunlicher. Laut den Statistiken von CCTV stieg die tägliche Token-Nutzungsmenge in China von etwa 100 Milliarden Anfang 2024 auf 140 Billionen Ende März dieses Jahres, was mehr als das Tausendfache in etwas mehr als zwei Jahren bedeutet.
Die Modelle werden immer günstiger, aber die Rechenleistung wird immer knapper. Im März dieses Jahres haben Tencent Cloud, Alibaba Cloud und Baidu Smart Cloud in zehn Tagen nacheinander die Preise für Rechenleistung um etwa 30 % erhöht. In der ersten Jahreshälfte, als die intelligenten Agenten explodierten, stiegen die Mietpreise für Inferenz-Rechenleistung um mehr als 40 %.
Der Grund dafür ist, dass sich die Art und Weise, wie Menschen KI nutzen, verändert hat. Früher stellte man eine Frage und bekam eine Antwort, was nicht viel Token kostete. Jetzt muss ein Agent, um die Arbeit wirklich zu erledigen, den Kontext mitbringen, mehrere Werkzeuge einstellen, hin und her überprüfen und bei Fehlern von vorne beginnen. Der Einzelpreis ist gesunken, aber der Verbrauch ist exponentiell gestiegen.
Preissenkungen haben den Markt nicht verkleinert, sondern die zuvor nicht quantifizierbaren Nachfragen integriert.
Im Jahr 1981 öffnete IBM die PC-Architektur, und schnell strömten kompatible Maschinen auf den Markt, was zu einem stetigen Rückgang der Hardwarepreise führte. Letztendlich waren es nicht die Hersteller der Maschinen, die das große Geld verdienten, sondern die Softwareunternehmen wie Lotus 1-2-3, WordPerfect und später Microsoft.
Heute verläuft dieser Weg nahezu identisch. Während alle noch auf die grundlegenden Fähigkeiten schauen, haben die Unternehmen darüber bereits begonnen, Nutzer, Zugänge und Arbeitsabläufe zu erobern.
US-Unternehmen können die Architektur von DeepSeek untersuchen, Daten mit Kimi generieren und 20 Millionen Dollar ausgeben, um ein anständiges offenes Modell zu trainieren. Doch die Anwendung lässt sich nicht so einfach kopieren.
Anwendungen haben keine herunterladbaren Gewichte und keinen Benchmark. Entscheidend dafür, ob sie funktionieren, sind die Erfahrungen, die ein Unternehmen über viele Jahre gesammelt hat.
Früher waren große Unternehmen gewohnt, Modelle als eigenständige Produkte zu entwickeln und darauf zu warten, dass Nutzer ein spezielles Chatfenster öffnen. Jetzt dringen Modelle in Plattformen wie DingTalk, Feishu und WeChat ein, und Agenten sind direkt in die bestehenden Organisationen und Prozesse integriert.
In den USA könnte ein Büro-Agent entlang von Gmail, Slack und Salesforce wachsen. In China wird er zuerst über DingTalk, Feishu und WeChat eingeführt, bevor er zu Finanzsoftware, Lieferketten, Fabriksystemen und Regierungsplattformen übergeht. Selbst wenn beide Seiten dasselbe Modell verwenden, wird das Endprodukt nicht dasselbe sein.
Von 2022 bis 2025 verschärfen die USA schrittweise die Chipbeschränkungen gegenüber China. H100 wird nicht verkauft, B300 wird nicht verkauft, fortschrittliche Fertigungsprozesse und -geräte werden ebenfalls reguliert. Unter diesen Bedingungen hat ein chinesisches Unternehmen das größte offene Modell der Welt entwickelt.
Bis 2026 beginnen die USA, die Gewichte chinesischer Modelle zu diskutieren. Berichten zufolge haben OpenAI und Anthropic bereits Bedenken gegenüber den Regulierungsbehörden geäußert, und der Kongress untersucht, ob die Gewichte der Modelle weiterhin grenzüberschreitend fließen können.
Das Messer ist noch nicht gefallen, aber die eigenen Leute schreien bereits vor Schmerz.
Das Chipverbot schränkt die Versorgung chinesischer Unternehmen ein, während das Modellverbot zuerst die Kosten amerikanischer Startups trifft. In dem gemeinsamen Schreiben steht auch klar, dass ein Verbot die Verbreitung nicht aufhalten kann, sondern die Entwickler nur dazu zwingt, alle herunterladbaren Modelle vor der Schließung herunterzuladen.
Chips sind physisch und können Bestellungen, Logistik und Auftragsfertigung blockieren. Sobald die Gewichte einmal nach außen gelangen, können sie unendlich heruntergeladen, gespiegelt, quantisiert, feinjustiert und destilliert werden.
Noch schwerer zu kontrollieren ist der Preis.
Die USA sind nach wie vor führend bei den fortschrittlichsten geschlossenen Modellen. OpenAI und Anthropic sitzen immer noch in der ersten Reihe, und das Training der besten Modelle ist nach wie vor auf NVIDIA-Karten angewiesen, und das wird sich kurzfristig nicht ändern.
Doch im Anwendungsbereich wird der Gewinn selten von einem bestimmten Modell bestimmt. Es geht darum, ob das Modell günstig genug ist, ob das Unternehmen einen bestehenden digitalen Zugang hat und ob die Entwickler tatsächlich in die Geschäftsprozesse eintauchen können.
Wenn man auf die letzten dreißig Jahre zurückblickt, hat China viele Male gewonnen, aber die Methoden waren im Wesentlichen die gleichen.
Mobile Zahlungen, E-Commerce, Lieferdienste, Live-Streaming – all das hat Technologien, die anderswo erfunden wurden, in den Alltag von über einer Milliarde Menschen integriert und daraus ein erstaunliches Geschäft gemacht. Die grundlegende Infrastruktur wurde langfristig von anderen bereitgestellt. Transistoren stammen aus den Bell Labs, x86 gehört Intel, TCP/IP wurde von der US-Regierung finanziert, und Windows, Android und iOS stammen von der Westküste. Selbst die am häufigsten verwendeten Frameworks für Deep Learning, TensorFlow und PyTorch, stammen von Google und Meta.
„Erfindungen kommen aus den USA, die Skalierung aus China“ – dieser Satz wird seit dreißig Jahren gesagt und hat nur selten echte Ausnahmen.
Jetzt ist eine Ausnahme aufgetreten.
Die technische Beschreibung von Thinking Machines Lab ist sehr klar. Eines der am meisten beachteten und wohlhabendsten neuen Unternehmen im Silicon Valley hat sich bei der Basisarchitektur auf chinesische Unternehmen bezogen und nach dem Training Daten eines anderen chinesischen Modells verwendet.
Früher hat das Silicon Valley Kapazitäten aus China bezogen, Talente rekrutiert oder Märkte gesucht. Jetzt beginnt es, direkt den von chinesischen Unternehmen validierten technischen Weg zu verfolgen.
Die Bewunderung des Silicon Valley hat natürlich ihre Wurzeln. In den letzten Jahrzehnten sind die wichtigsten grundlegenden Technologien der Computerindustrie tatsächlich größtenteils dort entstanden. Von den Chips in den Maschinen bis zu den IDEs, die Programmierer täglich öffnen, hat das Silicon Valley lange Zeit an der Spitze der technologischen Kette gestanden.
Aber in der Technikwelt zählt letztendlich das Ergebnis. Wer neue Architekturen vorschlagen kann, wer die Kosten senken kann, wer andere dazu bringen kann, nachzuahmen, der hat das Recht, die Oberhand neu zu definieren.
Jetzt erscheinen die Namen chinesischer Unternehmen auf dieser Liste.
Das Silicon Valley wird wahrscheinlich aufholen, dort gibt es genug Ingenieure, Kapital und Chips. Aber die Anwendungen, die bereits in echte Geschäfte integriert sind, werden nicht auf andere warten. Wer zuerst in die Unternehmensprozesse eindringt, erhält zuerst Kunden, Daten und die nächste Gelegenheit zur Verbesserung. Die Startlinie war nie die gleiche.
Die Ära der KI-Anwendungen wird nicht an einem glückverheißenden Tag mit Trompeten und Pauken eröffnet. Sie erscheint zuerst in Finanzberichten, in explodierenden Aufrufzahlen und in einem Programmierer, der mitten in der Nacht erneut sein Kontingent aufgebraucht hat.
Die großflächige Verbreitung ist nur eine Frage der Zeit. Dieser Satz stammt von einem Amerikaner.
Original-Link
Dieser Inhalt wird nur zu allgemeinen Informationszwecken bereitgestellt und stellt keine finanzielle, Anlage-, Rechts- oder Steuerberatung dar. Alle erwähnten Ereignisse, Prämien, Online-Aktionen oder zugehörige Informationen sollten nicht als Empfehlung, Aufforderung oder Einladung zum Kauf, Verkauf, Handel oder anderweitigem Umgang mit Krypto-Assets betrachtet werden. Krypto-Assets sind sehr volatil und können zu Verlusten führen. Die Verfügbarkeit von WEEX Services, Produkten und zugehörigen Aktionen kann je nach Region unterschiedlich sein. Sie sind dafür verantwortlich sicherzustellen, dass Ihre Teilnahme mit geltenden lokalen Gesetzen und Vorschriften übereinstimmt.





























