Bernstein kommentiert sieben große Speicher: Nach HBM kämpfen DRAM und NAND um den nächsten Billionenmarkt

By: www.theblockbeats.info|2026/08/31 07:21:44

TL;DR ·Die Nachfrage nach Speicher durch KI beschränkt sich nicht nur auf HBM. Das Training erfordert ein vollständiges Speichersystem, das von HBM über System-DRAM bis hin zu SSDs und gemeinsam genutztem Speicher reicht. ·Der wahre Engpass beim Inferenzprozess tritt in der Dekodierungsphase auf. Der KV-Cache wächst mit der Kontextlänge und der Anzahl der gleichzeitigen Benutzer, sodass der Speicherbedarf möglicherweise früher als das Modellgewicht die kommerzielle Skalierung einschränkt. ·Agenten verstärken den Speicherbedarf weiter. Mehrstufige Aufrufe erzeugen wiederholt Kontext, rufen externe Werkzeuge auf und erhöhen den Bedarf an CPU, DRAM und KV-Cache. ·Es entstehen mehrere neue Ebenen zwischen HBM und traditionellen SSDs, einschließlich CXL, „Storage Next“ und CMX, die alle darauf abzielen, die ständig wachsenden Inferenzdaten zu geringeren Kosten zu bewältigen. ·Neue Technologierouten sind nicht alle umsetzbar. HBF, zHBM, NVHBM, ZAM und PIM stehen jeweils vor Herausforderungen wie Wärmeabfuhr, Ausbeute, ökologische Kompatibilität oder Umverteilung von Lieferketteninteressen. ·Bernstein bleibt optimistisch gegenüber Samsung Electronics, SK Hynix, Micron, SanDisk, Seagate und Western Digital und bewertet Kioxia mit „Underperform“.


In den letzten zwei Jahren drehte sich die Marktnarrative für KI-Speicher fast ausschließlich um HBM. Doch mit dem Übergang von großen Modellen vom Training zur großflächigen Inferenz reicht es nicht mehr aus, einfach nur HBM zu erhöhen.
In dem neuesten globalen Speicherbericht von Bernstein wird darauf hingewiesen, dass die Anforderungen an den Speicher je nach KI-Arbeitslast deutlich variieren: Das Training betont Rechenleistung und Bandbreite, während die Dekodierungsphase in der Inferenz stärker auf Kapazität angewiesen ist. RAG benötigt große Datenbanken, während Arbeitsabläufe von Agenten sowohl die Last traditioneller Server als auch von KI-Servern erhöhen.
Das bedeutet, dass die Veränderungen, die durch KI hervorgerufen werden, von HBM auf System-DRAM, SSDs, HDDs und sogar Bandlaufwerke übergreifen. Rund um die „Speicherwand“ beginnt die Industrie, neue Produkte zwischen den bestehenden Ebenen einzufügen, in der Hoffnung, ein neues Gleichgewicht zwischen Leistung, Kapazität und Kosten zu finden.
Die Obergrenze der Inferenzskala könnte vom KV-Cache abhängen ======================
In der Trainingsphase großer Modelle spielen GPUs und HBM nach wie vor eine zentrale Rolle.
Das Training erfordert häufiges Lesen von Modellparametern und Zwischeninformationen, was hohe Anforderungen an Rechenleistung und Speicherbandbreite stellt. Aber das Training eines großen Modells hängt nicht nur von HBM ab: Die Rohdatensätze müssen in kostengünstigeren Speichermedien aufbewahrt werden; bevor die Daten in die GPU gelangen, müssen sie normalerweise von System-DRAM und lokalen SSDs zwischengespeichert und vorverarbeitet werden; das Training, das Wochen oder sogar Monate dauert, muss regelmäßig Checkpoints speichern, um zu verhindern, dass Hardware- oder Softwarefehler die Aufgabe von vorne beginnen lassen.
Daher erfordert ein großes Training tatsächlich ein vollständiges System von HBM, System-DRAM bis hin zu lokalen SSDs und Netzwerkspeicher.
Nach dem Eintritt in die Inferenzphase differenzieren sich die Speicheranforderungen weiter.
Die Inferenz kann normalerweise in zwei Phasen unterteilt werden: Vorbefüllung (Prefill) und Dekodierung (Decode). Die Vorbefüllung ist dafür verantwortlich, Benutzereingaben zu verarbeiten und das erste Token zu generieren, wobei hauptsächlich großflächige Matrixoperationen ausgeführt werden, die eher „rechenleistungsbeschränkt“ sind. In dieser Phase sind die GPU-Auslastung und die HBM-Bandbreite wichtiger, wobei ein häufig verwendeter Indikator die Latenz des ersten Tokens ist.
Die Dekodierungsphase ist jedoch anders. Das Modell muss Token einzeln generieren und bei der Generierung neuer Token auf zuvor erzeugte Informationen zugreifen. Um Wiederholungsberechnungen zu vermeiden, speichert das System diese Daten normalerweise im KV-Cache.
Der KV-Cache hat zwei wichtige Merkmale: Seine Kapazität wächst linear mit der Kontextlänge, und jeder Benutzer benötigt einen eigenen Cache. Daher werden bei längeren Kontexten und einer erhöhten Anzahl gleichzeitiger Benutzer beide Faktoren den Speicherbedarf erhöhen.
Bernstein ist der Ansicht, dass im Rahmen großflächiger KI-Implementierungen der Speicherbedarf des KV-Caches das Modellgewicht übersteigen könnte und somit der Hauptfaktor wird, der die Anzahl gleichzeitiger Benutzer und das Kontextfenster einschränkt. Wie viele Benutzer das Modell bedienen kann und wie lange der Kontext aufrechterhalten werden kann, wird letztendlich direkt die Einkommensgröße beeinflussen.
In diesem Sinne liegt der Wettbewerb im Zeitalter der Inferenz nicht nur darin, wie viele Berechnungen der Chip durchführen kann, sondern auch darin, wie das System die ständig wachsenden Kontexte zu möglichst geringen Kosten speichern und abrufen kann.
RAG und Agenten treiben die Nachfrage in Richtung traditionellen Speicher =====================
Die Verbreitung von RAG und Agenten hat die Speicheranforderungen von KI weiter über HBM hinaus verbreitet.
RAG umfasst hauptsächlich zwei Phasen: den Aufbau von Datenbanken und die Datenbankabfrage. Beim Aufbau einer Datenbank muss das System eine große Menge an unstrukturierten Daten wie PDFs, Webseiten und Code verarbeiten und diese in durchsuchbare Vektoren und Indizes umwandeln. Dieser Prozess ist stärker auf große SSDs und System-DRAM angewiesen, während die Rolle von HBM relativ begrenzt ist.
Nach der Erstellung der Datenbank wird die Benutzerabfrage zunächst in einen Vektor umgewandelt und dann mit den Inhalten in der Datenbank abgeglichen. Die Vektorgenerierung kann schnell in GPUs und HBM erfolgen, aber die eigentliche Suche ist normalerweise stärker auf System-DRAM angewiesen. Die Suchergebnisse werden dann mit der Benutzerfrage kombiniert und in den normalen Vorbefüllungs- und Dekodierungsprozess integriert.
Die Arbeitslast von Agenten ist noch schwerer.
Traditionelle Dialoge bestehen normalerweise aus einem einmaligen Aufruf „Eingabe---Modell---Ausgabe“, während Agenten das Ziel in mehrere Schritte aufteilen, andere Modelle oder externe Werkzeuge aufrufen, Zwischenresultate speichern und basierend auf Feedback neu planen müssen. Jedes Ergebnis eines Aufrufs kann auch die Eingabe für den nächsten Modellaufruf werden.
Dies erhöht gleichzeitig zwei Arten von Anforderungen: Einerseits benötigen Werkzeugaufrufe und nicht-KI-Aufgaben mehr CPU und Systemspeicher; andererseits wird der Kontext, der zwischen mehreren Modellen ständig übertragen wird, die Vorbefüllung, Dekodierung und den KV-Cache-Bedarf schnell erhöhen.
Daher wird die Entwicklung von Agentenanwendungen nicht nur GPU und HBM zugutekommen, sondern auch die Nachfrage nach Server-DRAM, Unternehmens-SSDs und kostengünstigeren Speichermedien ankurbeln.
Zwischen HBM und SSD entstehen neue Speicherhierarchien =======================
Das Speichersystem traditioneller Server kann grob in Prozessor-internen Cache, System-DRAM, lokale SSDs und gemeinsam genutzten Speicher unterteilt werden. KI-Server haben HBM in diese Struktur eingefügt, aber die Kapazität von HBM ist begrenzt und die Kosten sind hoch, sodass es schwierig ist, alle Daten zu tragen.
Derzeit ist die Lösung der Industrie, neue Produkte zwischen verschiedenen Ebenen einzufügen.
CXL versucht, physisch verteilten Speicher in einen gemeinsamen Ressourcenpool zu integrieren, sodass CPU, GPU und Erweiterungsgeräte flexibler auf DRAM zugreifen können. Einige Produkte verwenden DRAM oder SRAM als Cache in Kombination mit NAND, um die Kosten zu senken und gleichzeitig die Zugriffsverzögerung zu verkürzen.
„Storage Next“, das von Nvidia vorangetrieben wird, versucht, einen Teil des Speichermanagements von der CPU auf die GPU zu verlagern und NAND eine Latenz, IOPS und Datenzugriffsgranularität näher an DRAM zu ermöglichen. Die GP-Serie SSD von Kioxia, die auf XL-FLASH basiert, ist ein Beispiel für diese Richtung.
CMX richtet sich hauptsächlich an den KV-Cache. Es platziert SSDs in unabhängigen Datenknoten und verbindet sie über DPU, Ethernet und Switch-Chips mit den Rechenknoten. Ziel ist es, den Inferenzkontext zwischen verschiedenen GPUs zu teilen, die redundante Speicherung zu reduzieren und gleichzeitig die Speicherkapazitätsgrenze eines einzelnen Servers zu überwinden.
Diese Lösungen weisen alle auf denselben Trend hin: KI-Systeme können nicht alle aktiven Daten langfristig in HBM speichern, sondern müssen sie entsprechend der Zugriffsfrequenz und den Anforderungen an die Latenz auf verschiedene Ebenen verteilen.
Heiße Daten bleiben in HBM, ein Teil des Kontexts wird auf System-DRAM oder Hochleistungs-SSDs verschoben, während kühlere Daten weiterhin auf normale SSDs, HDDs oder sogar Bandlaufwerke sinken. Je feiner die Speicherhierarchie, desto wahrscheinlicher ist es, dass das System ein Gleichgewicht zwischen Leistung und Kosten erreicht.
Neue Technologien erscheinen in dichter Folge, aber die Kommerzialisierung bleibt unsicher ==================
Rund um die „Speicherwand“ hat die Industrie mehrere neue Routen vorgeschlagen.
Der zHBM-Plan von Samsung wird HBM über dem Prozessor stapeln, um die Datenübertragungsdistanz weiter zu verkürzen. Dieses Design muss jedoch die von GPUs erzeugte Wärme bewältigen und stellt höhere Anforderungen an die Ausbeute und die Kosten der Wafer-Level-Mischbondierung.
Das von Nvidia vorangetriebene NVHBM übergibt die Basis-Dies an Nvidia-Designs und könnte von TSMC hergestellt werden. Diese Lösung könnte den Stromverbrauch senken und die Bandbreite erhöhen, könnte jedoch auch den Wert von Speicherherstellern bei der Gestaltung und Herstellung von HBM-Basis-Dies verringern. Mit der Standardisierung von Produkten könnte ein Teil des Mehrwerts von Speicherherstellern auf Nvidia und Wafer-Fab-Dienstleister übertragen werden.
Das HBF von SanDisk und SK Hynix versucht, NAND zu nutzen, um eine Bandbreite nahe HBM zu bieten und gleichzeitig eine größere Kapazität und niedrigere Stückkosten zu erzielen. Allerdings gibt es nach wie vor erhebliche Unterschiede in der Latenz und Leistung zwischen NAND und DRAM, sodass HBF mehrere technische Ebenen überwinden muss, was die Umsetzung nicht einfach macht.
Intels ZAM versucht, DRAM-Dies um 90 Grad zu drehen, um die Wärmeabfuhr zu verbessern, mit dem Ziel, bis zum Geschäftsjahr 2029 praktikabel zu sein; Qualcomms HBC verwendet LPDDR und traditionelle Verpackungen, um die CoWoS-Kosten auf Kosten einer gewissen Leistung zu umgehen.
Darüber hinaus versucht PIM, Rechenleistung direkt in Speicherchips zu integrieren, um den Datenverkehr zwischen Prozessor und Speicher zu reduzieren. Dies würde jedoch die bestehende Rechenarchitektur verändern und erfordert eine Anpassung von Prozessoren, Software und Netzwerken, was auch die bereits hochentwickelte Trennung zwischen Logik- und Speicherchips beeinträchtigen könnte. Bernstein glaubt, dass die Branchenakzeptanz weiterhin begrenzt ist.
In Anbetracht dessen bedeutet die schnelle Zunahme neuer Lösungen nicht, dass alle Routen einen skalierbaren Markt bilden können. Die Fähigkeit, mit bestehenden Software- und Hardware-Ökosystemen kompatibel zu sein, ob Kostenvorteile bestehen und ob die Akteure in der Lieferkette ein Gleichgewicht der Interessen erreichen können, wird das endgültige Ergebnis der Kommerzialisierung bestimmen.
Die Nutznießer des KI-Speichers werden nicht nur HBM-Hersteller sein =====================
Aus Anlegersicht ist Bernsteins Urteil recht klar: Die Nachfrage nach Speicher durch KI breitet sich von wenigen High-End-Produkten auf mehr Ebenen aus.
HBM bleibt das Herzstück des Trainings und der Hochleistungsinferenz, und Samsung Electronics, SK Hynix und Micron werden weiterhin von der Nachfrage nach Hochbandbreitenspeicher profitieren. Doch mit der Ausweitung der Inferenzskala wird die Bedeutung von System-DRAM und NAND zunehmen. Der Überlauf des KV-Caches, die RAG-Datenbanken und die große Menge an Zwischeninformationen, die von Agenten erzeugt werden, werden ebenfalls die Nachfrage nach SSDs und gemeinsam genutztem Speicher erhöhen.
Kühlere Daten werden weiterhin absteigen. Bernstein stellt fest, dass das durch KI verursachte Datenwachstum bereits HDDs zugutekommt; in bestimmten Szenarien, in denen die Kapazität von NAND und HDD nicht ausreicht, steigt auch die Nachfrage nach Bändern, die traditionell hauptsächlich für Archivierungszwecke verwendet werden.
Der Bericht bewertet Samsung Electronics, SK Hynix, Micron, SanDisk, Seagate und Western Digital weiterhin mit „Outperform“. Dabei beziehen sich Samsung Electronics, SK Hynix und Micron auf DRAM und HBM, SanDisk profitiert von NAND und HBF, während Seagate und Western Digital auf kostengünstigere, großvolumige Speicher abzielen. Kioxia wird mit „Underperform“ bewertet.
Der wahre Wert dieses Berichts liegt jedoch nicht darin, eine Reihe neuer Technologieabkürzungen aufzulisten, sondern darin, den Rahmen des KI-Speichermarktes neu zu definieren.
Die Engpässe der Trainingszeit konzentrierten sich hauptsächlich auf GPUs und HBM; im Zeitalter der Inferenz und Agenten beginnen die Engpässe, sich über das gesamte Speichersystem auszubreiten. Der Wettbewerb um die zukünftige KI-Infrastruktur hängt nicht nur davon ab, wie schnell Chips rechnen können, sondern auch davon, ob Daten zu ausreichend niedrigen Kosten effizient zwischen HBM, DRAM, NAND und gemeinsam genutztem Speicher fließen können.

---Preis

--
--
--

Dieser Inhalt wird nur zu allgemeinen Informationszwecken bereitgestellt und stellt keine finanzielle, Anlage-, Rechts- oder Steuerberatung dar. Alle erwähnten Ereignisse, Prämien, Online-Aktionen oder zugehörige Informationen sollten nicht als Empfehlung, Aufforderung oder Einladung zum Kauf, Verkauf, Handel oder anderweitigem Umgang mit Krypto-Assets betrachtet werden. Krypto-Assets sind sehr volatil und können zu Verlusten führen. Die Verfügbarkeit von WEEX Services, Produkten und zugehörigen Aktionen kann je nach Region unterschiedlich sein. Sie sind dafür verantwortlich sicherzustellen, dass Ihre Teilnahme mit geltenden lokalen Gesetzen und Vorschriften übereinstimmt.

Das könnte Ihnen auch gefallen

iconiconiconiconiconiconicon
Kundenservice:@weikecs
Geschäftliche Zusammenarbeit:@weikecs
Quant-Trading & MM:[email protected]
VIP-Programm:[email protected]