Bernstein commente les sept grandes mémoires : après HBM, DRAM et NAND se disputent le prochain marché de mille milliards

By: www.theblockbeats.info|2026/08/31 07:21:44

TL;DR · La demande d'IA en matière de stockage ne se limite pas à HBM. L'entraînement nécessite presque l'activation d'un système de mémoire complet allant de HBM, DRAM système à SSD et stockage partagé. · Le véritable goulot d'étranglement de l'inférence se situe au stade du décodage. Le cache KV augmentera avec la longueur du contexte et le nombre d'utilisateurs simultanés, la capacité de mémoire pourrait limiter la mise à l'échelle commerciale plus tôt que le poids du modèle. · Les agents amplifient encore la pression sur le stockage. Les appels multi-étapes génèrent à plusieurs reprises des contextes, appellent des outils externes et augmentent les besoins en CPU, DRAM et cache KV. · De nouveaux niveaux émergent entre HBM et SSD traditionnels, y compris CXL, « Storage Next » et CMX, visant à gérer des données d'inférence en expansion à un coût inférieur. · Toutes les nouvelles technologies ne peuvent pas être mises en œuvre. HBF, zHBM, NVHBM, ZAM et PIM font face à des problèmes de dissipation thermique, de rendement, de compatibilité écologique ou de redistribution des intérêts de la chaîne d'approvisionnement. · Bernstein reste optimiste quant à Samsung Electronics, SK Hynix, Micron, SanDisk, Seagate et Western Digital, maintenant une note « sous-performer » pour Kioxia.


Au cours des deux dernières années, le récit du marché du stockage AI s'est presque entièrement concentré sur HBM. Mais avec le passage des grands modèles de l'entraînement à l'inférence à grande échelle, l'augmentation pure de HBM ne suffit plus à résoudre tous les problèmes.


Dans son dernier rapport mondial sur le stockage, Bernstein souligne que les exigences en matière de mémoire varient considérablement selon les charges de travail AI : l'entraînement met l'accent sur la puissance de calcul et la bande passante, tandis que la phase de décodage dans l'inférence dépend davantage de la capacité, RAG nécessite une base de données à grande échelle, et le flux de travail des agents augmentera simultanément la charge sur les serveurs traditionnels et AI.


Cela signifie que les changements apportés par l'IA se transmettent de HBM aux DRAM système, SSD, HDD, et même au stockage sur bande. Autour du « mur de la mémoire », la chaîne d'approvisionnement commence à insérer de nouveaux produits entre les niveaux existants, espérant trouver un nouvel équilibre entre performance, capacité et coût.


La limite de l'échelle d'inférence pourrait dépendre du cache KV


Au stade d'entraînement des grands modèles, GPU et HBM restent au cœur de l'attention.


L'entraînement nécessite une lecture fréquente des paramètres du modèle et des données intermédiaires, avec des exigences élevées en matière de capacité de calcul et de bande passante mémoire. Mais l'entraînement d'un grand modèle ne dépend pas uniquement de HBM : les ensembles de données brutes doivent être conservés sur des supports de stockage moins coûteux ; avant d'entrer dans le GPU, les données doivent généralement être mises en cache et prétraitées par le DRAM système et le SSD local ; un entraînement continu pendant des semaines, voire des mois, nécessite également des sauvegardes régulières pour éviter que des pannes matérielles ou logicielles ne forcent à recommencer la tâche.


Ainsi, un entraînement à grande échelle appelle en réalité un système complet allant de HBM, DRAM système à SSD local et stockage réseau.


Une fois en phase d'inférence, les besoins en mémoire se diversifient encore davantage.


L'inférence peut généralement être décomposée en deux étapes : pré-remplissage (Prefill) et décodage (Decode). Le pré-remplissage gère les entrées utilisateur et génère le premier token, exécutant principalement des calculs matriciels à grande échelle, plus orientés vers « la puissance de calcul limitée ». À ce stade, l'utilisation du GPU et la bande passante HBM sont plus importantes, l'indicateur courant étant la latence du premier token.


La phase de décodage est différente. Le modèle doit générer les tokens un par un et, lors de la génération d'un nouveau token, il doit appeler les informations précédemment produites. Pour éviter les calculs redondants, le système stocke généralement ces données dans le cache KV.


Le cache KV présente deux caractéristiques importantes : sa capacité augmente linéairement avec la longueur du contexte, et chaque utilisateur nécessite un cache indépendant. Ainsi, lorsque le contexte s'allonge et que le nombre d'utilisateurs simultanés augmente, ces deux facteurs augmentent ensemble l'occupation de la mémoire.


Bernstein estime que dans le déploiement AI à grande échelle, la mémoire occupée par le cache KV pourrait dépasser le poids du modèle, devenant le principal facteur limitant le nombre d'utilisateurs simultanés et la fenêtre de contexte. Le nombre d'utilisateurs que le modèle peut servir et la durée du contexte maintenue affecteront directement l'échelle des revenus.


Ainsi, la concurrence à l'ère de l'inférence ne se concentre pas seulement sur le nombre de calculs que la puce peut effectuer, mais aussi sur la capacité du système à stocker et à lire efficacement un contexte en expansion à un coût suffisamment bas.


RAG et Agent, poussent la demande vers la mémoire traditionnelle


La popularité de RAG et des agents a encore élargi la demande de stockage AI au-delà de HBM.


RAG comprend principalement deux étapes : la construction de la base de données et la recherche dans la base de données. Lors de la construction de la base de données, le système doit traiter une grande quantité de données non structurées telles que des PDF, des pages web, du code, puis les convertir en vecteurs et indexables. Ce processus dépend davantage de SSD de grande capacité et de DRAM système, le rôle de HBM étant relativement limité.


Une fois la base de données établie, les requêtes des utilisateurs sont d'abord converties en vecteurs, puis mises en correspondance avec le contenu de la base de données. La génération de vecteurs peut être réalisée rapidement dans le GPU et HBM, mais la recherche réelle dépend généralement davantage du DRAM système. Les résultats de la recherche sont ensuite fusionnés avec les questions des utilisateurs, entrant dans le processus normal de pré-remplissage et de décodage.


Le flux de travail des agents impose une charge encore plus lourde.


La conversation traditionnelle est généralement un appel unique « entrée --- modèle --- sortie », tandis que l'agent doit décomposer l'objectif en plusieurs étapes, appeler d'autres modèles ou outils externes, conserver les résultats intermédiaires et replanifier en fonction des retours. Chaque résultat d'appel peut devenir l'entrée pour le prochain appel du modèle.


Cela augmentera simultanément deux types de demande : d'une part, les appels d'outils et les tâches non AI nécessitent plus de CPU et de mémoire système ; d'autre part, le passage constant de contexte entre plusieurs modèles augmentera rapidement la charge de pré-remplissage, de décodage et de cache KV.


Ainsi, le développement des applications d'agents ne profite pas seulement aux GPU et HBM, mais pourrait également augmenter la demande pour le DRAM serveur, les SSD de niveau entreprise et des supports de stockage à coût inférieur.


De nouveaux niveaux de mémoire émergent entre HBM et SSD


Le système de mémoire des serveurs traditionnels peut être approximativement divisé en cache interne du processeur, DRAM système, SSD local et stockage partagé. Les serveurs AI ont ajouté HBM à cette structure, mais la capacité de HBM est limitée et son coût élevé, rendant difficile la prise en charge de toutes les données.


La solution actuelle de la chaîne d'approvisionnement consiste à ajouter de nouveaux produits entre les différents niveaux.


CXL tente d'intégrer la mémoire physiquement dispersée en un pool de ressources partagé, permettant aux CPU, GPU et dispositifs d'extension d'appeler DRAM de manière plus flexible. Certains produits utilisent également DRAM ou SRAM comme cache, combinés avec NAND, réduisant les coûts tout en diminuant la latence d'accès.


« Storage Next », soutenu par NVIDIA, tente de transférer une partie de la gestion du stockage du CPU vers le GPU, permettant à NAND d'obtenir des latences, IOPS et granularité d'accès aux données plus proches de celles de DRAM. La série GP de SSD de Kioxia, basée sur XL-FLASH, est un exemple de cette direction.


CMX est principalement destiné au cache KV. Il déploie des SSD dans des nœuds de données indépendants, connectés aux nœuds de calcul via DPU, Ethernet et puces de commutation. Son objectif est de partager le contexte d'inférence entre différents GPU, réduisant le stockage redondant tout en dépassant la limite de capacité mémoire d'un seul serveur.


Ces solutions pointent toutes vers une même tendance : les systèmes AI ne peuvent pas conserver toutes les données actives à long terme dans HBM, mais doivent les répartir entre différents niveaux en fonction de la fréquence d'accès et des exigences de latence des données.


Les données chaudes restent dans HBM, une partie du contexte est transférée vers DRAM système ou SSD haute performance, tandis que les données plus froides continuent de descendre vers des SSD ordinaires, HDD ou même des bandes. Plus les niveaux de mémoire sont fins, plus le système a de chances d'atteindre un équilibre entre performance et coût.


Prix de --

--
--
--

De nouvelles technologies émergent rapidement, mais la commercialisation reste incertaine


Autour du « mur de la mémoire », la chaîne d'approvisionnement a déjà proposé plusieurs nouvelles voies.


Le plan zHBM de Samsung empile HBM au-dessus du processeur, réduisant encore la distance de transmission des données. Cependant, cette conception doit gérer la chaleur générée par le GPU, tout en posant des exigences plus élevées en matière de rendement et de coût pour le collage hybride au niveau des wafers.


Le NVHBM soutenu par NVIDIA confie les puces de base à la conception de NVIDIA, et pourrait être fabriqué par TSMC. Cette solution pourrait réduire la consommation d'énergie et augmenter la bande passante, mais pourrait également affaiblir la valeur de conception et de fabrication des fabricants de stockage sur les puces de base HBM. Avec la standardisation des produits, une partie de la valeur ajoutée pourrait être transférée des fabricants de stockage vers NVIDIA et les fonderies.


Le HBF soutenu par SanDisk et SK Hynix espère utiliser NAND pour fournir une bande passante proche de celle de HBM, tout en obtenant une plus grande capacité et un coût unitaire plus bas. Cependant, il existe encore un écart significatif en termes de latence et de performance entre NAND et DRAM, et le HBF doit franchir plusieurs niveaux technologiques, ce qui rend sa mise en œuvre difficile.


Le ZAM d'Intel tente de faire pivoter les puces DRAM de 90 degrés pour améliorer la dissipation thermique, avec pour objectif une mise en œuvre en 2029 ; le HBC de Qualcomm utilise LPDDR et un emballage traditionnel, sacrifiant une partie de la performance pour contourner le coût de CoWoS.


De plus, le PIM tente d'ajouter des capacités de calcul directement dans les puces de stockage pour réduire le transport de données entre le processeur et la mémoire. Cependant, cela modifiera l'architecture de calcul existante, nécessitant une adaptation conjointe des processeurs, des logiciels et des réseaux, et impactera le système de division du travail déjà hautement mature entre les puces logiques et de stockage. Bernstein estime que son adoption dans l'industrie reste limitée.


Ainsi, bien que le nombre de nouvelles solutions augmente rapidement, cela ne signifie pas que toutes les voies peuvent former un marché à grande échelle. La compatibilité avec les écosystèmes logiciels et matériels existants, la présence d'un avantage de coût, et la capacité des parties de la chaîne d'approvisionnement à parvenir à un équilibre des intérêts détermineront le résultat commercial final.


Les bénéficiaires du stockage AI ne seront pas seulement les fabricants de HBM


D'un point de vue d'investissement, le jugement de Bernstein est assez clair : la demande d'IA pour l'industrie du stockage s'étend de quelques produits haut de gamme à davantage de niveaux.


HBM reste au cœur de l'entraînement et de l'inférence haute performance, Samsung Electronics, SK Hynix et Micron continueront de bénéficier de la demande de stockage à haute bande passante. Cependant, avec l'expansion de l'échelle d'inférence, l'importance du DRAM système et de NAND augmentera. Le débordement du cache KV, les bases de données RAG et les grandes quantités de données intermédiaires générées par les agents augmenteront également la demande pour les SSD et le stockage partagé.


Les données plus froides continueront également de descendre. Bernstein indique que la croissance des données apportée par l'IA commence déjà à bénéficier aux HDD ; dans certains scénarios, en raison de l'insuffisance de la capacité de NAND et HDD, la demande de bandes, traditionnellement utilisées principalement pour l'archivage, augmente également.


Le rapport continue d'attribuer une note « surperformer » à Samsung Electronics, SK Hynix, Micron, SanDisk, Seagate et Western Digital. Parmi eux, Samsung Electronics, SK Hynix et Micron correspondent à DRAM et HBM, SanDisk bénéficie de NAND et HBF, tandis que Seagate et Western Digital correspondent à des solutions de stockage à coût inférieur et de grande capacité. Kioxia est noté « sous-performer ».


Cependant, la valeur centrale de ce rapport ne réside pas dans l'énumération d'une série d'abréviations de nouvelles technologies, mais dans la redéfinition des frontières du marché du stockage AI.


Les goulots d'étranglement de l'ère de l'entraînement se concentraient principalement sur le GPU et HBM ; à l'ère de l'inférence et des agents, les goulots d'étranglement commencent à se propager à l'ensemble du système de mémoire. La concurrence future pour les infrastructures AI dépendra non seulement de la rapidité des calculs des puces, mais aussi de la capacité des données à circuler efficacement à un coût suffisamment bas entre HBM, DRAM, NAND et stockage partagé.

Ce contenu est fourni à titre informatif uniquement et ne constitue pas un conseil financier, d'investissement, juridique ou fiscal. Les événements, récompenses, promotions en ligne ou informations mentionnées ici ne doivent pas être considérés comme une recommandation, une sollicitation ou une invitation à acheter, vendre, trader ou effectuer toute autre opération sur des actifs crypto. Les actifs crypto sont très volatils et peuvent entraîner des pertes. La disponibilité des services, produits et événements liés à WEEX peut varier selon les régions. Veuillez vous assurer que votre participation respecte les lois et réglementations locales applicables.

Vous pourriez aussi aimer

iconiconiconiconiconicon
Assistance client:@weikecs
Collaborations commerciales:@weikecs
Trading quantitatif/Market makers:[email protected]
Programme VIP:[email protected]