Comentario de Bernstein sobre las siete grandes memorias: Después de HBM, DRAM y NAND compiten por el próximo mercado de un billón
TL;DR · La demanda de almacenamiento por parte de la IA no se limita a HBM. El entrenamiento requiere movilizar un sistema de memoria completo que va desde HBM, DRAM del sistema hasta SSD y almacenamiento compartido. · El verdadero cuello de botella en la inferencia se presenta en la fase de decodificación. El KV Cache crecerá junto con la longitud del contexto y el número de usuarios concurrentes, y la capacidad de memoria podría limitar la escala comercial antes que los pesos del modelo. · Los agentes amplifican aún más la presión sobre el almacenamiento. Las llamadas de múltiples pasos generan repetidamente contexto, invocan herramientas externas y aumentan la demanda de CPU, DRAM y KV Cache. · Están surgiendo múltiples nuevos niveles entre HBM y SSD tradicionales, incluyendo CXL, "Storage Next" y CMX, todos con el objetivo de manejar los datos de inferencia en expansión a un costo más bajo. · No todas las nuevas rutas tecnológicas pueden implementarse. HBF, zHBM, NVHBM, ZAM y PIM enfrentan problemas de disipación de calor, rendimiento, compatibilidad ecológica o redistribución de beneficios en la cadena de suministro. · Bernstein sigue siendo optimista sobre Samsung Electronics, SK Hynix, Micron, SanDisk, Seagate y Western Digital, manteniendo una calificación de "bajo rendimiento" para Kioxia.
En los últimos dos años, la narrativa del mercado de almacenamiento de IA se ha centrado casi exclusivamente en HBM. Sin embargo, a medida que los grandes modelos pasan del entrenamiento a la inferencia a gran escala, simplemente aumentar HBM ya no resuelve todos los problemas.
Bernstein señala en su último informe global de almacenamiento que las diferentes cargas de trabajo de IA tienen requisitos de memoria significativamente diferentes: el entrenamiento enfatiza la potencia de cálculo y el ancho de banda, mientras que la fase de decodificación en la inferencia depende más de la capacidad, RAG requiere bases de datos a gran escala, y el flujo de trabajo de los agentes aumentará simultáneamente la carga tanto en servidores tradicionales como en servidores de IA.
Esto significa que los cambios traídos por la IA se están transmitiendo desde HBM hacia DRAM del sistema, SSD, HDD e incluso almacenamiento en cinta. Alrededor de la "pared de memoria", la cadena de suministro ha comenzado a insertar nuevos productos entre los niveles existentes, con la esperanza de encontrar un nuevo equilibrio entre rendimiento, capacidad y costo.
El límite de escala de la inferencia puede depender del KV Cache
Durante la fase de entrenamiento de grandes modelos, GPU y HBM siguen siendo fundamentales.
El entrenamiento requiere leer frecuentemente parámetros del modelo y datos intermedios, lo que exige una alta capacidad de cálculo y ancho de banda de memoria. Pero el entrenamiento de un modelo grande no depende únicamente de HBM: el conjunto de datos original debe almacenarse en medios de almacenamiento de menor costo; antes de que los datos ingresen a la GPU, generalmente deben ser almacenados en caché y preprocesados por DRAM del sistema y SSD locales; el entrenamiento que dura semanas o incluso meses también debe guardar puntos de control periódicamente para evitar que fallos de hardware o software reinicien la tarea desde cero.
Por lo tanto, un gran entrenamiento realmente invoca un sistema completo que va desde HBM, DRAM del sistema hasta SSD locales y almacenamiento en red.
Una vez que se entra en la fase de inferencia, la demanda de memoria se diversifica aún más.
La inferencia generalmente se puede dividir en dos etapas: prellenado (Prefill) y decodificación (Decode). El prellenado se encarga de procesar la entrada del usuario y generar el primer Token, ejecutando principalmente cálculos matriciales a gran escala, más enfocados en la "potencia de cálculo limitada". En esta etapa, la utilización de la GPU y el ancho de banda de HBM son más importantes, y un indicador común es la latencia del primer Token.
La fase de decodificación es diferente. El modelo necesita generar Tokens uno por uno y, al generar un nuevo Token, invocar la información previamente generada. Para evitar cálculos repetidos, el sistema generalmente almacena estos datos en KV Cache.
KV Cache tiene dos características importantes: su capacidad aumenta linealmente con la longitud del contexto, y cada usuario necesita un caché independiente. Por lo tanto, cuando la longitud del contexto aumenta y el número de usuarios concurrentes crece, ambos factores aumentarán el uso de memoria.
Bernstein cree que, en el despliegue de IA a gran escala, la memoria ocupada por KV Cache podría superar los pesos del modelo, convirtiéndose en el principal factor limitante del número de usuarios concurrentes y la ventana de contexto. Cuántos usuarios puede atender el modelo y cuánto contexto puede mantener, afectará directamente la escala de ingresos.
Desde esta perspectiva, el enfoque de competencia en la era de la inferencia no solo se centra en cuántos cálculos puede realizar el chip, sino también en cuán bajo puede ser el costo del sistema para almacenar y leer un contexto en expansión.
RAG y Agente, empujan la demanda hacia la memoria tradicional
La popularidad de RAG y Agente ha llevado la demanda de almacenamiento de IA a expandirse más allá de HBM.
RAG incluye principalmente dos etapas: construcción de bases de datos y recuperación de bases de datos. Al construir la base de datos, el sistema necesita procesar una gran cantidad de datos no estructurados, como PDF, páginas web y código, y luego convertirlos en vectores e índices buscables. Este proceso depende más de SSD de gran capacidad y DRAM del sistema, mientras que el papel de HBM es relativamente limitado.
Una vez establecida la base de datos, las consultas de los usuarios se convierten primero en vectores, que luego se emparejan con el contenido de la base de datos. La generación de vectores puede completarse rápidamente en GPU y HBM, pero la búsqueda real depende más de DRAM del sistema. Los resultados de la recuperación se combinan con las preguntas de los usuarios y entran en el flujo normal de prellenado y decodificación.
El flujo de trabajo de Agente trae una carga aún mayor.
El diálogo tradicional suele ser una llamada única de "entrada---modelo---salida", mientras que el Agente necesita descomponer el objetivo en múltiples pasos, invocar otros modelos o herramientas externas, guardar resultados intermedios y replanificar según los comentarios. Los resultados generados en cada llamada pueden convertirse en la entrada para la próxima llamada del modelo.
Esto aumentará simultáneamente dos tipos de demanda: por un lado, las llamadas a herramientas y tareas no relacionadas con IA requieren más CPU y memoria del sistema; por otro lado, la transmisión continua de contexto entre múltiples modelos ampliará rápidamente la carga de prellenado, decodificación y KV Cache.
Por lo tanto, el desarrollo de aplicaciones de Agente no solo beneficia a GPU y HBM, sino que también podría impulsar la demanda de DRAM en servidores, SSD de nivel empresarial y medios de almacenamiento de menor costo.
Entre HBM y SSD, están surgiendo nuevos niveles de memoria
El sistema de memoria de los servidores tradicionales se puede dividir en caché interna del procesador, DRAM del sistema, SSD locales y almacenamiento compartido. Los servidores de IA han añadido HBM a esta estructura, pero la capacidad de HBM es limitada y su costo es alto, lo que dificulta que asuma todos los datos.
La solución actual de la cadena de suministro es introducir nuevos productos entre diferentes niveles.
CXL intenta integrar la memoria físicamente dispersa en un grupo de recursos compartidos, permitiendo que CPU, GPU y dispositivos de expansión invoquen DRAM de manera más flexible. Algunos productos también utilizan DRAM o SRAM como caché, combinándolos con NAND, reduciendo costos y acortando la latencia de acceso.
"Storage Next", impulsado por NVIDIA, intenta trasladar parte de la gestión del almacenamiento de la CPU a la GPU, y permitir que NAND obtenga latencias, IOPS y granularidad de acceso a datos más cercanas a DRAM. La serie GP de SSD de Kioxia, basada en XL-FLASH, es un ejemplo representativo de esta dirección.
CMX se centra principalmente en KV Cache. Despliega SSD en nodos de datos independientes, conectándose a nodos de cálculo a través de DPU, Ethernet y chips de conmutación. Su objetivo es compartir el contexto de inferencia entre diferentes GPU, reduciendo el almacenamiento duplicado y superando las limitaciones de capacidad de memoria de un solo servidor.
Estas soluciones apuntan a una misma tendencia: los sistemas de IA no pueden mantener todos los datos activos a largo plazo en HBM, y necesitan distribuirlos entre diferentes niveles según la frecuencia de acceso y los requisitos de latencia de los datos.
Los datos calientes permanecen en HBM, parte del contexto se transfiere a DRAM del sistema o SSD de alto rendimiento, y los datos más fríos continúan descendiendo a SSD comunes, HDD e incluso cintas. Cuanto más finos sean los niveles de memoria, más probable será que el sistema logre un equilibrio entre rendimiento y costo.
Precio de --
Nuevas tecnologías surgen rápidamente, pero la comercialización sigue siendo incierta
Alrededor de la "pared de memoria", la cadena de suministro ya ha propuesto múltiples nuevas rutas.
El plan zHBM de Samsung apila HBM sobre el procesador, acortando aún más la distancia de transmisión de datos. Sin embargo, este diseño necesita manejar el calor generado por la GPU, al mismo tiempo que plantea mayores exigencias sobre el rendimiento y costo de la unión híbrida a nivel de oblea.
El NVHBM promovido por NVIDIA entrega los chips básicos a NVIDIA para su diseño, y podría ser fabricado por TSMC. Esta solución tiene el potencial de reducir el consumo de energía y aumentar el ancho de banda, pero también podría debilitar el valor de diseño y fabricación de los fabricantes de almacenamiento en los chips básicos de HBM. A medida que los productos se estandarizan, parte del valor agregado podría trasladarse de los fabricantes de almacenamiento a NVIDIA y a las fábricas de semiconductores.
El HBF promovido por SanDisk y SK Hynix busca utilizar NAND para proporcionar un ancho de banda cercano al de HBM, al mismo tiempo que obtiene mayor capacidad y menor costo por unidad. Sin embargo, NAND y DRAM aún presentan diferencias significativas en latencia y rendimiento, y HBF necesita superar múltiples niveles tecnológicos, lo que no es fácil de implementar.
Intel intenta rotar los chips de DRAM 90 grados para mejorar la disipación de calor, con el objetivo de lograr la comercialización en el año fiscal 2029; mientras que el HBC de Qualcomm utiliza LPDDR y empaquetado tradicional, sacrificando parte del rendimiento para evitar los costos de CoWoS.
Además, PIM intenta agregar capacidades de cálculo directamente en los chips de almacenamiento para reducir el transporte de datos entre el procesador y la memoria. Pero esto cambiará la arquitectura de cálculo existente, requiriendo que procesadores, software y redes se adapten conjuntamente, y también impactará el sistema de división de trabajo entre chips lógicos y de almacenamiento que ya está altamente maduro. Bernstein cree que su adopción en la industria sigue siendo limitada.
Desde esta perspectiva, el rápido aumento en el número de nuevas soluciones no significa que todas las rutas puedan formar un mercado a gran escala. La capacidad de ser compatible con el ecosistema de software y hardware existente, si tiene ventajas de costo, y si las partes de la cadena de suministro pueden alcanzar un equilibrio de intereses, determinará el resultado final de la comercialización.
Los beneficiarios del almacenamiento de IA no serán solo los fabricantes de HBM
Desde una perspectiva de inversión, el juicio de Bernstein es bastante claro: el impulso de la IA en la industria del almacenamiento se está expandiendo desde unos pocos productos de alta gama a más niveles.
HBM sigue siendo el núcleo del entrenamiento y la inferencia de alto rendimiento, y Samsung Electronics, SK Hynix y Micron seguirán beneficiándose de la demanda de almacenamiento de alto ancho de banda. Pero a medida que la escala de inferencia se expande, la importancia de DRAM del sistema y NAND aumentará. El desbordamiento de KV Cache, las bases de datos RAG y la gran cantidad de datos intermedios generados por los Agentes también aumentarán la demanda de SSD y almacenamiento compartido.
Los datos más fríos seguirán descendiendo. Bernstein señala que el crecimiento de datos traído por la IA ya ha comenzado a beneficiar a HDD; en ciertos escenarios, debido a la insuficiencia de capacidad de NAND y HDD, la demanda de cintas, que tradicionalmente se utilizan principalmente para archivo, también está aumentando.
El informe continúa otorgando calificaciones de "superior al mercado" a Samsung Electronics, SK Hynix, Micron, SanDisk, Seagate y Western Digital. Entre ellos, Samsung Electronics, SK Hynix y Micron están relacionados con DRAM y HBM, SanDisk se beneficia de NAND y HBF, mientras que Seagate y Western Digital están relacionados con almacenamiento de gran capacidad a menor costo. Kioxia ha sido calificada como "inferior al mercado".
Sin embargo, el valor central de este informe no radica en enumerar una serie de nuevas abreviaturas tecnológicas, sino en redefinir los límites del mercado de almacenamiento de IA.
Los cuellos de botella de la era del entrenamiento se concentran principalmente en GPU y HBM; en la era de la inferencia y los Agentes, los cuellos de botella comienzan a extenderse a través de todo el sistema de memoria. La competencia futura en la infraestructura de IA dependerá no solo de cuán rápido puede calcular el chip, sino también de si los datos pueden fluir de manera eficiente entre HBM, DRAM, NAND y almacenamiento compartido a un costo suficientemente bajo.
Este contenido se ofrece únicamente con fines informativos generales y no constituye un asesoramiento financiero, de inversión, legal ni fiscal. Cualquier evento, recompensa, promoción en línea o información relacionada que se mencione en el presente documento no debe considerarse como una recomendación, solicitud o invitación a comprar, vender, operar o de negociar de otra manera con cualquier criptoactivo. Los criptoactivos son sumamente volátiles y pueden provocar pérdidas. La disponibilidad de los servicios, productos y eventos relacionados de WEEX puede variar según la región. Tienes la responsabilidad de asegurarte de que tu participación esté de acuerdo con las leyes y regulaciones locales vigentes.
Te puede gustar

El S&P Merval se hundió un 12% en dólares en agosto y el riesgo país escaló 80 puntos, el mayor salto desde febrero

Polymarket discute la obtención de 1.000 millones de dólares, valorada en 29 billones de won

La estrategia se opone a la propuesta de MSCI para excluir activos digitales

Ripple se convierte en la principal opción de inversión, superando a Kraken

Blockstream renueva el panel de control del explorador de Bitcoin

Irán afirma que derribó un dron MQ-9 Reaper de EE.UU. cerca del estrecho de Ormuz

Por qué los tesoros corporativos de Bitcoin de 2.000 millones de dólares son una bomba de tiempo de suministro condicional oculto

La posición de productos derivados de Bitcoin en CME supera en 50,9 veces a Coinbase

Goldman Sachs prevé que la estrategia de carry sigue siendo válida a pesar de la intervención en el yen

La asociación de Solana en criptomonedas alcanza un récord de 169,9 millones de transacciones

HKDAP podría llevar el HKD más allá de los pagos hacia las finanzas en cadena, dice investigador de HashKey

La SEC propone recaudar 75 millones de dólares para activos criptográficos

El descontrol de la deuda estadounidense agrava la fuga de capitales, las opciones de Bitcoin apuestan a alcanzar los 100,000 dólares en 2026

"La tecnología queda en segundo plano": cómo las stablecoins pasan del ahorro a los pagos cotidianos

Dune lanza un conjunto de datos de activos del mundo real

Rusia destruyó 12 centros comerciales en Ucrania, las pérdidas alcanzaron 3,23 mil millones de UAH

Por qué el camino de 75 millones de dólares de la SEC no es el mismo trato que el que ofrece el Congreso

Toyota y Honda en peligro debido a aranceles del 50% de EE. UU. sobre automóviles canadienses

C1 Fund añade posiciones en Polymarket en el segundo trimestre, recompra acciones por 824,000 dólares

Israel construirá un sistema de defensa aérea para Grecia por 3 mil millones de euros

Metaplanet transfiere 2.400 BTC a Coinbase, valorados en aproximadamente 186 millones de USD

Análisis fundamental de criptomonedas: cómo evaluar activos digitales antes de comprarlos

El rendimiento de los bonos del Tesoro a 10 años de EE. UU. supera el 4,76%, alcanzando un nuevo máximo desde 2025

OKI vs IKE vs IKZE: ¿qué elegir en 2026? Impuestos, límites y cálculos para 2027

Natura cambia de CEO: Carlucci regresa tras una década

BitMine aumenta su participación en 53,501 ethers, comprando ETH durante 65 semanas consecutivas

La regulación del mercado de predicciones provoca una lucha política

Warren Buffett cumple 96 años: las inversiones que lo convirtieron en una leyenda de Wall Street

Después de que el precio de las acciones de MiniMax se recupera un 92%: ¿Qué queda cuando una empresa modelo elimina el modelo?








