Коментар Bernstein про сім основних пам'ятей: після HBM, DRAM та NAND змагаються за наступний трильйонний ринок
TL;DR · Потреба AI у пам'яті не обмежується лише HBM. Тренування вимагає повної пам'яті, що включає HBM, системний DRAM, SSD та спільне зберігання. · Справжнє вузьке місце під час інференції виникає на етапі декодування. KV Cache зростає разом з довжиною контексту та кількістю одночасних користувачів, тому обсяг пам'яті може обмежити комерційний масштаб раніше, ніж вага моделі. · Агент ще більше посилює тиск на пам'ять. Багатоступеневі виклики повторно генерують контекст, викликають зовнішні інструменти та збільшують потреби в CPU, DRAM та KV Cache. · Між HBM та традиційними SSD з'являються нові рівні, включаючи CXL, «Storage Next» та CMX, які мають на меті забезпечити зростаючі дані інференції за нижчою ціною. · Не всі нові технологічні маршрути можуть бути реалізовані. HBF, zHBM, NVHBM, ZAM та PIM стикаються з проблемами охолодження, виходу на ринок, екологічної сумісності або перерозподілу вигод у ланцюгу постачання. · Bernstein продовжує позитивно оцінювати Samsung Electronics, SK Hynix, Micron, SanDisk, Seagate та Western Digital, зберігаючи рейтинг «гірше ринку» для Kioxia.
Протягом останніх двох років наратив ринку пам'яті AI майже повністю обертався навколо HBM. Але з переходом великих моделей від тренування до масштабної інференції, просте збільшення HBM вже не може вирішити всі проблеми.
У своєму останньому глобальному звіті про пам'ять Bernstein зазначає, що різні робочі навантаження AI мають суттєві відмінності в вимогах до пам'яті: тренування акцентує на обчислювальній потужності та пропускній здатності, тоді як етап декодування в інференції більше залежить від обсягу, RAG потребує великих баз даних, а робочий процес агента одночасно збільшує навантаження на традиційні сервери та AI-сервери.
Це означає, що зміни, викликані AI, передаються від HBM до системного DRAM, SSD, HDD та навіть стрічкового зберігання. Вокруг «стінки пам'яті» ланцюг постачання починає вставляти нові продукти між існуючими рівнями, сподіваючись знайти новий баланс між продуктивністю, обсягом та вартістю.
Обмеження масштабу інференції, можливо, залежить від KV Cache
На етапі тренування великих моделей GPU та HBM все ще займають центральне місце.
Тренування вимагає частого зчитування параметрів моделі та проміжних даних, що має високі вимоги до обчислювальної потужності та пропускної здатності пам'яті. Але тренування великої моделі не залежить лише від HBM: вихідний набір даних потрібно зберігати на більш дешевих носіях; перед тим, як дані потраплять до GPU, їх зазвичай потрібно кешувати та попередньо обробляти за допомогою системного DRAM та локального SSD; тривале тренування протягом кількох тижнів або навіть місяців також вимагає регулярного збереження контрольних точок, щоб уникнути повторного початку завдання через збої апаратного або програмного забезпечення.
Отже, одне велике тренування фактично викликає повну систему, що включає HBM, системний DRAM, локальний SSD та мережеве зберігання.
На етапі інференції потреба в пам'яті ще більше диференціюється.
Інференцію зазвичай можна розділити на два етапи: попереднє заповнення (Prefill) та декодування (Decode). Попереднє заповнення відповідає за обробку введення користувача та генерацію першого токена, в основному виконує великомасштабні матричні обчислення, більше орієнтуючись на «обмежену обчислювальну потужність». На цьому етапі важливіше використання GPU та пропускна здатність HBM, звичайним показником є затримка першого токена.
Етап декодування відрізняється. Модель повинна генерувати токени один за одним і під час генерації нового токена викликати раніше отриману інформацію. Щоб уникнути повторних обчислень, система зазвичай зберігає ці дані в KV Cache.
KV Cache має дві важливі характеристики: його обсяг лінійно зростає з довжиною контексту, а кожен користувач потребує незалежного кешу. Тому, коли контекст подовжується, а кількість одночасних користувачів зростає, ці два фактори разом підвищують використання пам'яті.
Bernstein вважає, що в умовах великомасштабного розгортання AI пам'ять, зайнята KV Cache, може перевищити вагу моделі, ставши основним фактором, що обмежує кількість одночасних користувачів та вікно контексту. Скільки користувачів може обслуговувати модель і як довго вона може підтримувати контекст, в кінцевому підсумку безпосередньо вплине на обсяг доходу.
Таким чином, у конкуренції епохи інференції акцент не лише на тому, скільки обчислень може виконати чіп, але й на тому, наскільки низькою ціною система може зберігати та зчитувати постійно зростаючий контекст.
RAG та агент, підштовхують потреби до традиційної пам'яті
Популярність RAG та агентів ще більше розширила потреби в пам'яті AI за межі HBM.
RAG в основному включає два етапи: побудову бази даних та пошук бази даних. Під час побудови бази даних система повинна обробляти величезну кількість неструктурованих даних, таких як PDF, веб-сторінки, код, а потім перетворити їх на векторні та індексовані дані, що можна шукати. Цей процес більше залежить від великої ємності SSD та системного DRAM, а роль HBM є відносно обмеженою.
Після створення бази даних запит користувача спочатку перетворюється на вектор, а потім зіставляється з вмістом бази даних. Генерація векторів може швидко виконуватися на GPU та HBM, але справжній пошук зазвичай більше залежить від системного DRAM. Результати пошуку потім об'єднуються з питаннями користувача, переходячи до звичайного процесу попереднього заповнення та декодування.
Робочий процес агента створює ще більше навантаження.
Традиційний діалог зазвичай є одноразовим викликом «введення---модель---вихід», тоді як агент повинен розбити ціль на кілька етапів, викликати інші моделі або зовнішні інструменти, зберігати проміжні результати та перепланувати на основі зворотного зв'язку. Результати кожного виклику можуть стати введенням для наступного виклику моделі.
Це одночасно збільшує два типи потреб: з одного боку, виклики інструментів та не-AI завдання потребують більше CPU та системної пам'яті; з іншого боку, постійна передача контексту між кількома моделями швидко збільшує навантаження на попереднє заповнення, декодування та KV Cache.
Отже, розвиток застосувань агента не лише вигідний для GPU та HBM, але й може підвищити попит на серверний DRAM, корпоративні SSD та більш дешеві носії зберігання.
Між HBM та SSD з'являються нові рівні пам'яті
Пам'ятна система традиційних серверів приблизно поділяється на кеш процесора, системний DRAM, локальний SSD та спільне зберігання. AI-сервери додали HBM до цієї структури, але ємність HBM обмежена, а вартість висока, що ускладнює обробку всіх даних.
Виробничий ланцюг наразі вирішує цю проблему, додаючи нові продукти між різними рівнями.
CXL намагається об'єднати фізично розподілену пам'ять в загальний ресурсний пул, щоб CPU, GPU та розширювальні пристрої могли більш гнучко викликати DRAM. Деякі продукти також використовують DRAM або SRAM як кеш, поєднуючи їх з NAND, щоб знизити витрати та скоротити затримку доступу.
Ініціатива «Storage Next», що просувається NVIDIA, намагається частково перевести управління зберігання з CPU на GPU та дозволити NAND досягти затримки, IOPS та частоти доступу даних, близьких до DRAM. SSD серії GP, представлені Kioxia на основі XL-FLASH, є прикладом цього напрямку.
CMX в основному орієнтований на KV Cache. Він розміщує SSD у незалежних вузлах даних, з'єднуючи їх з обчислювальними вузлами через DPU, Ethernet та комутатор. Його мета - ділитися контекстом інференції між різними GPU, зменшуючи повторне зберігання та одночасно долаючи обмеження ємності пам'яті одного сервера.
Ці рішення вказують на одну й ту ж тенденцію: AI-системи не можуть довгостроково зберігати всі активні дані в HBM, їх потрібно розподілити між різними рівнями відповідно до частоти доступу до даних та вимог до затримки.
Гарячі дані залишаються в HBM, частина контексту переноситься до системного DRAM або високопродуктивних SSD, а більш холодні дані продовжують знижуватися до звичайних SSD, HDD або навіть стрічок. Чим тонші рівні пам'яті, тим більше шансів, що система досягне балансу між продуктивністю та витратами.
Ціна --
Нові технології з'являються інтенсивно, але комерціалізація залишається невизначеною
Вокруг «стінки пам'яті» ланцюг постачання вже запропонував кілька нових маршрутів.
План Samsung з zHBM передбачає укладання HBM над процесором, щоб ще більше скоротити відстань передачі даних. Однак цей дизайн вимагає обробки тепла, що генерується GPU, а також висуває вищі вимоги до виходу на ринок та вартості змішаного з'єднання на рівні кристалів.
NVHBM, просуваний NVIDIA, передбачає, що базові чіпи будуть розроблені NVIDIA та, можливо, виготовлені TSMC. Цей план має на меті знизити споживання енергії та підвищити пропускну здатність, але також може зменшити цінність дизайну та виробництва базових чіпів HBM для виробників пам'яті. Зі стандартизацією продуктів частина додаткової вартості може перейти від виробників пам'яті до NVIDIA та фабрик з виготовлення кристалів.
SanDisk та SK Hynix, які просувають HBF, сподіваються використовувати NAND для забезпечення пропускної здатності, близької до HBM, одночасно отримуючи більшу ємність та нижчу вартість на одиницю. Однак між NAND та DRAM все ще існує значна різниця в затримці та продуктивності, HBF потрібно подолати кілька технологічних рівнів, щоб реалізувати.
Intel намагається повернути DRAM чіпи на 90 градусів, щоб покращити охолодження, з метою реалізації у фінансовому році 2029; Qualcomm використовує LPDDR та традиційну упаковку, жертвуючи частину продуктивності, щоб обійти витрати CoWoS.
Крім того, PIM намагається безпосередньо додати обчислювальні можливості до чіпів пам'яті, щоб зменшити переміщення даних між процесором та пам'яттю. Але це змінить існуючу архітектуру обчислень, вимагатиме спільної адаптації процесора, програмного забезпечення та мережі, а також вплине на вже високо зрілу систему розподілу логічних та пам'ятних чіпів. Bernstein вважає, що його впровадження в галузі залишається обмеженим.
Таким чином, швидке збільшення кількості нових рішень не означає, що всі маршрути можуть сформувати масштабний ринок. Чи зможе новий продукт бути сумісним з існуючою екосистемою програмного та апаратного забезпечення, чи має він переваги в вартості, а також чи можуть всі учасники ланцюга постачання досягти балансування вигод, визначить остаточний результат комерціалізації.
Отримувачами вигоди від AI пам'яті не будуть лише виробники HBM
З точки зору інвестицій, оцінка Bernstein є досить чіткою: вплив AI на індустрію пам'яті поширюється від небагатьох висококласних продуктів до більшої кількості рівнів.
HBM залишається основою для тренування та високопродуктивної інференції, Samsung Electronics, SK Hynix та Micron продовжать отримувати вигоду від попиту на пам'ять з високою пропускною здатністю. Але з розширенням масштабу інференції важливість системного DRAM та NAND зросте. Переповнення KV Cache, бази даних RAG та велика кількість проміжних даних, що генеруються агентом, також збільшать попит на SSD та спільне зберігання.
Більш холодні дані також продовжать знижуватися. Bernstein зазначає, що зростання даних, викликане AI, вже почало приносити користь HDD; у деяких випадках, через недостатню ємність NAND та HDD, зростає попит на стрічки, які традиційно використовуються для архівування.
Звіт продовжує надавати рейтинги «перевищує ринок» для Samsung Electronics, SK Hynix, Micron, SanDisk, Seagate та Western Digital. При цьому Samsung Electronics, SK Hynix та Micron відповідають за DRAM та HBM, SanDisk виграє від NAND та HBF, а Seagate та Western Digital відповідають за більш дешеве зберігання великої ємності. Kioxia отримала рейтинг «гірше ринку».
Однак основна цінність цього звіту полягає не в переліку нових технологічних абревіатур, а в переосмисленні меж ринку пам'яті AI.
Вузькі місця епохи тренування зосереджені в основному на GPU та HBM; в епоху інференції та агентів вузькі місця починають поширюватися по всій системі пам'яті. У майбутньому конкуренція в інфраструктурі AI залежатиме не лише від швидкості обчислень чіпів, але й від того, чи можуть дані ефективно переміщатися між HBM, DRAM, NAND та спільним зберіганням за достатньо низькою ціною.
Цей контент надано лише для загальних інформаційних цілей і не є фінансовою, інвестиційною, юридичною чи податковою консультацією. Події, нагороди, онлайн-акцій або пов’язану інформацію, згадана тут, не слід розглядати як рекомендацію, прохання чи запрошення до купівлі, продажу, торгівлі чи інших операцій з криптоактивами. Криптоактиви є дуже волатильними та можуть призвести до збитків. Доступність послуг, продуктів WEEX та пов’язаних із ними подій може відрізнятися залежно від регіону. Ви несете відповідальність за забезпечення відповідності вашої участі чинному місцевому законодавству та нормативним актам.
Вам також може сподобатися

Шахрайство з AI на 3,2 мільйона доларів: основна арена безпеки криптовалют переходить від «коду» до «шахрайства»

Метт Деймон виступить з основною доповіддю! У Нью-Йорку відбудеться «Ripple Swell 2026»

Голосування щодо кредитування XRP Ledger: Що повинні знати власники XRP

Як картини могли стати частиною цифрової економіки, але не стали

IPO Shein та PMI Китаю: що змінюється для ринків

Від Pay до універсального управління активами: BiyaPay розширює межі глобальних фінансових послуг

Трамп заробив 1,4 мільярда доларів на криптовалюті, інвестори втратили 4,7 мільярда доларів

Приватні транзакції Zcash можуть знизитися до 200 мс

За сплеском Robinhood Chain: реальне процвітання чи емоційна премія?
![[Перше засідання шостого читача блоку медіа] "Необхідно диференціюватися глибокими статтями ⋯ Критика статті про лістинг альткоїнів від голови Пак Хьонджу вразила"](/public-static/9_8dc682caea.png?format=avif)
[Перше засідання шостого читача блоку медіа] "Необхідно диференціюватися глибокими статтями ⋯ Критика статті про лістинг альткоїнів від голови Пак Хьонджу вразила"

36-денний гальмування стейкінгу коштує депозиторам Ethereum понад 350 000 доларів у втрачених винагородах щодня

Штучний інтелект створює безмежність, BTC створює дефіцит: справжня зміна Web3 полягає не в виробничих відносинах, а у відносинах вартості

Хто продає Yushu? Масштабна передача акцій на високих рівнях, наступного року буде звільнено 228,7 мільйона акцій

Ripple пожертвувала 300 тисяч доларів на допомогу постраждалим від повені в Непалі та Тибеті

Арбітраж криптовалют та цінове сканування: як квантові трейдери виявляють неефективність фінансування та спредів через торгові API

Дефіцит DRAM до 2030 року: як позиціонуватися на ринку пам'яті?

Чому стейблкоїни не можуть стати кредитними інструментами?

Revolut починає впровадження EURR, оскільки ЄЦБ деталізує заходи конфіденційності цифрового євро

РАКІБ створює раду з розвитку фінансових інститутів: асоціація готує крипторинок до саморегулювання

Як відрізнити pipedog від сусіднього клонованого контракту з тим же байт-кодом

Після впливу на два покоління Meta зобов'язана виплатити 18 мільярдів доларів

Що таке Thinking Cat (HMM)? Причини, чому токени без власника можуть зазнати невдачі

Поліція Великої Британії вилучила біткоїни на суму 1,4 мільйона доларів з закритого ринку даркнету

Технічний аналіз проти фундаментального аналізу: визначення, відмінності та способи використання - Світ фінансових технологій

Деривативи починають зворотно впливати на спот: цінова влада над активами Південної Кореї виводиться за межі країни

HYPE стикається з виведенням команди на $36 млн 6 вересня

USD1 надходить до Binance, оскільки гаманець Fireblocks переміщує 30 мільйонів доларів

Біткоїн: через 12 років він відновлює свій гаманець і стає мільйонером

Адвокат Ripple пов'язує закон CLARITY з ростом робочих місць у США






