Komentarz Bernstein o siedmiu pamięciach: Po HBM, DRAM i NAND rywalizują o następny rynek wart bilion dolarów
TL;DR · Zapotrzebowanie AI na pamięć nie ogranicza się tylko do HBM. Trening wymaga pełnego systemu pamięci, obejmującego HBM, systemowy DRAM, SSD i pamięć współdzieloną. · Prawdziwe wąskie gardło wnioskowania pojawia się na etapie dekodowania. Cache KV rośnie wraz z długością kontekstu i liczbą użytkowników równocześnie, a pojemność pamięci może wcześniej ograniczyć skalę komercjalizacji niż wagi modelu. · Agent dodatkowo zwiększa presję na pamięć. Wiele kroków wywołania generuje kontekst, wywołuje zewnętrzne narzędzia i zwiększa zapotrzebowanie na CPU, DRAM i Cache KV. · Pomiędzy HBM a tradycyjnymi SSD pojawia się wiele nowych poziomów, w tym CXL, „Storage Next” i CMX, których celem jest przyjęcie rosnących danych wnioskowania przy niższych kosztach. · Nowe ścieżki technologiczne nie zawsze mogą być wdrożone. HBF, zHBM, NVHBM, ZAM i PIM borykają się z problemami związanymi z odprowadzaniem ciepła, wydajnością, kompatybilnością ekosystemu lub redystrybucją korzyści w łańcuchu dostaw. · Bernstein nadal jest optymistyczny wobec Samsung Electronics, SK Hynix, Micron, SanDisk, Seagate i Western Digital, utrzymując dla Kioxia ocenę „gorszą od rynku”.
W ciągu ostatnich dwóch lat narracja rynkowa dotycząca pamięci AI koncentrowała się prawie wyłącznie na HBM. Jednak w miarę przechodzenia dużych modeli od treningu do masowego wnioskowania, samo zwiększenie HBM nie rozwiązuje wszystkich problemów.
W najnowszym globalnym raporcie o pamięci Bernstein wskazuje, że różne obciążenia AI mają wyraźnie różne wymagania dotyczące pamięci: trening kładzie nacisk na moc obliczeniową i przepustowość, podczas gdy etap dekodowania w wnioskowaniu bardziej polega na pojemności, RAG wymaga dużych baz danych, a przepływ pracy agenta jednocześnie zwiększa obciążenie zarówno tradycyjnych serwerów, jak i serwerów AI.
Oznacza to, że zmiany wprowadzane przez AI zaczynają przenikać z HBM w dół do systemowego DRAM, SSD, HDD, a nawet pamięci taśmowej. Wokół „ściany pamięci” łańcuch dostaw zaczyna wprowadzać nowe produkty pomiędzy istniejącymi poziomami, mając nadzieję na znalezienie nowej równowagi między wydajnością, pojemnością a kosztami.
Ograniczenie skali wnioskowania może zależeć od Cache KV
Na etapie treningu dużych modeli GPU i HBM nadal odgrywają kluczową rolę.
Trening wymaga częstego odczytu parametrów modelu i danych pośrednich, co wiąże się z wysokimi wymaganiami dotyczącymi mocy obliczeniowej i przepustowości pamięci. Jednak trening dużego modelu nie opiera się tylko na HBM: oryginalny zestaw danych musi być przechowywany na tańszych nośnikach pamięci; zanim dane trafią do GPU, zazwyczaj muszą być buforowane i wstępnie przetwarzane przez systemowy DRAM i lokalne SSD; długotrwały trening, trwający tygodnie lub nawet miesiące, wymaga również regularnego zapisywania punktów kontrolnych, aby uniknąć rozpoczęcia zadania od nowa w przypadku awarii sprzętu lub oprogramowania.
Dlatego jedno duże szkolenie w rzeczywistości wykorzystuje pełny system pamięci, obejmujący HBM, systemowy DRAM, lokalne SSD i pamięć sieciową.
Po przejściu do etapu wnioskowania zapotrzebowanie na pamięć dalej się różnicuje.
Wnioskowanie można zazwyczaj podzielić na dwa etapy: wstępne wypełnienie (Prefill) i dekodowanie (Decode). Wstępne wypełnienie odpowiada za przetwarzanie danych wejściowych od użytkownika i generowanie pierwszego tokena, głównie wykonując dużą ilość operacji macierzowych, co bardziej przypomina „ograniczoną moc obliczeniową”. Na tym etapie wykorzystanie GPU i przepustowość HBM są jeszcze ważniejsze, a powszechnym wskaźnikiem jest opóźnienie pierwszego tokena.
Etap dekodowania jest inny. Model musi generować tokeny jeden po drugim, a podczas generowania nowego tokena korzysta z wcześniej wygenerowanych informacji. Aby uniknąć powtarzania obliczeń, system zazwyczaj przechowuje te dane w Cache KV.
Cache KV ma dwie ważne cechy: jego pojemność rośnie liniowo wraz z długością kontekstu, a każdy użytkownik potrzebuje niezależnego bufora. Dlatego, gdy kontekst staje się dłuższy, a liczba użytkowników równocześnie wzrasta, oba te czynniki wspólnie zwiększają wykorzystanie pamięci.
Bernstein uważa, że w dużych wdrożeniach AI pamięć zajmowana przez Cache KV może przekroczyć wagę modelu, stając się głównym czynnikiem ograniczającym liczbę równocześnie działających użytkowników i okna kontekstowego. To, ilu użytkowników model może obsłużyć i jak długo może utrzymać kontekst, ostatecznie wpłynie na skalę przychodów.
Z tego punktu widzenia, konkurencja w erze wnioskowania nie polega tylko na tym, ile obliczeń może wykonać chip, ale także na tym, jak system może przechowywać i odczytywać rosnący kontekst przy jak najniższych kosztach.
RAG i Agent, przesuwają zapotrzebowanie w kierunku tradycyjnej pamięci
Powszechność RAG i Agenta sprawiła, że zapotrzebowanie na pamięć AI jeszcze bardziej rozprzestrzeniło się poza HBM.
RAG obejmuje głównie dwa etapy: budowę bazy danych i wyszukiwanie bazy danych. Podczas budowy bazy danych system musi przetwarzać dużą ilość niestrukturalnych danych, takich jak PDF, strony internetowe, kody itp., a następnie przekształcać je w wektory i indeksy, które można przeszukiwać. Ten proces bardziej polega na dużych pojemnościach SSD i systemowym DRAM, a rola HBM jest stosunkowo ograniczona.
Po utworzeniu bazy danych zapytania użytkowników są najpierw przekształcane w wektory, a następnie dopasowywane do treści w bazie danych. Generowanie wektorów można szybko wykonać na GPU i HBM, ale prawdziwe wyszukiwanie zazwyczaj bardziej polega na systemowym DRAM. Wyniki wyszukiwania są następnie łączone z pytaniami użytkowników i wchodzą w normalny proces wstępnego wypełnienia i dekodowania.
Przepływ pracy Agenta wprowadza jeszcze większe obciążenie.
Tradycyjna rozmowa zazwyczaj polega na pojedynczym wywołaniu „wejście---model---wyjście”, podczas gdy Agent musi podzielić cel na wiele kroków, wywołując inne modele lub zewnętrzne narzędzia, zapisując wyniki pośrednie i ponownie planując na podstawie informacji zwrotnej. Wynik każdego wywołania może stać się wejściem do następnego wywołania modelu.
To jednocześnie zwiększa dwa rodzaje zapotrzebowania: z jednej strony, wywołania narzędzi i zadania nie-AI wymagają więcej CPU i pamięci systemowej; z drugiej strony, ciągłe przekazywanie kontekstu między różnymi modelami szybko zwiększa obciążenie wstępnego wypełnienia, dekodowania i Cache KV.
Dlatego rozwój aplikacji Agenta nie tylko sprzyja GPU i HBM, ale także może zwiększyć zapotrzebowanie na DRAM serwerów, SSD klasy enterprise oraz tańsze nośniki pamięci.
Pomiędzy HBM a SSD, pojawiają się nowe poziomy pamięci
Tradycyjny system pamięci serwerów można zasadniczo podzielić na pamięć podręczną wewnętrzną procesora, systemowy DRAM, lokalne SSD i pamięć współdzieloną. Serwery AI wprowadzają HBM do tej struktury, ale pojemność HBM jest ograniczona, a koszty wysokie, co utrudnia obsługę wszystkich danych.
Obecne rozwiązanie w łańcuchu dostaw polega na wprowadzeniu nowych produktów pomiędzy różnymi poziomami.
CXL stara się zintegrować fizycznie rozproszone pamięci w wspólną pulę zasobów, umożliwiając CPU, GPU i urządzeniom rozszerzającym bardziej elastyczne wywoływanie DRAM. Niektóre produkty wykorzystują również DRAM lub SRAM jako pamięć podręczną, łącząc je z NAND, co pozwala na obniżenie kosztów i skrócenie opóźnienia dostępu.
„Storage Next”, promowane przez Nvidię, stara się przenieść część zarządzania pamięcią z CPU do GPU, a także umożliwić NAND uzyskanie opóźnień, IOPS i granularności dostępu do danych zbliżonych do DRAM. Seria SSD GP wprowadzona przez Kioxia oparta na XL-FLASH jest reprezentantem tego kierunku.
CMX jest głównie skierowane na Cache KV. Umieszcza SSD w niezależnych węzłach danych, łącząc je z węzłami obliczeniowymi za pomocą DPU, Ethernetu i chipów przełączających. Jego celem jest dzielenie kontekstu wnioskowania między różnymi GPU, zmniejszenie powtarzającego się przechowywania, a także przełamanie ograniczeń pojemności pamięci jednego serwera.
Te rozwiązania wspólnie wskazują na ten sam trend: systemy AI nie mogą długoterminowo przechowywać wszystkich aktywnych danych w HBM, muszą rozdzielać je na różne poziomy w zależności od częstotliwości dostępu i wymagań dotyczących opóźnienia.
Dane gorące pozostają w HBM, część kontekstu przenosi się do systemowego DRAM lub wysokowydajnych SSD, a chłodniejsze dane są przesuwane do zwykłych SSD, HDD, a nawet taśm. Im bardziej szczegółowe poziomy pamięci, tym większa szansa na osiągnięcie równowagi między wydajnością a kosztami przez system.
Nowe technologie pojawiają się gęsto, ale komercjalizacja nadal wiąże się z niepewnością
Wokół „ściany pamięci” łańcuch dostaw już zaproponował wiele nowych ścieżek.
Plan zHBM Samsunga zakłada umieszczenie HBM w stosie nad procesorem, co ma na celu dalsze skrócenie odległości przesyłania danych. Jednak ten projekt wymaga zarządzania ciepłem generowanym przez GPU, a także stawia wyższe wymagania dotyczące wydajności i kosztów związanych z mieszanym łączeniem na poziomie wafla.
NVHBM promowane przez Nvidię przekazuje podstawowe chipy do projektowania Nvidii, a produkcja może być zlecona TSMC. To rozwiązanie ma na celu obniżenie zużycia energii i zwiększenie przepustowości, ale może również osłabić wartość projektowania i produkcji producentów pamięci w zakresie podstawowych chipów HBM. W miarę standardyzacji produktów część wartości dodanej może być przeniesiona od producentów pamięci do Nvidii i fabryk półprzewodników.
HBF, promowane przez SanDisk i SK Hynix, ma na celu wykorzystanie NAND do zapewnienia przepustowości zbliżonej do HBM, jednocześnie uzyskując większą pojemność i niższe koszty jednostkowe. Jednak NAND i DRAM nadal mają znaczną różnicę w opóźnieniach i wydajności, a HBF musi pokonać wiele poziomów technologicznych, co nie jest łatwe do wdrożenia.
ZAM Intela próbuje obrócić chipy DRAM o 90 stopni, aby poprawić odprowadzanie ciepła, z celem osiągnięcia użyteczności w roku finansowym 2029; HBC Qualcomma wykorzystuje LPDDR i tradycyjne pakowanie, aby obejść koszty CoWoS kosztem części wydajności.
Ponadto PIM stara się bezpośrednio dodać zdolności obliczeniowe do chipów pamięci, aby zmniejszyć przesył danych między procesorem a pamięcią. Jednak to zmieni istniejącą architekturę obliczeniową, wymagając współpracy procesora, oprogramowania i sieci, a także wpłynie na już wysoko rozwinięty system podziału pracy między chipami logicznymi a pamięciowymi. Bernstein uważa, że jego zastosowanie w branży nadal jest ograniczone.
Z tego punktu widzenia szybki wzrost liczby nowych rozwiązań nie oznacza, że wszystkie ścieżki mogą stworzyć rynek o dużej skali. Możliwość kompatybilności z istniejącym ekosystemem oprogramowania i sprzętu, posiadanie przewagi kosztowej oraz zdolność do osiągnięcia równowagi interesów w łańcuchu dostaw będą decydować o ostatecznym wyniku komercjalizacji.
Beneficjenci pamięci AI nie będą ograniczeni tylko do producentów HBM
Z perspektywy inwestycyjnej, ocena Bernsteina jest dość jasna: wpływ AI na przemysł pamięci rozprzestrzenia się z nielicznych produktów wysokiej klasy na więcej poziomów.
HBM nadal pozostaje kluczowym elementem treningu i wysokowydajnego wnioskowania, a Samsung Electronics, SK Hynix i Micron będą nadal korzystać z zapotrzebowania na pamięć o wysokiej przepustowości. Jednak w miarę rozszerzania się skali wnioskowania, znaczenie systemowego DRAM i NAND wzrośnie. Przepełnienie Cache KV, bazy danych RAG oraz ogromne ilości danych pośrednich generowanych przez Agenta również zwiększą zapotrzebowanie na SSD i pamięć współdzieloną.
Chłodniejsze dane będą nadal przesuwać się w dół. Bernstein stwierdza, że wzrost danych spowodowany przez AI już zaczyna przynosić korzyści HDD; w niektórych scenariuszach, z powodu niewystarczającej pojemności NAND i HDD, rośnie również zapotrzebowanie na taśmy, które tradycyjnie były używane głównie do archiwizacji.
Raport nadal przyznaje oceny „przewyższające rynek” dla Samsung Electronics, SK Hynix, Micron, SanDisk, Seagate i Western Digital. W tym Samsung Electronics, SK Hynix i Micron odpowiadają za DRAM i HBM, SanDisk korzysta z NAND i HBF, a Seagate i Western Digital odpowiadają za tańsze nośniki o dużej pojemności. Kioxia została oceniona jako „gorsza od rynku”.
Jednak kluczowa wartość tego raportu nie polega na wymienieniu szeregu nowych skrótów technologicznych, ale na redefiniowaniu granic rynku pamięci AI.
Wąskie gardła ery treningu koncentrują się głównie na GPU i HBM; w erze wnioskowania i Agenta, wąskie gardła zaczynają rozprzestrzeniać się w całym systemie pamięci. W przyszłości konkurencja w infrastrukturze AI będzie zależała nie tylko od tego, jak szybko chipy mogą obliczać, ale także od tego, czy dane mogą efektywnie przepływać między HBM, DRAM, NAND i pamięcią współdzieloną przy wystarczająco niskich kosztach.
Niniejsza treść ma charakter wyłącznie informacyjny i nie stanowi porady finansowej, inwestycyjnej, prawnej ani podatkowej. Wszelkie wydarzenia, nagrody, promocje online lub powiązane informacje, o których tu mowa, nie powinny być traktowane jako rekomendacja, zachęta ani zaproszenie do kupna, sprzedaży, wymiany lub innego rodzaju obrotu aktywami kryptograficznymi. Aktywa kryptograficzne charakteryzują się dużą zmiennością i mogą prowadzić do strat. Dostępność usług, produktów i powiązanych wydarzeń WEEX może się różnić w zależności od regionu. Użytkownik jest odpowiedzialny za upewnienie się, że jego udział jest zgodny z obowiązującymi lokalnymi przepisami i regulacjami.
Możesz również polubić

Arbitraż kryptowalut i skanowanie cen: jak kwanty znajdują nieefektywności w stopach finansowania i spreadach za pomocą API handlowych

Niedobór DRAM do 2030 roku: jak zainwestować w gigantów pamięci?

Dlaczego stablecoiny nie mogą być kredytami, mimo że umożliwiają przelewy i zachowanie wartości?

Revolut rozpoczyna wdrażanie EURR, gdy EBC szczegółowo opisuje zabezpieczenia prywatności cyfrowego euro

RAKIB powołuje radę ds. rozwoju instytucji finansowych: stowarzyszenie przygotowuje rynek kryptowalut do samoregulacji

Jak odróżnić pipedoga od jego identycznego klona bytecode

Po wpływie na dwie pokolenia, Meta została skazana na odszkodowanie w wysokości 18 miliardów dolarów

Czym jest Thinking Cat (HMM)? Powody, dla których tokeny bez właściciela mogą zawieść

Brytyjska policja skonfiskowała bitcoiny o wartości 1,4 miliona dolarów z zamkniętego rynku dark web

Analiza techniczna vs analiza fundamentalna: definicje, różnice i sposoby ich wykorzystania - Świat Fintech

Instrumenty pochodne zaczynają wpływać na rynek spot: Koreańskie prawo do wyceny aktywów odpływa za granicę

HYPE staje w obliczu wycofania zespołu o wartości 36 milionów dolarów 6 września

USD1 przepływa do Binance, gdy portfel Fireblocks przenosi 30 mln dolarów

Bitcoin: 12 lat później odzyskuje swój portfel i staje się milionerem

Prawnik Ripple łączy ustawę CLARITY z wzrostem zatrudnienia w USA

Przedstawicielka EBC wzywa banki centralne do przyjęcia technologii blockchain

25. słowo: Sekretny sejf w Twoim portfelu Ledger

Tom Lee w najnowszym wywiadzie: Cztery czynniki, które napędzą wzrost ETH w tym roku

Japońska Komisja Usług Finansowych żąda zwiększenia budżetu o 13,4 miliarda jenów na rok 2027, planując utworzenie nowego biura do monitorowania aktywów kryptograficznych

Czy Strategy w końcu wraca do trybu „kupuj, kupuj, kupuj” po 10 tygodniach przerwy?

Bitcoin nie jest już tylko ryzykownym aktywem, według przedstawiciela BlackRock

Japońska opozycyjna koalicja na skraju załamania po nieudanej fuzji

Poranny raport z Wall Street: Jastrzębi Waller przerywa szaleństwo mocy obliczeniowej, giganci chmurowi zyskują dzięki "wynajmowaniu AI", nadchodzi fala podwyżek w górę

Otwarcie rynku azjatyckiego i zmienność kryptowalut: Jak indeks Nikkei 225, KOSPI i handel carry w jenie wpływają na Bitcoin

Prognozy dotyczące 'stablecoinów dolarowych' z Jackson Hole... "Dominacja dolara będzie się wzmacniać"

Saylor wzywa do działania, ale tym razem ma prawdziwe zasoby

Rozpoczęcie walki HIP-4: Kto stanie się nowym trade.xyz?

Bitcoin zyskuje na wartości jako alternatywa dla słabego dolara

Czy można zarabiać na handlu kryptowalutami? Rzeczywistość ryzyka i nagrody, zarządzanie kapitałem oraz niezbędne narzędzia

