Francuski startup AI Kog stawia na przyspieszenie wnioskowania GPU przez oprogramowanie
Rywalizacja w zakresie przyspieszania wnioskowania AI nabiera tempa. Francuski startup Kog nie zdecydował się na opracowanie własnych chipów, lecz postawił na optymalizację oprogramowania, aby w pełni wykorzystać możliwości wnioskowania istniejących GPU w centrach danych przedsiębiorstw.
Skupienie na scenariuszach o wysokim opóźnieniu
Firma zyskała uwagę w maju tego roku dzięki prezentacji technologicznej. Kog pokazał, że przy użyciu standardowych GPU w centrach danych, takich jak AMD MI300X i Nvidia H200, można osiągnąć bardzo szybkie prędkości dekodowania pojedynczych żądań. Firma później stwierdziła, że ta prezentacja przyniosła około 200 wyraźnych wskazówek biznesowych.
Kog obecnie koncentruje się na profesjonalnych przepływach pracy, które wymagają wysokiej prędkości reakcji, szczególnie w scenariuszach inżynierii oprogramowania. Według firmy, niektórzy użytkownicy intensywnie generujący kod mogą czekać na wyniki nawet przez kilka godzin, a opóźnienia w wnioskowaniu stały się istotnym problemem wpływającym na doświadczenie użytkownika i koszty.
Firma współpracuje również z niektórymi partnerami projektowymi, aby wdrożyć aplikacje. Tego typu klienci pozwalają użytkownikom generować gry lub aplikacje za pomocą podpowiedzi, a zwiększenie prędkości wnioskowania zazwyczaj oznacza wyższą efektywność konwersji i większe możliwości przychodowe.
Mały model osiągnął 3000 TPS
Kog wcześniej postawił sobie cel "przyspieszenia wnioskowania dużych modeli o 30 razy", ale obecne publiczne demonstracje wciąż opierają się głównie na małych modelach. Ich prezentacja wykorzystywała model Laneformer 2B z około 2 miliardami parametrów, osiągając prędkość wnioskowania na poziomie 3000 tokenów na sekundę. Model ten jest już dostępny jako open source.
Jednakże popyt rynkowy nie ogranicza się do dostosowywania małych modeli. Kog stwierdził, że potencjalni klienci nie zamierzają koncentrować się na małych modelach, dlatego od czasu publikacji demonstracji firma skupiła się na przyspieszeniu rozwoju większych modeli, aby dostosować się do rzeczywistych potrzeb.
Weryfikacja możliwości dużych modeli przed wrześniem
Kog uważa, że potencjał GPU w dekodowaniu wnioskowania nie został jeszcze w pełni wykorzystany. Dyrektor generalny firmy, Gaël Delalleau, stwierdził, że wraz z ciągłym wzrostem przepustowości pamięci GPU nowej generacji, w warstwie oprogramowania wciąż istnieje duża przestrzeń do optymalizacji.
Kosztem tej metody jest długi czas rozwoju. Kog stwierdził, że dostosowanie nowego GPU często wymaga od zespołu poświęcenia kilku tygodni, a nawet miesięcy na badania na poziomie sprzętu. Przy obecnej wielkości zespołu liczącego 11 osób, liczba chipów, które firma może wspierać w krótkim okresie, pozostaje ograniczona.
Kog planuje w przyszłości stopniowo wprowadzać tę metodę do procesów rozwoju opartych na agentach, aby wspierać więcej chipów i modeli. Kluczowym punktem na ten moment jest najpierw udowodnienie, że ta droga może być skuteczna w przypadku dużych modeli. Delalleau przewiduje, że firma zakończy realizację pierwszego głównego modelu z około 10-krotnym przyspieszeniem przed wrześniem i na tej podstawie zaprezentuje postępy klientom, co pomoże w dalszym finansowaniu serii A.
Cena --
Niniejsza treść ma charakter wyłącznie informacyjny i nie stanowi porady finansowej, inwestycyjnej, prawnej ani podatkowej. Wszelkie wydarzenia, nagrody, promocje online lub powiązane informacje, o których tu mowa, nie powinny być traktowane jako rekomendacja, zachęta ani zaproszenie do kupna, sprzedaży, wymiany lub innego rodzaju obrotu aktywami kryptograficznymi. Aktywa kryptograficzne charakteryzują się dużą zmiennością i mogą prowadzić do strat. Dostępność usług, produktów i powiązanych wydarzeń WEEX może się różnić w zależności od regionu. Użytkownik jest odpowiedzialny za upewnienie się, że jego udział jest zgodny z obowiązującymi lokalnymi przepisami i regulacjami.
Możesz również polubić

JP Morgan przedstawia strategię dywersyfikacji inwestycji w AI

Współpracownik Dogecoina ostrzega o podatności w portfelach BitBox

Od Mint do TapeOut: Przewodnik dla nowicjuszy po pierwszym doświadczeniu

a16z analizuje moc obliczeniową AI: podwójne przychody, presja na akcje, niesamowite wydatki kapitałowe

Apple planuje globalną zmianę cen, cena iPhone 17 może wzrosnąć o 1000 juanów

NVIDIA rozszerza plan finansowania AI do 500 miliardów dolarów
![[Analiza Alpha] Peter Thiel inwestuje 72% swojego portfela w energię... Wąskie gardło inwestycji w AI się zmienia](/public-static/7_ca1b7746d1.png?format=avif)
[Analiza Alpha] Peter Thiel inwestuje 72% swojego portfela w energię... Wąskie gardło inwestycji w AI się zmienia

Korea Południowa zbliża się do 20 bilionów długu, czy rynek przesadza z oczekiwaniami na podwyżki stóp?

Badanie UBS nad chińskim łańcuchem AI: szybka iteracja dużych modeli, kapitał zaczyna płynąć w kierunku półprzewodników

Arm Holdings uznaje przegląd fuzji i przejęć z Cerebras i Marvell

Zagrożenia związane z AI przyciągają uwagę inwestorów w akcje cyberbezpieczeństwa

NVIDIA inwestuje 1,5 miliarda dolarów w dewelopera centrów danych powiązanego z SoftBankiem

Wzrost chipów pamięci AI, SK Hynix kontynuuje wzrost przed otwarciem rynku

Nowa „ropa” w erze AI, kontrakty futures na moc obliczeniową wkrótce na rynku

Finansowanie mocy obliczeniowej AI: Modele open source wprowadzają moc obliczeniową na rynek kapitałowy (część 2)

NVIDIA planuje zainwestować 3 miliardy dolarów w SB Energy na wsparcie projektu OpenAI

a16z nowy artykuł: Od kopalni kryptowalut do chmury AI, dlaczego 'nowa chmura' coraz bardziej spala pieniądze?

Google i AMD współpracują nad 10. generacją TPU, integrując rdzenie CPU w odpowiedzi na potrzeby obliczeń AI

Nowa generacja Roadstera Tesli może zadebiutować w tym miesiącu: supersamochód z silnikiem rakietowym SpaceX, zdolny do "latania" wkrótce na rynku

PKB Tajwanu wzrasta o 13,72% w pierwszej połowie roku: Eksport AI napędza wzrost do najwyższego poziomu od 40 lat

USA planuje wprowadzenie "jednoznacznych pytań" dla partnerów AI: Pax Silica przekształca się z ram współpracy w oboz technologiczny

Wiele amerykańskich ETF-ów zwiększa zaangażowanie w chińskie akcje chipowe

Nvidia planuje zainwestować 3 miliardy USD w SB Energy na megaprojekt centrów danych OpenAI

Wall Street Journal: Jak handel AI kradnie blask kryptowalutom?

Stany Zjednoczone wymagają od 35 krajów wyboru strony w rywalizacji AI między USA a Chinami

NVIDIA posiada udziały w SpaceX o wartości około 21 miliardów dolarów

Fundusz majątkowy ZEA dostosowuje portfel akcji AI w USA, sprzedaje Broadcom, zwiększa udziały w Micron i Palantir

NVIDIA rozważa zmiany w projekcie Feynman na 2028 rok

NVIDIA rozpoczyna masową produkcję Ethernet Photonics Spectrum-X




