Wczoraj wieczorem w Dolinie Krzemowej miała miejsce bitwa bogów AI
Autor: Max, 01 Founder
Redaktor: Max
Wczoraj w nocy w Dolinie Krzemowej miały miejsce trzy ważne wydarzenia.
Google ogłosiło Gemini 3.8 Flash, Meta zaprezentowało Muse Spark 1.3, a wcześniej nieznana firma startupowa Mostik zyskała uwagę w prestiżowym wywiadzie dla WIRED.
Jeśli spojrzeć tylko na pierwsze dwa wydarzenia, można by pomyśleć, że to kolejna zwykła noc z AI.
Google właśnie wprowadziło Gemini na szczyt rankingu DeepSWE, a kilka godzin później Meta ogłosiło jeszcze lepszy wynik, a tytuł światowego lidera utrzymał się zaledwie przez kilka godzin.
W 2026 roku wszyscy mogą być już na to obojętni.
Wydania modeli, aktualizacje benchmarków, kilka godzin świętowania na X, a potem czekanie na kolejną firmę, która zaktualizuje wyniki.
Jednak jeśli połączyć te trzy wydarzenia z wczoraj wieczorem, to naprawdę interesujące rzeczy nie znajdują się na tych listach.
Ekonomia AI przechodzi gwałtowną zmianę.
W ciągu ostatnich kilku lat, gdy rozmawialiśmy o kosztach AI, najczęściej patrzyliśmy na to, ile kosztuje milion tokenów.
Jednak po pojawieniu się Agentów, ten sposób pomiaru staje się coraz mniej użyteczny.
Prawdziwe pytania, które będą miały znaczenie w przyszłości, mogą nie dotyczyć "ile kosztuje milion tokenów", ale "ile kosztuje naprawienie błędu", "ile kosztuje wykonanie badania", "ile kosztuje, aby Agent pracował przez trzy godziny bez przerwy".
A wczoraj wieczorem koszty wnioskowania zaczęły spadać z kilku zupełnie różnych kierunków jednocześnie.
Google wprowadza możliwości na poziomie frontier do coraz tańszych modeli, Meta pozwala Agentom wykonać te same zadania przy użyciu mniejszej liczby tokenów i wywołań narzędzi, a Mostik idzie jeszcze dalej, zaczynają kwestionować:
Jeśli obie strony komunikacji są AI, dlaczego modele muszą komunikować się w języku zaprojektowanym dla ludzi?
CZĘŚĆ.01, Gemini wrócił
Zacznijmy od Google.
Google ogłosiło swój nowy flagowy model Gemini 3.8 Flash, który oficjalnie nazywają najsilniejszym modelem wnioskowania i kodowania, jaki kiedykolwiek stworzyli.
To także trzecia aktualizacja serii Flash w ciągu sześciu tygodni, od 3.6 do 3.7, a teraz do 3.8.
Dotychczas Flash był postrzegany jako bardzo prosty: szybszy, tańszy, ale z nieco gorszymi możliwościami niż najsilniejsze modele.
Google powoli zmienia tę definicję.
Tym razem najważniejsze ulepszenia 3.8 Flash koncentrują się na długoterminowym kodowaniu i agentowym przepływie pracy.
W ocenie zdolności AI do długoterminowego inżynierii oprogramowania DeepSWE v1.1 uzyskał około 74%.
Największa różnica między DeepSWE a tradycyjnymi benchmarkami kodu polega na tym, że nie polega on na zadawaniu modelowi pytania algorytmicznego, ale rzeczywiście umieszcza Agenta w repozytorium kodu.
Model musi zrozumieć problem, wyszukać kod, zmodyfikować pliki, wywołać narzędzia, przeprowadzić testy, a po niepowodzeniu kontynuować poszukiwania przyczyny.
Pełne zadanie może trwać dziesiątki, a nawet setki kroków.
W takich testach Gemini 3.8 Flash osiągnął szczyt światowy.
Claude Opus 5 również osiągnął około 74%, GPT-5.6 Sol około 73%, a wcześniej prowadzący Fable 5 około 70%.
Jeśli spojrzeć tylko na zdolności, te najsilniejsze modele nie różnią się już znacznie.
Prawdziwie przerażający jest inny wskaźnik: pieniądze.
Cena początkowa API Gemini 3.8 Flash pozostaje na poziomie 0,75 USD / 1M tokenów za wejście i 3,75 USD / 1M tokenów za wyjście.
Wykonanie pełnego zadania na DeepSWE kosztuje średnio tylko 2,36 USD.
Dla porównania, Claude Opus 5, również około 74%, ma średni koszt pojedynczego zadania wynoszący 11,84 USD; GPT-5.6 Sol około 73%, średni koszt wynosi 6,46 USD.
Oznacza to, że przy tej samej zdolności inżynierii oprogramowania, koszty wykonania mogą różnić się wielokrotnie.
To stanie się bardzo ważne w erze Agentów.
W erze chatbotów, różnica kilku centów w odpowiedzi nie była odczuwalna dla przeciętnego użytkownika.
Jednak Agenci są zupełnie inni, agent kodujący może wykonać 100 kroków, agent badawczy może przeszukać dziesiątki stron internetowych, przeczytać setki stron materiałów, a w przyszłości Agenci w firmach mogą pracować przez kilka godzin bez przerwy.
Google nawet wspomniało, że 3.8 Flash w przypadku złożonych zadań będzie aktywnie "pracować ciężej", przeprowadzając więcej wnioskowań i wywołań narzędzi.
Google nie oszczędza na kosztach, aby model "myślał mniej", ale ponieważ tokeny są już wystarczająco tanie, można pozwolić mu na dłuższe pętle.
Dlatego uważam, że prawdziwe znaczenie 3.8 Flash nie polega na tym, że ponownie zdobył tytuł światowego lidera.
Ale na tym, że wprowadza zdolności, które wcześniej były dostępne tylko dla najdroższych modeli frontier, do przedziału cenowego Flash.
CZĘŚĆ.02, trzy i pół godziny później Meta wróciła
Podczas gdy zespół Google świętował wydanie Gemini 3.8 Flash, Meta nagle wróciła.
Meta nagle ogłosiła model Muse Spark 1.3.
Według ocen opublikowanych przez Meta, Muse Spark 1.3 osiągnęło wynik 75,4% w DeepSWE v1.1.
Ten wynik przewyższa Gemini 3.8 Flash, Claude Opus 5 i GPT-5.6 Sol.
Co więcej, Muse Spark 1.2 w tym teście osiągnęło tylko około 55%.
Z wersji 1.2 do 1.3, mała aktualizacja wersji zwiększyła wynik o około 20 punktów procentowych.
Jednak uważam, że to, co naprawdę warto zauważyć w przypadku Meta, to nie tylko 75,4%.
Są jeszcze dwa inne wskaźniki: wywołania narzędzi zmniejszyły się o około 20%, a zużycie tokenów zmniejszyło się o około 25%.
To może być łatwo przeoczone, ale jest to bardzo bliskie najważniejszym problemom po prawdziwej komercjalizacji Agentów.
Najwięcej pieniędzy marnuje Agent, gdy nie rozumie zadania.
Na przykład agent kodujący w 20. kroku błędnie zrozumiał wymagania, może kontynuować modyfikację pięciu plików, przeprowadzać trzy rundy testów, przeszukiwać dużą ilość kodu, a na końcu odkryć, że poszedł w złym kierunku, a potem wszystko zaczyna od nowa.
W ten sposób marnuje się dziesiątki wywołań narzędzi i tysiące tokenów.
Dlatego model, który może wcześniej zauważyć, że zadanie jest niejednoznaczne, wcześniej zrozumie, że nie może kontynuować, wcześniej zapyta użytkownika, w rzeczywistości bezpośrednio obniża koszty.
Wzmocnione zdolności Muse Spark 1.3 należą do tej kategorii: może jednocześnie utrzymywać wiele przepływów pracy w długich wątkach, aktywnie pytać w przypadku niejasnych zadań, prosić o pomoc w przypadku problemów, które są nieodwracalne, a po wielu rundach długich zadań jest mniej skłonny do zapomnienia początkowych ograniczeń.
Meta zaczęła nawet podkreślać, że model rozumie swoje granice: wie, co potrafi, a co nie.
Te zdolności mogą nie wyglądać tak atrakcyjnie, jak wzrost benchmarku o 20 punktów w erze chatbotów, ale w erze Agentów mogą one bezpośrednio przekładać się na pieniądze.
Mniej błędów popełnionych przez Agenta to optymalizacja wnioskowania.
Dlatego patrząc na Google i Meta razem, jednostki miary w konkurencji dużych modeli cicho się zmieniają.
W przyszłości ludzie mogą coraz mniej interesować się "ile kosztuje milion tokenów", a coraz bardziej innym wskaźnikiem:
Ile kosztuje wykonanie rzeczywistego zadania od początku do końca.
CZĘŚĆ.03, Mostik, przełomowe osiągnięcie
Jeśli Google i Meta wciąż badają, jak wykonać zadania taniej i z mniejszą liczbą tokenów, to Mostik zaczyna dotykać bardziej podstawowego pytania:
Dlaczego te tokeny muszą istnieć?
Mostik w języku rosyjskim oznacza "most".
CEO Sasha Malysheva jest głównym twórcą tej metody, a jej głównym naukowcem jest profesor Uniwersytetu Genewskiego, laureat Medalu Fieldsa z 2010 roku, Stanislav Smirnov.
Próbują zrobić coś, co brzmi bardzo prosto, ale w rzeczywistości jest niezwykle trudne: sprawić, aby dwa modele AI nie komunikowały się już za pomocą języka naturalnego.
Dziś zdecydowana większość systemów Multi-Agent działa w ten sposób:
Model A po uzyskaniu informacji generuje setki, a nawet tysiące tokenów, aby przedstawić swoje wnioski w języku naturalnym; Model B następnie odczytuje te słowa, ponownie je interpretuje i tworzy swoje wewnętrzne reprezentacje, a następnie kontynuuje wnioskowanie.
Ale problem polega na tym, że to, co naprawdę oblicza duży model, nie jest ani chińskim, ani angielskim, lecz:
Wysokowymiarową, ciągłą reprezentacją matematyczną.
To tak, jakby dwa komputery mogły bezpośrednio przesyłać dane, ale komputer A najpierw drukuje plik na setkach stron, a następnie komputer B skanuje go kamerą, strona po stronie, aby go odczytać.
W przeszłości wszyscy skupiali się na tym, jak obniżyć koszty druku, a Mostik postanowił po prostu wyrzucić drukarkę.
Próbują zbudować most między wewnętrznymi reprezentacjami różnych modeli, aby modele mogły wymieniać latentne reprezentacje, zamiast najpierw generować język naturalny.
Eksperyment ujawniony przez autorytet w Dolinie Krzemowej, WIRED, jest bardzo interesujący.
Mostik połączył pełną wersję GLM-5.2 753B z wersją Qwen 3.5, która ma tylko 4B i może działać na urządzeniach mobilnych.
Ostateczny mieszany system ma zdolności pomiędzy dwoma modelami, ale koszt wnioskowania wynosi tylko 1/20 pełnego GLM-5.2.
Oczywiście, mówienie teraz, że Mostik rozwiązał problem komunikacji modeli, jest zdecydowanie przedwczesne.
Latentna komunikacja nie pojawiła się po raz pierwszy wczoraj; w ciągu ostatnich kilku lat było wiele badań próbujących wymieniać embeddingi, stany ukryte, pamięci KV i inne wewnętrzne reprezentacje.
Prawdziwym wyzwaniem jest to, że różne modele mają różne architektury, parametry, dane treningowe i wewnętrzne układy współrzędnych. Jak sprawić, by dwa modele naprawdę zrozumiały swoje latentne przestrzenie, to samo w sobie jest bardzo trudnym problemem.
Smirnov sam przyznaje, że obecnie brakuje nawet dojrzałego języka matematycznego do opisu wspólnych reprezentacji między różnymi modelami.
Jednak liczba 1/20 wciąż mnie bardzo ekscytuje.
Ponieważ zaczynam poważnie myśleć o zupełnie innej architekturze AI w przyszłości.
CZĘŚĆ 04: W przyszłości potrzebujesz tylko modelu o wielkości 0, kilka B
W ciągu ostatnich dwóch lat, rozmawiając o AI na urządzeniach końcowych, ciągle badaliśmy, jak wcisnąć większe modele do telefonów: 7B, 4B, 3B, 1B, nieustannie destylując, kwantyzując i kompresując.
Ale jeśli ta droga Mostika naprawdę się sprawdzi, myślę, że przyszłe telefony mogą w ogóle nie potrzebować dużego modelu, który „wszystko potrafi”.
Twoje urządzenie może potrzebować tylko małego modelu o wielkości 0.xB lub kilku B.
Jest tani, może działać nieprzerwanie, odpowiada za zrozumienie, w której aplikacji aktualnie jesteś, co właśnie zrobiłeś, w jakim stanie jest urządzenie i przetwarza większość prostych, częstych zadań.
Prawdziwe trudności będą pojawiać się w bardziej skomplikowanych problemach, które będą rozwiązywane przez komunikację w latentnej przestrzeni zdalnego dużego modelu.
Ale kluczowa różnica polega na tym, że nie musi, jak dzisiaj, przesyłać całego kontekstu o dziesiątkach tysięcy tokenów do chmury, aby zdalny model mógł go przeczytać od nowa.
Może potrzebować tylko przesłać wysoko skompresowany stan latentny.
Zdalny duży model, po zakończeniu skomplikowanego wnioskowania, również nie musi generować kilku tysięcy tokenów naturalnego języka, aby wyjaśnić lokalnemu modelowi, lecz po prostu przesłać nowe wewnętrzne reprezentacje.
W ten sposób lokalny mały model odpowiada za częste, tanie, nieprzerwane działanie, a chmurowy model frontier odpowiada tylko za rzadkie, ale naprawdę trudne wnioskowanie, a pośrednio wykorzystuje jakiś most do efektywnej komunikacji.
Jeśli w przyszłości uda się to osiągnąć, spadek kosztów wnioskowania może być znacznie większy niż dzisiejsze obniżki cen API o 30% czy 50%.
Może to zmienić sposób, w jaki organizujemy obliczenia AI.
CZĘŚĆ 05: Zakończenie
Patrząc wstecz na wczoraj wieczorem, na powierzchni były to trzy zupełnie różne wiadomości.
Google wydało Gemini 3.8 Flash, wprowadzając możliwości na poziomie frontier w przedziale cenowym Flash;
Meta wydało Muse Spark 1.3, umożliwiając Agentowi wykonanie większej liczby zadań przy mniejszej liczbie tokenów i wywołań narzędzi;
Mostik poszedł jeszcze dalej, zaczynając próbować, aby część tokenów między modelami w ogóle nie była generowana od samego początku.
Wszystkie one wskazują na tę samą zmianę:
Inteligencja staje się niezwykle tania w bardzo szybkim tempie.
A ta obniżka cen nie dotyczy już tylko jednostkowej ceny API.
Ceny modeli spadają, ilość obliczeń potrzebnych do wykonania zadań maleje, a teraz nawet sposób wymiany informacji między modelami zaczyna być na nowo projektowany.
Ostateczny wpływ tej sytuacji może być znacznie większy niż kilka punktów procentowych wzrostu benchmarków.
Ponieważ wiele technologii naprawdę wybucha, nigdy nie dzieje się to w momencie, gdy „po raz pierwszy można je używać”, ale wtedy, gdy „w końcu stały się na tyle tanie, że można je używać bez ograniczeń”.
Dziś zlecenie Agentowi wydania dziesiątek dolarów na wykonanie zwykłego zadania dla przeciętnego człowieka może być całkowicie nieopłacalne.
Jeśli w przyszłości wystarczy kilka groszy, wiele aplikacji, które dziś wydają się szalone, nagle stanie się realnych.
Dziś nie możemy pozwolić sobie na to, aby dziesiątki Agentów działały przez 24 godziny wokół jednej osoby; jeśli koszty wnioskowania spadną o jeden lub dwa rzędy wielkości, może to stać się domyślnym stanem.
Jest już siódma rano, powinienem był spać kilka godzin temu.
Ale po zakończeniu Gemini, Meta kilka godzin później znów się odezwało, a potem zobaczyłem eksperyment Mostika z 1/20.
Leżąc w łóżku, wciąż myślałem o tych sprawach, myśląc o modelu 0.xB w telefonie, myśląc o dużym modelu w chmurze, myśląc, że może wcale nie muszą rozmawiać ze sobą w naturalnym języku.
Im więcej myślałem, tym trudniej było mi zasnąć, więc w końcu wstałem i napisałem ten artykuł.
74% Gemini, 75.4% Muse, za kilka dni mogą pojawić się nowe liczby, które je zastąpią.
Ale teraz naprawdę trudno mi uspokoić tę ekscytację.
Ponieważ w porównaniu do tego, kto znowu zdobył pierwsze miejsce na świecie, coraz bardziej interesuje mnie inne pytanie:
Jak tanie może być tak inteligentne AI?
Gdy potężna inteligencja stanie się naprawdę tania i dostępna do swobodnego użycia, myślę, że wiele dzisiejszych produktów AI, które wydają się szalone, może dopiero zaczynać.
Niniejsza treść ma charakter wyłącznie informacyjny i nie stanowi porady finansowej, inwestycyjnej, prawnej ani podatkowej. Wszelkie wydarzenia, nagrody, promocje online lub powiązane informacje, o których tu mowa, nie powinny być traktowane jako rekomendacja, zachęta ani zaproszenie do kupna, sprzedaży, wymiany lub innego rodzaju obrotu aktywami kryptograficznymi. Aktywa kryptograficzne charakteryzują się dużą zmiennością i mogą prowadzić do strat. Dostępność usług, produktów i powiązanych wydarzeń WEEX może się różnić w zależności od regionu. Użytkownik jest odpowiedzialny za upewnienie się, że jego udział jest zgodny z obowiązującymi lokalnymi przepisami i regulacjami.
Możesz również polubić

Arthur Hayes: ETH wzrośnie w tym roku do 10 000 USD, a ekspansja bilansu Fedu wprowadzi płynność na rynek kryptowalut

Dzień Przemysłu: CABA straciła 17 tysięcy miejsc pracy w sektorze w ciągu 2 lat i ostrzegają, że spadek trwa

Czym jest „Czerwony Wrzesień”? Klątwa Bitcoina i dlaczego Wall Street nie może się od niej uwolnić

Lokaty w dolarach: bank zaktualizował stawki, które mogą osiągnąć nawet 4,5%

Nowe badania obalają teorię "upadku banków" w kręgu kryptowalut

Departament Skarbu USA staje się „cieniem banku centralnego”, niezależność polityki monetarnej Fed jest zagrożona

Trzy publiczne łańcuchy bloków wstrzymane w ciągu czterech dni, kto ma prawo nacisnąć przycisk pauzy?

HYPE po raz pierwszy w indeksie ETF kryptowalut w USA, tuż za SOL

Startup zajmujący się danymi treningowymi AI stał się najszybszym jednorożcem w historii Y Combinatora

Magalu w Mercado Livre: co partnerstwo ujawnia o e-commerce

Fairshake wchodzi w wybory w USA z budżetem 122 mln dolarów

USDC może być tak bezpieczny przed kwantami, jak jego najwolniejszy portfel, most lub blockchain

Opóźnienie IPO Kraken do drugiego kwartału 2027: raport

Giertych chciał wyłudzić informacje ws. zondacrypto? Siostra Suszka zdradza kulisy

Ustawa CLARITY może zostać przyjęta w ciągu kilku tygodni, mówi Atkins

Cięcie inflacji Solany jest przedwczesne, mówi CEO SOL Strategies

Wolumen zleceń na XRP Ledger wzrasta o 79% w obliczu spadku liczby traderów

Raport Fed: Amerykańska gospodarka rośnie w umiarkowanym tempie, ale presja inflacyjna pozostaje

Reforma BCRA może być jedną z najbardziej restrykcyjnych w regionie, według międzynarodowego stowarzyszenia banków

Arabia Saudyjska potwierdza śmierć dwóch filipińskich marynarzy w wyniku irańskiego ataku na tankowiec

Kurs dolara spada, ale pozostaje powyżej 1,510 $ i rynek przewiduje większe napięcia

Inwestycje w AI i dobre wyniki firm... Pozytywne sygnały dla amerykańskiej gospodarki według przewodniczącego Fed - Bloomberg

Śledzenie kryptowalut może być włączone do kontroli przychodów walutowych eksporterów

Najlepsze zdecentralizowane platformy AI w 2026 roku

Rynek obligacji skarbowych w USA uwięziony w trójwymiarowej burzy inflacji, zacieśnienia i podaży, przekracza 5%

Przychody ArbitrumDAO osiągnęły 6,19 miliona dolarów w pierwszej połowie roku

Czego $344M wydatków politycznych w kryptowalutach oczekuje od Kongresu

Bezpieczeństwo AI staje się rynkiem wartym miliardy dolarów i przyciąga 100 mln USD

Słaby ADP i rosnące Treasuries: co to zmienia dla inwestorów

