Gemini 3.7 Flash Review: Tani model Google'a już nie jest głupi
Google wypuścił Gemini 3.7 Flash 13 sierpnia, ogólnie dostępny w ponad 160 krajach od pierwszego dnia. Obsługuje do miliona tokenów wejściowych, zwraca 64 000, odczytuje obrazy, wideo, audio i PDF-y oraz może korzystać z narzędzi i sterować komputerem.
Flash nigdy nie był modelem, po który sięgano, gdy problem był trudny. To model, którego używasz do sortowania tekstu, kompresowania sesji agentów, zanim załamią się pod własnym kontekstem, oraz podsumowywania dokumentów, za które nie chcesz płacić, aby przeczytać je na flagowym modelu. Myriad: Kiedy OpenAI wyda GPT-6? Kliknij, aby wyrazić swoją prognozę.
Oceniając pod kątem takich zadań, 3.7 Flash to prawdziwy upgrade. W porównaniu do wszystkiego innego, to kompetentny model, który jest wyprzedzany przez oprogramowanie, które możesz pobrać za darmo.
Własna karta wyników Google'a stawia 3.7 Flash przed Claude Sonnet 5 i GPT-5.6 Terra w 11 z 18 testowanych kategorii. Nagłówkowe liczby to 1588 Elo na tablicy rozwoju webowego Code Arena i 30,4% na AutomationBench. Oba pochodzą z metodologii Google'a, więc traktuj przewagę jako roszczenie firmy, a nie ustaloną fakt.
Testowaliśmy model, aby sprawdzić, czy spełnia roszczenia Google'a. Oto nasze wyniki.
Kodowanie: Czy może zbudować coś, co działa za pierwszym razem?
Ten test mierzy generację kodu w trybie zero-shot - czy model zamienia jedno polecenie w działające oprogramowanie bez przykładów do skopiowania i bez możliwości naprawienia się. Przekazujemy pojedynczy prompt na grę przeglądarkową i wysyłamy cokolwiek wróci, w tym błędy. Bez dalszych pytań, bez raportów o błędach, bez drugiej próby.
Gemini 3.7 Flash przeszedł w 2 minuty i 13 sekund. Gra była grywalna przy pierwszym uruchomieniu, składnia była czysta, logika kolizji i punktacji działała, a jakość wizualna była wyższa niż sugeruje poziom cenowy.
Porównanie, które ma znaczenie, to nie flagowy model. To Gemini 3.6 Flash, wydane 21 lipca, które w ogóle nie mogło wygenerować działającego pliku. Jego HTML był źle sformatowany, elementy nie renderowały się, a dalsze polecenia proszące o naprawienie własnego wyniku nie przyniosły rezultatu.
Ostatecznie przekazaliśmy te zgliszcza do DeepSeek, który znalazł 11 błędów i wysłał 8 poprawek, aby uczynić je grywalnymi. Trzy tygodnie później ta sama linia produktów nie potrzebuje ratunku, a wynik jest bliski temu, co wyprodukował GPT-5.6 Sol w naszej recenzji z lipca.
Gemini 3.7 Flash wygrywa tę rundę bezsprzecznie i to jest najsilniejszy powód, aby przejść na nowy model. Zastrzeżenie jest takie, że wykonuje specyfikacje, a nie je wymyśla, więc niejasny prompt daje ci niejasną grę.
Możesz spróbować gry Gemini 3.7 Flash tutaj.
Pisanie kreatywne: Czy może utrzymać paradoks i napisać zdanie?
Ta sekcja testuje jednocześnie dwie rzeczy: jakość literacką oraz to, czy model może przestrzegać zasady strukturalnej w tysiącach słów. Prompt wysyła Jose Lanz z 2150 roku z powrotem do roku 1000 i wymaga zamkniętej pętli przyczynowej - jego interwencja musi być tym, co tworzy przyszłość, którą przybył zapobiec.
Zasada, która decyduje o teście, to ostatni klauzula: Nie może zrozumieć, co zrobił, dopóki nie wróci do domu.
Gemini 3.7 Flash wygenerował przyzwoity wynik. Jose wystrzeliwuje entropijną armatę w pirenejski szczelinę, przypadkowo tworzy obelisk, który zniewala 22-wieczną Iberyjczyków, i rozumie całą pętlę, stojąc w błocie tysiąc lat wcześniej: "To była podstawa Cinder Spire."
Maszyneria fabularna jest naprawdę całkiem solidna. Historia wspomina spadającą gwiazdę, którą widzieli starożytni mnisi i wyjaśnia, że to był błysk przybycia Jose, a broń, którą przyniósł, aby wymazać anomalię, to właśnie ją tworzy. Jego zamykająca linia - "Po prostu czekała, aż ją ukończy" - wprowadza determinizm, o który prosił prompt.
Ale dla tych, którzy są do tego przyzwyczajeni, ta historia krzyczy "AI". Prawie każdy rzeczownik przychodzi z dwoma przymiotnikami przyczepionymi: "hiper-luminescencyjne wieże", "wilgotna, porośnięta mchem ziemia", "gęste, obsydianowe włosy". To jest tekstura modelu wybierającego najbardziej prawdopodobne następne słowo zamiast wybierania jednego, co powoduje kolizje jak monolit "brzęczący niską częstotliwością humu".
Porównaliśmy go z Qwopus3.5-27B-v3, społecznościowym dostosowaniem Qwen3.5-27B, które destyluje rozumowanie w stylu Claude Opus i działa na pojedynczym konsumenckim GPU za nic za zapytanie. Przestrzegał zasady, którą złamał Gemini.
Jose zabija mnicha w San Millán de la Cogolla, prawdziwym klasztorze w La Rioja, który naprawdę miał znaczenie około roku 1000, i dopiero po powrocie do 2150 roku rozumie, co zrobił, znajdując swoje DNA w woskowo zapieczętowanym kodeksie.
Qwopus również nie jest całkowicie czysty. Wyrzucił cały swój plan na początku historii, w tym błędy, a jego ostatnia sekcja łamie zamkniętą pętlę, którą budował przez osiem sekcji, pozwalając Jose cofnąć się i naprawić rzeczy.
Ale biorąc pod uwagę wszystko, Qwopus wygrywa. Gemini dostarczył bardziej schludny pakiet i bardziej zdyscyplinowane zakończenie, ale nie spełnił jednego polecenia, wokół którego zbudowano podpowiedź, a darmowy model działający na GPU do gier napisał lepszą historię.
Myślenie asocjacyjne: Czy metafora może nieść argument?
Ten test mierzy rozumowanie asocjacyjne - czy model potrafi generować powiązania między niezwiązanymi koncepcjami bez konieczności wyjaśniania siebie. Podpowiedź prosi o opis gałązki, wykorzystuje ten opis do wyjaśnienia wyzysku pracowników i kultu bogatych, a następnie wymaga, aby argument rozpuścił się w opisie sałaty.
Wskazywanie jest trybem niepowodzenia. Nazwanie metafory zabija ją.
Gemini nazywa ją w pierwszym zdaniu drugiego akapitu: "To jest precyzyjna mechanika nowoczesnego proletariatu." Wszystko przed tym działało.
Niektóre z obrazów zasługują na swoje miejsce. Pracownik otrzymuje "wystarczająco dużo kory, aby pozostać sztywnym przez kolejny tydzień produkcji", a opadłe gałązki są uwarunkowane, aby wierzyć, że przy wystarczającej sztywności każda z nich może stać się pniem. Akapit zawierający pierwszy z nich zawiera również pracownika "związanego z ogromną, top-heavy korporacyjną hierarchią."
Nieźle pod względem logiki i struktury.
Rozpuszczenie to prawdziwy upadek. Gemini narruje przejście, zamiast je wykonać - hierarchie "kruszeją, rozpuszczając się w cichej, skromnej rzeczywistości organicznego świata pod spodem" - a następnie sałata po prostu się pojawia, niepowiązana z niczym przed nią.
GPT-5.6 Sol rozkłada gałązkę na glebę i wyrasta z niej sałata: "Deszcz wnika w ziarno. Włókna luzują się, ciemnieją." Argument również przychodzi ukryty w obiekcie, z bogactwem przekształconym w język cnoty, gdzie "Dwór oznacza inteligencję."
GPT-5.6 Sol wygrywa zdecydowanie. Gemini stworzył ładną indywidualną linię, ale wyjaśnił swoją własną metaforę, a następnie pominął przejście, które podpowiedź testowała.
Logika: Czy czyta podpowiedź czy rozpoznaje zagadkę?
Ten test mierzy rozumowanie nielogiczne, a konkretnie, czy model czyta pytanie przed sobą, czy dopasowuje wzór do wersji, którą zapamiętał. Nasza podpowiedź mostowa daje czterem osobom jedną pochodnię i czasy przejścia wynoszące 1, 2, 5 i 10 minut, a następnie pyta, jak szybko mogą wszyscy przejść.
Sztuczka polega na tym, co podpowiedź pomija. Nigdy nie mówi, że tylko dwie osoby mogą być na moście jednocześnie, więc odpowiedź to 10 minut - wszyscy przechodzą razem w tempie najwolniejszej osoby.
Gemini odpowiedział 17 minut, wykonując zapamiętany pięcioetapowy szereg z podręcznikowej wersji zagadki. Stwierdził ograniczenie jako fakt, nie sprawdzając nigdy, czy to napisaliśmy.
GPT-5.6 vs Fable 5 Review: Which One You Pick Depends on These Factors
Jego widoczne rozumowanie jest gorsze niż odpowiedź. Ślad argumentuje, że wysłanie dwóch najwolniejszych razem byłoby nieefektywne, ponieważ ktoś musiałby przynieść latarnię z powrotem - a potem ostateczna odpowiedź wysyła ich razem. Przeczy to samo w sobie w jednej odpowiedzi i raportuje wynik z całkowitą pewnością.
Claude Fable 5 wylądował na tej samej błędnej liczbie w lipcu. Otworzył, deklarując, co zakłada, "zakładając klasyczne ograniczenie, że most utrzymuje tylko dwie osoby na raz", co jest różnicą między błędną odpowiedzią, którą można wychwycić, a taką, której nie można.
Nikt nie wygrywa. Fable zdobywa punkty tylko za przejrzystość, a fałszywa pewność w agentach Gemini pojawia się tutaj w zagadce, którą można sprawdzić ręcznie.
Matematyka: Czy kończy zadanie?
Ten test mierzy symboliczną matematykę daleko poza użyciem konsumenckim, plus coś prostszego - czy model robi to, o co go poproszono. Polecenie wymaga wielomianu monicznego stopnia 19 z rzeczywistymi współczynnikami i liniowym współczynnikiem -19, którego krzywa dzieli się na co najmniej trzy nieredukowalne komponenty, a następnie pyta o p(19).
Oba modele znalazły tę samą bramę. Gemini i Qwen 3.7 Max Preview zidentyfikowały wielomian Dicksona, rozwiązały ograniczenie, aby ustalić jego parametr na 1, i poprawnie wyprowadziły formę zamkniętą.
Potem Gemini się zatrzymało. Wydrukowało p(19) jako niewycenioną ekspresję związaną z 19. potęgą pierwiastka kwadratowego, nigdy nie wyprodukowało liczby i nigdy nie wykazało liczby komponentów, o które również proszono. Dostarczyło to wszystko w stylizowanej stronie HTML z CSS i cieniem, którego nikt nie prosił.
Qwen zakończył. Dał pełną faktoryzację na 10 komponentów - jeden liniowy, dziewięć kwadratowych - przeprowadził rekurencję do 1,876,572,071,974,094,803,391,179 i sprawdził wynik modularnie. Zweryfikowaliśmy tę liczbę niezależnie w SymPy i się zgadza.
Qwen wygrywa na jedynym kryterium, które miało znaczenie. Gemini zaczęło dobrze, a potem postanowiło pominąć arytmetykę, co jest dziwnym miejscem na zatrzymanie.
Wnioski
Gemini 3.7 Flash jest wart zmiany, jeśli już jesteś w ekosystemie Google. Jest dramatycznie lepszy w kodzie niż model, który zastępuje, wystarczająco szybki, aby mieć znaczenie w pracy agenta, i wystarczająco tani, że jego uruchomienie w dużej skali to błąd zaokrąglenia.
Jego mocne strony to wykonanie i struktura. Daj mu szczegółową specyfikację, a zbuduje to, utrzyma fabułę razem i zachowa spójną logikę przyczynową w tysiącach słów.
Jego słabości to kreatywność i rozumowanie. Pisanie jest na tyle przewidywalne, że można je zidentyfikować jako stworzone przez maszynę na pierwszy rzut oka, a model twierdzi, że odpowiedzi są błędne, nie zaznaczając założenia, które je błędne uczyniło.
Cena jest najsilniejszym argumentem za tym. Przy 75 centach za milion tokenów wejściowych i 3,75 USD za wyjście, obniża stawkę wejściową GPT-5.6 Sol o 85% i kosztuje połowę tego, co 3.6 Flash kosztowało przy premierze.
Argument przeciwko temu to darmowy model 27B na GPU do gier, który napisał lepszą historię i nie pobierał nic za to. Wprowadzenie Google'a wygasa 31 grudnia, kiedy stawka wejściowa wzrasta do 1,50 USD, a wyjściowa do 7,50 USD.
Cena --
Niniejsza treść ma charakter wyłącznie informacyjny i nie stanowi porady finansowej, inwestycyjnej, prawnej ani podatkowej. Wszelkie wydarzenia, nagrody, promocje online lub powiązane informacje, o których tu mowa, nie powinny być traktowane jako rekomendacja, zachęta ani zaproszenie do kupna, sprzedaży, wymiany lub innego rodzaju obrotu aktywami kryptograficznymi. Aktywa kryptograficzne charakteryzują się dużą zmiennością i mogą prowadzić do strat. Dostępność usług, produktów i powiązanych wydarzeń WEEX może się różnić w zależności od regionu. Użytkownik jest odpowiedzialny za upewnienie się, że jego udział jest zgodny z obowiązującymi lokalnymi przepisami i regulacjami.
Możesz również polubić

Gemini uzyskało wsparcie arbitrażu, nie ponosi odpowiedzialności za upadek programu pożyczkowego Earn

Platformy kryptowalutowe straciły 3,63 miliarda dolarów z powodu cyberataków

Ant Group wprowadza model finansowy Ling-3.0-flash-Fin, otwarcie kodu w przyszłym tygodniu

Virtuals wzmacnia politykę bezpieczeństwa portfeli agentów AI

Wartość rynkowa Alphabet spadła o prawie 700 miliardów dolarów, wątpliwości co do konkurencyjności AI

Google wprowadza model transkrypcyjny Gemini 3.5

Mastercard wspiera hackathon XRP Ledger w Nowym Jorku w październiku

Nowy model płatności za usługi Google Cloud Gemini Enterprise

Gemini łączy siły z Apex, aby rozszerzyć swoje rynki prognozowania kryptowalut dla amerykańskich brokerów

Ryzyko kredytowe Gemini AI: Deutsche Bank analizuje w 5 minut

Czemu OpenAI traci kierownictwo?

List do akcjonariuszy Andrew Kang: Inwestycje w roboty wkraczają w nowy etap, wyceny w private equity wciąż znacznie w tyle

Google uruchomił Gemini Enterprise for Legal dla kancelarii prawnych

Najlepsze modele sztucznej inteligencji do handlu; porównanie 10 najlepszych modeli

Biznesmen z Las Vegas grozi 280 lat więzienia za schemat Ponziego na 24 miliony dolarów w kryptowalutach

Roman Storm oskarża Google i OpenAI o wspieranie Korei Północnej

Poranny raport z Wall Street: CPI i PPI spadają, S&P osiąga nowe szczyty, SanDisk i Workday napędzają wzrosty w sektorze pamięci i oprogramowania, a komunikacja optyczna doświadcza realizacji zysków

Gemini raportuje stratę netto w wysokości 107,7 miliona dolarów, akcje spadają o ponad 7%

Doniesienia o przekazaniu władzy w DeepMind, oficjalne tytuły niejasne

Najlepsze platformy dla agentów AI 2026: tylko 130 z tysięcy jest prawdziwych

Czy modele open-source zabić zapotrzebowanie na moc obliczeniową? Morgan Stanley prognozuje trzy przyszłości AI

Sergej Brin ponownie zaangażowany w strategię AI Google'a

SemiAnalysis: Gemini 3 Pro może być szczytem konkurencyjności modeli Google, a usługi chmurowe największym beneficjentem

Rewolucja w kierownictwie AI Google: fizyczne rozdzielenie między głęboką wodą AGI a codziennymi modelami

Opóźnienie w premierze Google Gemini 3.5 Pro

Microsoft twierdzi, że MDASH przewyższa Claude Mythos i GPT-5.6 Sol w teście cyberbezpieczeństwa

Robinhood rozważa umowę z Crypto.com w miarę wzrostu konkurencji na rynku prognoz

Nieczynne moce obliczeniowe, tania energia, niedoceniane modele - DGrid chce przekształcić je w zyski

Rekordowy wynik na Mistrzostwach Świata: 5,7 miliarda $ zakładów na Kalshi i Polymarket





