Właśnie wydano Claude 5.1! Najpotężniejszy model na świecie jest już dostępny

By: www.chaincatcher.com|2026/09/02 01:28:23
0
Udostępnij
copy
Oceń nas w GoogleOceń nas w Google

Oryginalny artykuł od Maszyny Umysłu, śledź AI
Właśnie, Anthropic wprowadził nową generację modeli Claude Fable 5.1 i Claude Mythos 5.1.

Anthropic twierdzi, że Claude Fable 5.1 jest jednym z najpotężniejszych publicznie dostępnych modeli, zaprojektowanym do złożonego rozumowania, długoterminowych zadań i przepływów pracy Agentów. Claude Mythos 5.1 reprezentuje z kolei wyższe granice możliwości, które eksplorują.

Warto zauważyć, że chociaż oba modele dzielą tę samą podstawową zdolność modelu, zastosowano różne środki bezpieczeństwa w zależności od scenariuszy użycia.

Fable 5.1 jest otwarty dla zwykłych użytkowników, programistów i firm, podczas gdy Mythos 5.1 jest przeznaczony dla zatwierdzonych partnerów w obszarach wysokiego ryzyka, z zachowaniem surowszej kontroli dostępu.

Innymi słowy, jeden model jest odpowiedzialny za pracę w rzeczywistym świecie, a drugi pozostaje w bardziej kontrolowanym środowisku. Może to być również eksploracja przez Anthropic przyszłych form produktów AI: najpotężniejszy model niekoniecznie musi być dostępny w tej samej formie dla wszystkich.

Oficjalnie stwierdzono, że oba modele reprezentują istotny postęp w zdolnościach serii Claude i pokazują, jak w miarę zwiększania zdolności modelu, kontynuują postęp w bezpiecznym wdrażaniu.

Jako "najpotężniejszy" model, Fable 5.1 nadal wykazuje doskonałe wyniki, a dane oficjalne pokazują, że Fable 5.1 przewyższa poprzednią generację flagowego modelu Fable 5 w wielu testach benchmarkowych.

Jednakże, mimo większej mocy, cena spadła. Anthropic stwierdził, że Fable 5.1 utrzymuje tę samą podstawową cenę, a koszty odczytu pamięci podręcznej spadły o 75% w porównaniu do Fable 5. W praktycznym użyciu oznacza to, że całkowity koszt modelu dla typowego obciążenia roboczego spadł o około 25%; dla wysoko zautomatyzowanych obciążeń roboczych koszty mogą spaść nawet o 45%.

Wygląda na to, że nawet najpotężniejsze modele zaczynają zwracać uwagę na stosunek jakości do ceny.

Przyjrzyjmy się szczegółowo.

Niskie poziomy osiągają wyniki poprzedniej generacji, Fable 5.1 stawia na "stosunek jakości do ceny"

W przeciwieństwie do prostego odświeżania list, Anthropic tym razem chce podkreślić, że Fable 5.1 może wykonać zadania, które wcześniej wymagały wysokiego poziomu Fable 5, przy niższych kosztach rozumowania.

Zgodnie z testami oficjalnymi, Fable 5.1 osiąga wyniki bliskie lub nawet przewyższające Fable 5 przy niskiej i średniej intensywności rozumowania. Claude Code domyślnie używa wysokiej intensywności rozumowania, podczas gdy Claude Cowork i Claude . ai używają średniej intensywności, a użytkownicy mogą dostosować intensywność w zależności od złożoności zadania, między prędkością, kosztami a efektami.

Szczegółowo, Fable 5.1 osiągnęło 52,6% w benchmarku Terminal - Bench - Science 0.1, co stanowi ponad dwukrotny wzrost w porównaniu do 24,7% Fable 5; w Terminal - Bench 4.0 Fable 5.1 osiągnęło 55,8%, a otwarty Mythos 5.1 osiągnął 60,9%.

W testach dotyczących pracy wiedzy, operacji komputerowych i procesów biznesowych nowy model również osiągnął poprawę. Wynik AutomationBench wzrósł z 17,1% Fable 5 do 31,4%, a CursorBench 3.2.0 wzrósł z 70,5% do 73,4%.

W wielu testach benchmarkowych wyniki Fable 5.1 przewyższają Fable 5, a poprawa w zakresie zdolności agentów badawczych i procesów biznesowych jest najbardziej widoczna.

W teście Terminal - Bench 4.0, Fable 5.1 i Mythos 5.1 przewyższają poprzednią generację Mythos 5 przy różnych intensywnościach rozumowania.

W teście Terminal - Bench - Science 0.1 Fable 5.1 osiągnęło maksymalny wynik 52,6%, co jest ponad dwukrotnością Fable 5.

Anthropic uważa, że istotną zmianą w Fable 5.1 jest większa chęć śledzenia podstawowych przyczyn problemów, co czyni go bardziej odpowiednim do wykonywania złożonych zadań trwających kilka godzin lub nawet dziesiątek godzin.

Instytucja inwestycyjna Millennium odkryła w testach, że wewnętrzny kod zawieszał się raz na milion uruchomień. Problem ten dręczył zespół inżynieryjny przez cztery lub pięć lat, a inne modele nie były w stanie znaleźć przyczyny. Fable 5.1 zlokalizował problem, analizując zewnętrzne biblioteki dostawców i porównując pliki zrzutu rdzenia, ostatecznie wskazując na błąd w bibliotece zewnętrznej.

Ramp pozwolił również Fable 5.1 na ciągłe działanie przez 38 godzin. Model, po odkryciu, że wyniki uczenia maszynowego były wpływane przez błędy etykiet, samodzielnie naprawił problem i uruchomił sześć eksperymentów, ostatecznie porządkując nowe wyniki i dalsze zalecenia.

Od pisania kodu do prowadzenia badań naukowych

W tej publikacji Anthropic poświęcił znaczną część na omówienie wyników Fable 5.1 i Mythos 5.1 w badaniach naukowych.

W eksperymencie projektowania białek badacze poprosili Mythos 5.1 o użycie narzędzi do projektowania i składania białek, a następnie przekazali wygenerowane projekty dwóm zewnętrznym instytucjom do weryfikacji eksperymentalnej.

W przypadku trzech docelowych białek, związki zaprojektowane przez Mythos 5.1 osiągnęły 10-krotną siłę wiązania w porównaniu do najlepszych rozwiązań w konkursie projektowania białek Adaptyv Bio. W przypadku 12 docelowych białek, wskaźnik trafności skutecznych związków zaprojektowanych przez model wynosił blisko 50%, podczas gdy standardowy poziom branżowy podawany przez Anthropic wynosił od 10% do 15%.

Fable 5.1 wykorzystał również radarowe obrazy z sondy Magellan NASA sprzed ponad 30 lat, aby wygenerować nową mapę wysokości o wysokiej rozdzielczości dla około jednej trzeciej powierzchni Wenus.

Radarowe obrazy Wenus z sondy Magellan NASA, na środku znajduje się mały wulkan tarczowy o średnicy około 15 kilometrów.

Oryginalna mapa mogła przedstawiać szczegóły w skali 10 do 20 kilometrów, nowa mapa zwiększa zdolność rozdzielczości do 2 do 3 kilometrów, a dokładność pomiarów wysokości wzrasta o maksymalnie 25%. Anthropic planuje udostępnić tę mapę na zasadzie licencji na dzielenie się wiedzą, aby mogła być wykorzystana przez przyszłe misje NASA VERITAS i Europejskiej Agencji Kosmicznej EnVision.

W dziedzinie biologii obliczeniowej Mythos 5.1, poprzez pisanie dostosowanych rdzeni GPU i buforowanie wyników pośrednich, zwiększył prędkość działania siedmiu otwartych modeli białek i genomów nawet o 2,5 razy, jednocześnie zachowując spójność wyników. W niektórych zadaniach analizy całego genomu przewiduje się, że można obniżyć koszty GPU o 30% do 60%.

Mythos 5.1, po optymalizacji siedmiu otwartych modeli białek i genomów, zwiększył prędkość rozumowania od 1,4 do 2,5 razy.

Anthropic chce udowodnić, że modele przechodzą od organizowania materiałów i pisania kodu do proponowania rozwiązań, uruchamiania narzędzi i dostarczania wyników badań do weryfikacji eksperymentalnej.

Ceny pamięci podręcznej spadły o 75%, a zadania Agentów są tańsze o 45%

Oprócz wydajności, cena jest bezpośrednią zmianą w Fable 5.1.

Ceny wejścia i wyjścia Fable 5.1 nie uległy zmianie, nadal wynoszą 10 dolarów za milion tokenów i 50 dolarów, ale cena odczytu pamięci podręcznej spadła o 75%, do 0,25 dolara za milion tokenów.

Odczyt pamięci podręcznej odnosi się do ponownego użycia kontekstu, który został już przetworzony przez model. W przypadku zwykłych pytań może to mieć ograniczony udział, ale w zadaniach Agentów, które wymagają wielokrotnego odczytu kodów, historii rozmów i wyników narzędzi, pamięć podręczna często stanowi główny koszt.

Zgodnie z obliczeniami Anthropic na podstawie danych z rzeczywistego użycia w sierpniu 2026 roku, całkowity koszt uruchamiania typowych zadań Fable 5.1 jest o około 25% niższy niż Fable 5; w przypadku złożonych zadań Agentów, które mają długie konteksty i częste wywołania narzędzi, koszty mogą spaść nawet o około 45%.

Po obniżeniu ceny odczytu pamięci podręcznej, całkowity koszt typowych zadań Fable 5.1 spadł o około 25%, a koszty zadań wysoko zautomatyzowanych spadły o maksymalnie 45%.

Fable 5.1 jest już dostępny na Claude . ai, Claude Code i Claude API, a także przez AWS, Google Cloud i Microsoft Azure. Programiści mogą wywołać nowy model przez claude - fable -5-1.

Wzmocniony mechanizm ochrony przed destylacją

Fable 5.1 i Mythos 5.1 w rzeczywistości korzystają z tego samego podstawowego modelu, a ich główna różnica polega na ograniczeniach bezpieczeństwa.

Fable 5.1 jest całkowicie otwarty dla zwykłych użytkowników i firm; Mythos 5.1 ma luźniejsze ograniczenia w zakresie bezpieczeństwa sieciowego i nauk życia, obecnie dostępne tylko dla zatwierdzonych osób i instytucji.

W dziedzinie bezpieczeństwa sieciowego Fable 5.1 może już pomóc użytkownikom w wykrywaniu luk w oprogramowaniu, ale nadal nie może bezpośrednio generować programów wykorzystujących te luki. Zadania o podwójnym zastosowaniu, takie jak testy penetracyjne, generowanie exploitów i skanowanie luk w oprogramowaniu na podstawie plików binarnych, mogą nadal być przekazywane do modeli o surowszych ograniczeniach.

Po dostosowaniu nowy mechanizm ochrony w zakresie bezpieczeństwa sieciowego zmniejszył liczbę fałszywych alarmów o około 60% w porównaniu do Fable 5. Wskaźnik fałszywych alarmów w mechanizmie bezpieczeństwa biologicznego w przypadku podstawowych problemów biologicznych i medycznych również spadł o 85%, a zaawansowane zdolności związane z badaniami naukowymi w dziedzinie życia są głównie udostępniane poprzez program zatwierdzania Mythos 5.1.

Anthropic wprowadził również Enterprise Frontier Safeguards. Firmy mogą przechowywać dane w kontrolowanej przez siebie infrastrukturze chmurowej, a odpowiedzialność za domyślną ręczną kontrolę spoczywa na firmach, co pozwala na zachowanie zdolności monitorowania bezpieczeństwa przy jednoczesnym osiągnięciu efektu "zerowego przechowywania danych" w zakresie prywatności. Ten mechanizm planuje być wprowadzany stopniowo od tej jesieni.

W odniesieniu do destylacji dużych modeli Fable 5.1 wprowadził również nowe ograniczenia. Konta API utworzone po tym dniu nie będą mogły ręcznie modyfikować wcześniejszego kontekstu w wieloetapowych rozmowach, zachowując jednocześnie historię myślenia Claude'a. Anthropic stwierdził, że ta zmiana ma na celu zablokowanie metody wydobywania zdolności, która została już ujawniona.

Ponadto, aby spełnić wymagania unijnej "Ustawy o sztucznej inteligencji", tekstowe wyjście Fable 5.1 będzie zawierać niewidoczne znaki wodne. Anthropic rozpoczął również testy wykrywania API w małej skali, które są otwarte dla organów regulacyjnych, mediów, organizacji zajmujących się weryfikacją faktów i instytucji badawczych.

Na koniec, użytkownicy mają rację, że wczesne ptaki korzystają z 5.1.

Niniejsza treść ma charakter wyłącznie informacyjny i nie stanowi porady finansowej, inwestycyjnej, prawnej ani podatkowej. Wszelkie wydarzenia, nagrody, promocje online lub powiązane informacje, o których tu mowa, nie powinny być traktowane jako rekomendacja, zachęta ani zaproszenie do kupna, sprzedaży, wymiany lub innego rodzaju obrotu aktywami kryptograficznymi. Aktywa kryptograficzne charakteryzują się dużą zmiennością i mogą prowadzić do strat. Dostępność usług, produktów i powiązanych wydarzeń WEEX może się różnić w zależności od regionu. Użytkownik jest odpowiedzialny za upewnienie się, że jego udział jest zgodny z obowiązującymi lokalnymi przepisami i regulacjami.

Możesz również polubić

iconiconiconiconiconiconiconicon
Obsługa klienta:@weikecs
Współpraca biznesowa:@weikecs
Quant trading i MM:[email protected]
Program VIP:[email protected]