Sztuczna inteligencja

Dlaczego najnowsza wersja Claude jest dwa razy inteligentniejsza, ale dwa razy droższa

Anthropic wydaje Claude Fable 5.1, podwajając wydajność w kluczowych benchmarkach przy zachowaniu cen premium. Dowiedz się, jak wpływa to na Twój budżet na AI.
Dlaczego najnowsza wersja Claude jest dwa razy inteligentniejsza, ale dwa razy droższa

Większość ludzi zakłada, że aktualizacja oprogramowania jest jak aktualizacja telefonu, w której otrzymuje się więcej funkcji w tej samej cenie. Anthropic właśnie przełamał ten cykl wraz z wydaniem Claude Fable 5.1. Choć model ten ma znacznie większe możliwości niż jego poprzednik, zajmuje on specyficzne miejsce na rynku. Jego uruchomienie kosztuje dwa razy więcej niż modelu wydanego przez Anthropic zaledwie dwa miesiące temu i wymaga od użytkowników poważniejszego zastanowienia się nad budżetem przed kliknięciem przycisku prześlij.

W ubiegły wtorek Anthropic wydał Claude Fable 5.1 oraz jego brata Mythos 5.1. Jest to pierwsza duża aktualizacja wysokiej klasy linii Mythos od czasu premiery oryginalnego Fable 5 w czerwcu. Wydanie to następuje po chaotycznym trzymiesięcznym okresie dla firmy. W tym czasie Anthropic zmierzył się z 18-dniowym wstrzymaniem eksportu oraz sporem cenowym, który sprawił, że wielu użytkowników zastanawiało się, z którego modelu powinni właściwie korzystać.

Matematyka stojąca za skokiem mocy obliczeniowej

Aby zrozumieć, dlaczego ta aktualizacja jest ważna, należy przyjrzeć się sposobowi testowania tych modeli. Anthropic korzysta z testu o nazwie Terminal-Bench-Science 0.1. Ten benchmark mierzy, czy agent AI potrafi wykonywać zadania badawcze wewnątrz terminala komputerowego. W zasadzie jest to test sprawdzający, czy AI może działać jako niestrudzony stażysta, który potrafi poruszać się po komputerze laboratoryjnym bez pomocy człowieka.

Fable 5.1 uzyskał w tym teście wynik 52,6%. Dla porównania, poprzednia wersja, Fable 5, osiągnęła zaledwie 24,7%. Flagowy model średniej klasy, Opus 5, uzyskał wynik 29,0%. Przekładając to na prosty język, nowy model jest ponad dwukrotnie lepszy w złożonym rozumowaniu naukowym niż ten, który zastąpił. Taki poziom poprawy w ciągu trzech miesięcy jest niezwykły dla branży, w której zyski mierzy się zazwyczaj w cyfrach jednocyfrowych.

W osobnym teście programowania — Terminal-Bench 4.0 — model wykazał podobny postęp. Fable 5.1 poprawnie wykonał 55,8% zadań. Jest to znaczący skok w porównaniu do 42,0% w Fable 5 i plasuje się wyraźnie przed wynikiem Opus 5 wynoszącym 52,3%. Dane pokazują, że dla osób używających AI do pisania, uruchamiania i debugowania kodu, Fable 5.1 jest obecnie najlepszym wyborem w ofercie Anthropic.

Nazwa modelu Wynik benchmarku naukowego Wynik benchmarku kodowania Cena wejściowa (za 1 mln tokenów) Cena wyjściowa (za 1 mln tokenów)
Claude Fable 5.1 52,6% 55,8% $10 $50
Claude Fable 5 24,7% 42,0% $10 $50
Claude Opus 5 29,0% 52,3% $5 $25

Ukryty koszt rozumowania na wysokim poziomie

Choć skok wydajności jest imponujący, cennik stwarza dylemat dla przeciętnego użytkownika. W lipcu Anthropic wydał model Opus 5. Model ten stał się wielkim hitem, ponieważ był lepszy od starego Fable 5, a kosztował dokładnie połowę mniej. Przez kilka tygodni wydawało się, że wysokiej klasy linia „Fable” umarła, ponieważ tańszy model był po prostu lepszy.

Fable 5.1 zmienia to, odzyskując koronę wydajności, ale zachowuje pierwotną wysoką cenę 10 USD za milion tokenów wejściowych i 50 USD za milion tokenów wyjściowych. Tokeny to cyfrowa ropa naftowa napędzająca AI. Są to małe fragmenty danych przetwarzane przez model, w przybliżeniu równe 750 słowom. Jeśli jesteś programistą wykonującym tysiące zapytań na godzinę, płacenie 10 USD zamiast 5 USD stanowi różnicę między zyskownym miesiącem a stratą.

Anthropic próbuje złagodzić ten cios nową funkcją zwaną wysiłkiem rozumowania (reasoning effort). Zamiast uruchamiać model z pełną mocą przy każdym zadaniu, użytkownicy mogą przekręcić metaforyczne pokrętło. Firma twierdzi, że uruchomienie Fable 5.1 na niskim lub średnim poziomie wysiłku zapewnia lepsze wyniki niż stary Fable 5, ale przy niższym koszcie. Jednak użytkownicy, którzy potrzebują modelu do rozwiązywania problemów, których inne AI nie potrafią tknąć, będą musieli zapłacić pełną stawkę premium.

Zarządzanie pamięcią podręczną danych

Istnieje jeden obszar, w którym nowy model jest obiektywnie tańszy dla wszystkich. Anthropic obniżył koszt odczytów z pamięci podręcznej (cache) o 75%. W świecie architektury AI buforowanie jest jak trzymanie książki otwartej na konkretnej stronie, aby nie trzeba było jej szukać ponownie. Jeśli poprosisz AI o przeanalizowanie tego samego 500-stronicowego dokumentu dziesięć razy w ciągu godziny, buforowanie oszczędza AI konieczności ponownego czytania całości za każdym razem.

W przypadku typowej pracy obniża to koszty o około 25%. W przypadku obciążeń wysoce agentowych — gdzie AI wykonuje dziesiątki małych kroków pod rząd, aby ukończyć projekt — oszczędności sięgają 45%. Sprawia to, że cena 10 USD jest bardziej znośna dla zaawansowanych użytkowników, ale nie zmienia faktu, że cena wejściowa za pojedyncze pytanie pozostaje wysoka.

Dostęp do nowego modelu jest również podzielony na poziomy w sposób, który może frustrować standardowych subskrybentów. Jeśli posiadasz plan Claude Pro lub standardowe konto Team, Fable 5.1 nie jest wliczony w stałą miesięczną opłatę. Musisz oddzielnie dokupić kredyty na użytkowanie, podobnie jak w przypadku telefonu na kartę. Tylko osoby korzystające z drogich planów Max lub kont Enterprise premium mają model wliczony w subskrypcję, a nawet wtedy pokrywa on tylko do 50% ich tygodniowych limitów użycia.

Dlaczego filtry mają znaczenie

Anthropic wydał również Mythos 5.1 wraz z Fable 5.1. Firma opisuje je jako ten sam bazowy model z różnymi filtrami bezpieczeństwa. Fable 5.1 to wersja, z której korzysta ogół społeczeństwa. Posiada ona rygorystyczne zabezpieczenia zapobiegające pomaganiu w niebezpiecznych działaniach.

Mythos 5.1 jest inny. Jest on ograniczony do zweryfikowanych profesjonalistów w dziedzinie cyberbezpieczeństwa i nauk przyrodniczych. Eksperci ci potrzebują AI, aby zrozumieć, jak działają wirusy lub jak hakerzy włamywali się do systemów, aby mogli budować lepszą obronę. Ponieważ Mythos 5.1 ma lżejsze filtry, faktycznie uzyskał wyższe wyniki w testach kodowania — 60,9% w porównaniu do 55,8% w Fable 5.1. Luka ta istnieje, ponieważ standardowe filtry bezpieczeństwa czasami mylą legalne zadania programistyczne ze złośliwymi i blokują AI przed ich ukończeniem.

Co to oznacza dla Twojej pracy

Jeśli używasz AI do podstawowych zadań, takich jak streszczanie e-maili lub pisanie listów motywacyjnych, prawdopodobnie powinieneś zignorować Fable 5.1. Model Opus 5 pozostaje lepszą opcją dla codziennej pracy. Jest szybki, tani i w zupełności wystarczający do typowych zadań związanych z pisaniem. Używanie Fable 5.1 do streszczenia e-maila jest jak zatrudnienie naukowca od rakiet do pomocy w pracy domowej z matematyki dla czwartej klasy.

Jeśli jednak jesteś inżynierem oprogramowania lub badaczem, matematyka się zmienia. Zdolność do wykonywania zadań badawczych ze skutecznością na poziomie 52% to fundamentalna zmiana. Oznacza to, że AI ewoluuje z prostego generatora tekstu w funkcjonalnego agenta, który potrafi obsługiwać wieloetapowe procesy. Dla tych użytkowników wysoka cena jest praktycznym kompromisem za czas, który oszczędzają.

Patrząc na szerszy obraz, Fable 5.1 pokazuje, że branża AI dzieli się na dwie ścieżki. Jedna ścieżka skupia się na uczynieniu AI tak tanią, jak to tylko możliwe dla mas. Druga ścieżka, którą reprezentuje Fable 5.1, przesuwa granice tego, co mogą zrobić komputery, niezależnie od kosztów. Jako konsument musisz teraz zdecydować, czy płacisz za podstawowe narzędzie, czy za silnik o wysokiej wydajności. Obserwuj swoje nawyki użytkowania w ciągu najbliższego tygodnia. Jeśli zauważysz, że prosisz AI o wykonanie tego samego zadania trzy razy, zanim zrobi to poprawnie, cena premium za inteligentniejszy model może w dłuższej perspektywie faktycznie przynieść Ci oszczędności.

Źródła:
Anthropic Official Technical Announcement (September 2026)
Terminal-Bench Science 0.1 Performance Report
Anthropic API Pricing Schedule
Cyber and Life Sciences Verification Program Documentation

bg
bg
bg

Do zobaczenia po drugiej stronie.

Nasze kompleksowe, szyfrowane rozwiązanie do poczty e-mail i przechowywania danych w chmurze zapewnia najpotężniejsze środki bezpiecznej wymiany danych, zapewniając bezpieczeństwo i prywatność danych.

/ Utwórz bezpłatne konto