GPT-6 Astra i Claude Fable 5.1 - dwie identyczne metki cenowe nad pojemnikami wypełnionymi w różnym stopniu

GPT-6 Astra kontra Claude Fable 5.1 – wyniki, koszt i wybór do konkretnej pracy

Oba modele kosztują nominalnie tyle samo: 10 USD za milion tokenów wejścia i 50 USD za milion wyjścia. Przy tej samej cenie katalogowej rachunek rozstrzyga struktura zadania, a nie stawka. Astra wygrywa w obsłudze komputera, matematyce i cyberbezpieczeństwie. Fable 5.1 prowadzi w Humanity’s Last Exam i w niezależnym indeksie Artificial Analysis – oraz w rachunku za pracę na długim, powtarzalnym kontekście.

Stan na 13 września 2026. Wyniki testów pochodzą z komunikatu premierowego OpenAI, stawki API z cenników OpenAI i Anthropic, a indeks Artificial Analysis z zestawienia niezależnej firmy analitycznej. Klasa każdego źródła jest podana przy liczbie.

Krótka odpowiedź: co do czego

Jeśli potrzebujesz jednego zdania: Astra do zadań wykonywanych na komputerze i do matematyki, Fable 5.1 do szerokiej wiedzy eksperckiej i do pracy na dużym, powtarzalnym kontekście.

ZadanieWskazany modelNa jakiej podstawie
Obsługa komputera, klikanie w interfejsachGPT-6 AstraAgents’ Last Exam 59,3% vs 48,7%; ScreenSpot-Pro 92,7% vs 87,3%
Automatyzacja procesów biurowychGPT-6 AstraAutomationBench 41,4% vs 31,4%
Matematyka na poziomie badawczymGPT-6 AstraFrontierMath Tier 4: 97,6% vs 87,8%
Cyberbezpieczeństwo ofensywne i obronneGPT-6 AstraExploitBench 100% vs brak wyniku; SRE-Bench 88,0%
Szeroka wiedza ekspercka z narzędziamiClaude Fable 5.1Humanity’s Last Exam 65,0% vs 57,2%
Ogólna inteligencja w indeksie niezależnymClaude Fable 5.1Artificial Analysis Intelligence Index 65,7 vs 61,2
Agent na dużym repozytorium z cache’emClaude Fable 5.1odczyt z cache’u 0,25 USD vs 1,00 USD
Analiza dokumentu powyżej 272 tys. tokenówClaude Fable 5.1pełne okno w cenie standardowej vs podwojona stawka
Wiele krótkich zapytań bez cache’uGPT-6 Astratokenizator Claude produkuje około 30% więcej tokenów
Kodowanie agentoweremisTerminal-Bench 57,9% vs 55,8%, ale Coding Agent Index 67,0 vs 68,1 dla Opus 5

Reszta tekstu pokazuje, skąd te liczby się biorą i gdzie mają słabe punkty.

Kto publikuje te liczby i dlaczego to ma znaczenie

Wszystkie wyniki porównawcze Astry i Claude publikuje OpenAI – czyli podmiot, którego model w większości wierszy wygrywa. To jest pierwsza rzecz, którą trzeba wiedzieć przed spojrzeniem na tabelę.

Anthropic nie opublikowała własnego zestawienia porównującego Fable 5.1 z Astrą. Nie istnieje więc drugi zestaw liczb z drugiej strony, który można by zestawić obok. Jedyną trzecią stroną w całym tym materiale jest Artificial Analysis – niezależna firma analityczna prowadząca własny indeks – i to jest jedyny wiersz, którego OpenAI nie policzyła sama.

OpenAI dodaje do wyników konkurencji trzy zastrzeżenia i podaje je we własnych przypisach:

  • Na ScreenSpot-Pro i ExploitGym wyniki podpisane jako Fable pochodzą z modelu Mythos – odmiany Fable z mniejszą liczbą zabezpieczeń. To nie jest ten sam model, który kupuje klient.
  • Na BenchCAD wyniki Claude odzwierciedlają trzy modyfikacje testu, opisane w system card Fable 5.1.
  • W HealthBench Professional OpenAI sama oceniła wszystkie modele Claude, używając własnego modelu GPT-5.4 jako sędziego; dla Fable 5.1 przy odmowach dostawcy podstawiono wyniki Opus 5.

Do tego dochodzi trzeci przypis o wymowie odwrotnej: Claude Fable 5 i 5.1 nie mają wyników w trzech testach biomedycznych – LifeSciBench, GeneBench Pro i MedChemBench – bo odmawiają odpowiedzi na większość pytań w tych zestawach. Puste pole w tabeli nie zawsze znaczy „gorzej”; tutaj znaczy „model odmówił”.

Żadna z tych uwag nie unieważnia wyników. Wszystkie zmieniają jednak sposób, w jaki należy je czytać, i dlatego są tutaj, a nie w przypisie na końcu. Szerszy obraz tej rywalizacji opisuje analiza wyścigu modeli AI, a zestawienie samych asystentów – porównanie Gemini, ChatGPT i Claude.

Obsługa komputera i praca zawodowa

To jest obszar, w którym przewaga Astry jest największa i najlepiej udokumentowana – i jednocześnie ten, w którym OpenAI zbudowała cały komunikat premierowy.

Wyniki opublikowane przez OpenAI:

TestGPT-6 AstraClaude Fable 5.1Claude Fable 5Claude Opus 5
Agents’ Last Exam59,3%48,7%55,5%
OSWorld 2.072,6%70,2%
ScreenSpot-Pro (bez narzędzi)92,7%87,3%
AutomationBench41,4%31,4%17,4%26,9%
BenchCAD95,9%84,3%67,5%82,1%
BrowseComp91,5%87,4%90,8%

Agents’ Last Exam bada złożone zadania zawodowe w prawdziwym oprogramowaniu – od modelowania finansowego po produkcję medialną. AutomationBench mierzy automatyzację procesów. BenchCAD sprawdza, czy model potrafi odtworzyć obiekt 3D z renderów, generując kod CAD.

Do wyniku Agents’ Last Exam OpenAI dokłada twierdzenie o efektywności: przy najwyższych ustawieniach Astra ma zużywać około 65% mniej tokenów wyjścia niż Claude Opus 5. To deklaracja producenta, nie pomiar zewnętrzny.

Na co trzeba uważać w tej tabeli: w trzech wierszach kolumna Fable 5.1 jest pusta, a porównanie odbywa się z Fable 5 albo Opus 5 – modelami starszymi lub tańszymi. A w ScreenSpot-Pro, jak wyżej, liczba 87,3% nie pochodzi z Fable, tylko z Mythos.

Co to znaczy w praktyce, gdy model ma klikać w interfejsy na twoim komputerze, rozkłada osobny tekst o obsłudze komputera przez GPT-6 Astra.

Kodowanie – remis bliżej, niż wygląda z nagłówków

Na jednym benchmarku Astra wyprzedza Fable 5.1 o dwa punkty, na innym przegrywa z Claude Opus 5 – i to jest uczciwszy obraz niż zdanie „najlepszy model do programowania”.

TestGPT-6 AstraGPT-5.6 SolClaude Fable 5.1Claude Fable 5Claude Opus 5
Terminal-Bench 4.057,9%37,3%55,8%44,5%52,6%
DeepSWE v1.174,1%72,7%67,4%69,9%73,7%
FrontierCode 1.1 Extended64,5%60,6%63,6%64,9%63,6%
FrontierCode 1.1 Main53,3%47,5%50,9%53,5%53,4%
Artificial Analysis Coding Agent Index v1.467,065,167,268,1

Cztery obserwacje:

  • Terminal-Bench 4.0 – przewaga Astry nad Fable 5.1 to 2,1 punktu procentowego. OpenAI dodaje, że przy tym wyniku koszt zadania jest około 63% niższy niż u Fable 5.1.
  • FrontierCode 1.1 Main – Astra przegrywa z Claude Fable 5 i Claude Opus 5, choć różnice są w granicach dwóch dziesiątych punktu.
  • Artificial Analysis Coding Agent Index – jedyny wiersz liczony przez trzecią stronę. Astra jest tu trzecia, za Opus 5 i Fable 5.
  • Największy skok Astra notuje nie wobec Claude, tylko wobec własnego poprzednika: Terminal-Bench z 37,3% na 57,9%.

Do wyników FrontierCode OpenAI dodaje informację, że Astra była uruchamiana z komunikatem deweloperskim zbliżonym do tego, którego używa Codex – z instrukcją unikania nadmiarowych plików testowych i zbędnych porządków w kodzie. Producent zaznacza, że prompt nie był optymalizowany pod ten test. Nasze własne obserwacje z testów modeli w zadaniach programistycznych zebraliśmy w materiale o testach modeli w kodowaniu.

Matematyka i nauka – tu przewaga jest duża

W matematyce i w zadaniach naukowych z użyciem terminala Astra nie wygrywa o dwa punkty, tylko o kilkanaście.

TestGPT-6 AstraClaude Fable 5.1Claude Fable 5Claude Opus 5
FrontierMath Tier 4 (v2)97,6%87,8%90,2%73,2%
Terminal-Bench Science 0.164,6%52,6%21,4%30,0%
GPQA Diamond96,0%93,7%92,6%93,7%
ARC-AGI-295,0%90,0%89,2%90,4%
ARC-AGI-198,5%97,5%98,5%97,5%

Terminal-Bench Science bada, czy agent potrafi przeprowadzić naukowy przepływ pracy z użyciem kodu i narzędzi terminalowych – analizę danych, symulacje, dopasowanie modeli. Przewaga dwunastu punktów nad Fable 5.1 przy, według OpenAI, około 31% niższym szacowanym koszcie API to najmocniejszy pojedynczy wynik w całym tym zestawieniu.

Poza benchmarkami OpenAI pokazała przy premierze dwa wyniki dotyczące odstępów między liczbami pierwszymi – w tym poprawienie granicy krótkich przerw z 240 na 186. Anthropic nie publikuje analogicznych rezultatów dla Fable 5.1, więc tego wątku nie da się porównać.

Gdzie Astra przegrywa

W tabeli OpenAI są dwa wiersze, w których Claude Fable 5.1 wygrywa wyraźnie – i jeden z nich nie pochodzi od OpenAI.

TestGPT-6 AstraClaude Fable 5.1Różnica
Humanity’s Last Exam (z narzędziami)57,2%65,0%7,8 pkt na korzyść Claude
Artificial Analysis Intelligence Index v4.1.161,265,74,5 pkt na korzyść Claude

Humanity’s Last Exam to test szerokiej wiedzy eksperckiej z dostępem do narzędzi – zaprojektowany tak, żeby nie dało się go wysycić. Tutaj Astra przegrywa nie tylko z Fable 5.1, ale też z Fable 5 (63,8%) i Opus 5 (63,6%). To jedyny obszar w całym zestawieniu, w którym trzy modele Anthropic wyprzedzają Astrę jednocześnie.

Artificial Analysis Intelligence Index ma status szczególny: jest jedyną liczbą w tej tabeli policzoną przez podmiot niezależny od obu dostawców. Astra uzyskuje w nim 61,2 – mniej niż Fable 5.1 (65,7), Opus 5 (63,1) i Fable 5 (62,1), i tylko o 0,3 punktu więcej niż własny poprzednik, GPT-5.6 Sol (60,9).

To zestawienie jest ważne z jednego powodu. W benchmarkach liczonych przez OpenAI Astra wyprzedza poprzednika o kilkanaście albo kilkadziesiąt punktów. W indeksie liczonym przez kogoś innego – o trzy dziesiąte punktu. Obie liczby są prawdziwe i mierzą co innego, ale tylko jedna z nich trafia do nagłówków.

Ta sama cena, inny rachunek: pamięć podręczna

Nominalnie oba modele kosztują 10 i 50 USD. Pierwsza realna różnica siedzi w cenie odczytu z pamięci podręcznej i wynosi czterokrotność.

PozycjaGPT-6 AstraClaude Fable 5.1
Wejście10,00 USD10,00 USD
Wyjście50,00 USD50,00 USD
Zapis do cache’u12,50 USD12,50 USD (5 min) / 20,00 USD (1 godz.)
Odczyt z cache’u1,00 USD0,25 USD

Anthropic wycenia odczyt z cache’u dla Fable 5.1 na 0,025× ceny wejścia, podczas gdy standardem w całej branży – i u Anthropic dla pozostałych modeli – jest 0,1×. OpenAI stosuje dla Astry właśnie 0,1×, czyli 1,00 USD.

Dlaczego to jest istotne akurat teraz: przy pracy agentowej ta sama, duża część kontekstu – instrukcje, dokumentacja, struktura repozytorium – wraca do modelu przy każdym kroku. Przy dwudziestu krokach dziennie płacisz za jeden zapis i dziewiętnaście odczytów. To odczyty decydują o rachunku, nie stawka za wejście.

Ta sama cena, inny rachunek: długi kontekst

Druga różnica dotyczy tego, co się dzieje po przekroczeniu progu długiego kontekstu – i tu konstrukcje obu cenników są przeciwstawne.

GPT-6 Astra: powyżej 272 000 tokenów wejścia stawki rosną do 20 USD za wejście i 75 USD za wyjście. Wyższa stawka obejmuje całe zapytanie, nie nadwyżkę ponad próg.

Claude Fable 5.1: modele Claude 4.6 i nowsze obejmują pełne okno miliona tokenów w cenie standardowej. Anthropic podaje to wprost: żądanie na 900 tysięcy tokenów jest rozliczane po tej samej stawce za token co żądanie na 9 tysięcy. Rabaty za cache i przetwarzanie wsadowe działają na całym oknie.

Okno kontekstu Astry jest większe – 1 050 000 tokenów wobec miliona u Claude – ale ostatnie trzy czwarte tego okna kosztuje podwójnie.

Tokenizator, który odwraca część rachunku

Trzecia różnica działa na korzyść Astry i nie wynika z cennika, tylko z tego, jak każdy model liczy tekst.

Anthropic podaje w dokumentacji, że modele Claude 4.7 i nowsze – a więc także Fable 5.1 – korzystają z nowszego tokenizatora, który produkuje około 30% więcej tokenów dla tego samego tekstu. Dokładna wielkość różnicy zależy od treści i charakteru zadania.

Konsekwencja jest prosta i mało oczywista: ta sama stawka za milion tokenów nie oznacza tej samej faktury za tę samą pracę. Jeśli dokument liczy 100 000 tokenów w mierze OpenAI, u Claude będzie ich około 130 000 – i tyle właśnie zapłacisz. Czym jest token i dlaczego liczy się różnie w różnych modelach, wyjaśnia materiał o tokenizacji.

To jest czynnik, którego brakuje w każdym porównaniu opartym wyłącznie na tabeli cenników – i jedyny, który przesuwa wynik na korzyść Astry przy prostych, krótkich zapytaniach.

Trzy scenariusze z policzonym kosztem

Poniższe wyliczenia to działania na cennikach obu dostawców, nie wyniki pomiaru jakości. Dla Claude uwzględniono około 30% więcej tokenów wynikające z tokenizatora. Wszystkie kwoty w USD.

Scenariusz pierwszy: agent na dużym repozytorium

Powtarzalny kontekst 200 000 tokenów w mierze OpenAI, dwadzieścia wywołań dziennie, jeden zapis do cache’u i dziewiętnaście odczytów.

ModelZapisOdczytyRazem za wejście
GPT-6 Astra200 000 × 12,50 / mln = 2,5019 × 200 000 × 1,00 / mln = 3,806,30
Claude Fable 5.1260 000 × 12,50 / mln = 3,2519 × 260 000 × 0,25 / mln = 1,244,49

Fable 5.1 jest tańszy o około 29% mimo trzydziestu procent więcej tokenów do opłacenia. Decyduje czterokrotnie tańszy odczyt.

Scenariusz drugi: analiza jednego długiego dokumentu

Dokument 500 000 tokenów w mierze OpenAI, 5 000 tokenów odpowiedzi, bez cache’u.

ModelWejścieWyjścieRazem
GPT-6 Astra (powyżej progu)500 000 × 20,00 / mln = 10,005 000 × 75,00 / mln = 0,3810,38
Claude Fable 5.1 (cena standardowa)650 000 × 10,00 / mln = 6,506 500 × 50,00 / mln = 0,336,83

Fable 5.1 jest tańszy o około 34%. Decyduje brak progu długiego kontekstu.

Scenariusz trzeci: wiele krótkich zapytań

10 000 tokenów wejścia, 2 000 wyjścia, bez cache’u.

ModelWejścieWyjścieRazem
GPT-6 Astra10 000 × 10,00 / mln = 0,102 000 × 50,00 / mln = 0,100,20
Claude Fable 5.113 000 × 10,00 / mln = 0,132 600 × 50,00 / mln = 0,130,26

Astra jest tańsza o około 23%. Decyduje tokenizator – przy krótkich zapytaniach ani cache, ani próg długiego kontekstu nie wchodzą w grę.

Wniosek z trzech scenariuszy jest jeden i przeciwny do intuicji, jaką daje tabela cenników: im większy i bardziej powtarzalny kontekst, tym bardziej opłaca się Claude; im krótsze i bardziej jednorazowe zapytanie, tym bardziej opłaca się Astra. Plany abonamentowe obu dostawców rządzą się osobnymi regułami – rozpisują je teksty o cenie GPT-6 Astra i o planach Claude.

Czego to porównanie nie rozstrzyga

Trzy rzeczy, których nie da się dziś ustalić na podstawie dostępnych danych – i warto wiedzieć, że ich brakuje.

Polszczyzna. Żaden z benchmarków w tym zestawieniu nie testuje języka polskiego. Jakość redakcji polskiego tekstu, poprawność fleksji i naturalność stylu to wymiary, w których kolejność modeli bywa inna niż w matematyce. Publiczny test obu modeli na polskim materiale jeszcze nie powstał.

Zachowanie w długiej pracy. Benchmarki mierzą zadania zamknięte. Wielogodzinna praca nad jednym projektem – z poprawkami, zmianami kierunku i narastającym kontekstem – to inny reżim i inne ryzyka.

Wyniki po zmianie cennika. Cena promocyjna GPT-5.6 Sol obowiązuje co najmniej do 21 listopada 2026. Jeśli po tej dacie OpenAI przestawi stawki w rodzinie GPT-5.6, część rachunków w tym tekście trzeba będzie policzyć od nowa. Każde porównanie cen modeli AI ma datę ważności liczoną w tygodniach.

FAQ

Który model jest lepszy: GPT-6 Astra czy Claude Fable 5.1?

Zależy od zadania. Astra wygrywa w obsłudze komputera, automatyzacji, matematyce i cyberbezpieczeństwie. Fable 5.1 prowadzi w Humanity’s Last Exam z narzędziami (65,0% wobec 57,2%) i w niezależnym indeksie Artificial Analysis (65,7 wobec 61,2).

Czy GPT-6 Astra i Claude Fable 5.1 kosztują tyle samo?

Nominalnie tak – oba po 10 USD za milion tokenów wejścia i 50 USD za wyjścia. Realnie nie: odczyt z cache’u u Astry kosztuje 1,00 USD, u Fable 5.1 tylko 0,25 USD, a Astra podwaja stawkę powyżej 272 000 tokenów wejścia, podczas gdy Claude obejmuje pełny milion ceną standardową.

Dlaczego ten sam tekst kosztuje więcej u Claude?

Bo modele Claude 4.7 i nowsze używają tokenizatora, który produkuje około 30% więcej tokenów dla tego samego tekstu. Przy identycznej stawce za milion tokenów oznacza to wyższy rachunek za tę samą pracę – chyba że kontekst jest duży i powtarzalny, bo wtedy przewaga tańszego cache’u to odwraca.

Kto liczył te benchmarki?

Wszystkie z wyjątkiem indeksów Artificial Analysis policzyła OpenAI, czyli producent jednego z porównywanych modeli. OpenAI sama zaznacza, że część wyników Claude pochodzi z modelu Mythos, mającego mniej zabezpieczeń niż Fable, a wyniki BenchCAD odzwierciedlają trzy modyfikacje testu.

Który model wybrać do agenta pracującego na kodzie?

Przy identycznym obciążeniu z dużym, powtarzalnym kontekstem Claude Fable 5.1 wypada taniej – w przykładowym rachunku o około 29%. W samych wynikach kodowania jest remis: Astra prowadzi na Terminal-Bench 4.0, przegrywa na FrontierCode Main i w Coding Agent Index liczonym przez trzecią stronę.

Czy okno kontekstu Astry jest większe niż u Claude?

Tak, 1 050 000 tokenów wobec miliona. Różnica jest jednak pozorna: powyżej 272 000 tokenów wejścia Astra podwaja stawkę dla całego zapytania, a Claude wycenia pełne okno po cenie standardowej.

Źródła

  • GPT-6 Astra: A new generation of intelligence, OpenAI – komunikat premierowy z pełnymi tabelami wyników i przypisami do metodyki, dostęp 13.09.2026
  • API Pricing, OpenAI API Docs – stawki GPT-6 Astra i rodziny GPT-5.6, progi długiego kontekstu, dostęp 13.09.2026
  • Pricing, Anthropic – stawki Claude Fable 5.1 i pozostałych modeli, mnożniki cache’u, wycena długiego kontekstu, nota o tokenizatorze, dostęp 13.09.2026
  • GPT-6 Astra Model, OpenAI API Docs – okno kontekstu i limity modelu, dostęp 13.09.2026
  • Artificial Analysis, Artificial Analysis – niezależny indeks inteligencji i indeks agentów kodujących, dostęp 13.09.2026
  • Claude Fable 5.1 & Claude Mythos 5.1 System Card, Anthropic – dokument, do którego odsyła OpenAI przy zastrzeżeniach do wyników BenchCAD, dostęp 13.09.2026
  • GPT-6 Astra System Card, OpenAI Deployment Safety Hub – metodyka ewaluacji i zastrzeżenia do porównań, dostęp 13.09.2026

Podobne wpisy

Dodaj komentarz

Twój adres email nie zostanie opublikowany. Wymagane pola są oznaczone *