GPT-6 Astra kontra Claude Fable 5.1 – wyniki, koszt i wybór do konkretnej pracy
Oba modele kosztują nominalnie tyle samo: 10 USD za milion tokenów wejścia i 50 USD za milion wyjścia. Przy tej samej cenie katalogowej rachunek rozstrzyga struktura zadania, a nie stawka. Astra wygrywa w obsłudze komputera, matematyce i cyberbezpieczeństwie. Fable 5.1 prowadzi w Humanity’s Last Exam i w niezależnym indeksie Artificial Analysis – oraz w rachunku za pracę na długim, powtarzalnym kontekście.
Stan na 13 września 2026. Wyniki testów pochodzą z komunikatu premierowego OpenAI, stawki API z cenników OpenAI i Anthropic, a indeks Artificial Analysis z zestawienia niezależnej firmy analitycznej. Klasa każdego źródła jest podana przy liczbie.
Krótka odpowiedź: co do czego
Jeśli potrzebujesz jednego zdania: Astra do zadań wykonywanych na komputerze i do matematyki, Fable 5.1 do szerokiej wiedzy eksperckiej i do pracy na dużym, powtarzalnym kontekście.
| Zadanie | Wskazany model | Na jakiej podstawie |
|---|---|---|
| Obsługa komputera, klikanie w interfejsach | GPT-6 Astra | Agents’ Last Exam 59,3% vs 48,7%; ScreenSpot-Pro 92,7% vs 87,3% |
| Automatyzacja procesów biurowych | GPT-6 Astra | AutomationBench 41,4% vs 31,4% |
| Matematyka na poziomie badawczym | GPT-6 Astra | FrontierMath Tier 4: 97,6% vs 87,8% |
| Cyberbezpieczeństwo ofensywne i obronne | GPT-6 Astra | ExploitBench 100% vs brak wyniku; SRE-Bench 88,0% |
| Szeroka wiedza ekspercka z narzędziami | Claude Fable 5.1 | Humanity’s Last Exam 65,0% vs 57,2% |
| Ogólna inteligencja w indeksie niezależnym | Claude Fable 5.1 | Artificial Analysis Intelligence Index 65,7 vs 61,2 |
| Agent na dużym repozytorium z cache’em | Claude Fable 5.1 | odczyt z cache’u 0,25 USD vs 1,00 USD |
| Analiza dokumentu powyżej 272 tys. tokenów | Claude Fable 5.1 | pełne okno w cenie standardowej vs podwojona stawka |
| Wiele krótkich zapytań bez cache’u | GPT-6 Astra | tokenizator Claude produkuje około 30% więcej tokenów |
| Kodowanie agentowe | remis | Terminal-Bench 57,9% vs 55,8%, ale Coding Agent Index 67,0 vs 68,1 dla Opus 5 |
Reszta tekstu pokazuje, skąd te liczby się biorą i gdzie mają słabe punkty.
Kto publikuje te liczby i dlaczego to ma znaczenie
Wszystkie wyniki porównawcze Astry i Claude publikuje OpenAI – czyli podmiot, którego model w większości wierszy wygrywa. To jest pierwsza rzecz, którą trzeba wiedzieć przed spojrzeniem na tabelę.
Anthropic nie opublikowała własnego zestawienia porównującego Fable 5.1 z Astrą. Nie istnieje więc drugi zestaw liczb z drugiej strony, który można by zestawić obok. Jedyną trzecią stroną w całym tym materiale jest Artificial Analysis – niezależna firma analityczna prowadząca własny indeks – i to jest jedyny wiersz, którego OpenAI nie policzyła sama.
OpenAI dodaje do wyników konkurencji trzy zastrzeżenia i podaje je we własnych przypisach:
- Na ScreenSpot-Pro i ExploitGym wyniki podpisane jako Fable pochodzą z modelu Mythos – odmiany Fable z mniejszą liczbą zabezpieczeń. To nie jest ten sam model, który kupuje klient.
- Na BenchCAD wyniki Claude odzwierciedlają trzy modyfikacje testu, opisane w system card Fable 5.1.
- W HealthBench Professional OpenAI sama oceniła wszystkie modele Claude, używając własnego modelu GPT-5.4 jako sędziego; dla Fable 5.1 przy odmowach dostawcy podstawiono wyniki Opus 5.
Do tego dochodzi trzeci przypis o wymowie odwrotnej: Claude Fable 5 i 5.1 nie mają wyników w trzech testach biomedycznych – LifeSciBench, GeneBench Pro i MedChemBench – bo odmawiają odpowiedzi na większość pytań w tych zestawach. Puste pole w tabeli nie zawsze znaczy „gorzej”; tutaj znaczy „model odmówił”.
Żadna z tych uwag nie unieważnia wyników. Wszystkie zmieniają jednak sposób, w jaki należy je czytać, i dlatego są tutaj, a nie w przypisie na końcu. Szerszy obraz tej rywalizacji opisuje analiza wyścigu modeli AI, a zestawienie samych asystentów – porównanie Gemini, ChatGPT i Claude.
Obsługa komputera i praca zawodowa
To jest obszar, w którym przewaga Astry jest największa i najlepiej udokumentowana – i jednocześnie ten, w którym OpenAI zbudowała cały komunikat premierowy.
Wyniki opublikowane przez OpenAI:
| Test | GPT-6 Astra | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 |
|---|---|---|---|---|
| Agents’ Last Exam | 59,3% | – | 48,7% | 55,5% |
| OSWorld 2.0 | 72,6% | – | – | 70,2% |
| ScreenSpot-Pro (bez narzędzi) | 92,7% | – | 87,3% | – |
| AutomationBench | 41,4% | 31,4% | 17,4% | 26,9% |
| BenchCAD | 95,9% | 84,3% | 67,5% | 82,1% |
| BrowseComp | 91,5% | – | 87,4% | 90,8% |
Agents’ Last Exam bada złożone zadania zawodowe w prawdziwym oprogramowaniu – od modelowania finansowego po produkcję medialną. AutomationBench mierzy automatyzację procesów. BenchCAD sprawdza, czy model potrafi odtworzyć obiekt 3D z renderów, generując kod CAD.
Do wyniku Agents’ Last Exam OpenAI dokłada twierdzenie o efektywności: przy najwyższych ustawieniach Astra ma zużywać około 65% mniej tokenów wyjścia niż Claude Opus 5. To deklaracja producenta, nie pomiar zewnętrzny.
Na co trzeba uważać w tej tabeli: w trzech wierszach kolumna Fable 5.1 jest pusta, a porównanie odbywa się z Fable 5 albo Opus 5 – modelami starszymi lub tańszymi. A w ScreenSpot-Pro, jak wyżej, liczba 87,3% nie pochodzi z Fable, tylko z Mythos.
Co to znaczy w praktyce, gdy model ma klikać w interfejsy na twoim komputerze, rozkłada osobny tekst o obsłudze komputera przez GPT-6 Astra.
Kodowanie – remis bliżej, niż wygląda z nagłówków
Na jednym benchmarku Astra wyprzedza Fable 5.1 o dwa punkty, na innym przegrywa z Claude Opus 5 – i to jest uczciwszy obraz niż zdanie „najlepszy model do programowania”.
| Test | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 |
|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57,9% | 37,3% | 55,8% | 44,5% | 52,6% |
| DeepSWE v1.1 | 74,1% | 72,7% | 67,4% | 69,9% | 73,7% |
| FrontierCode 1.1 Extended | 64,5% | 60,6% | 63,6% | 64,9% | 63,6% |
| FrontierCode 1.1 Main | 53,3% | 47,5% | 50,9% | 53,5% | 53,4% |
| Artificial Analysis Coding Agent Index v1.4 | 67,0 | 65,1 | – | 67,2 | 68,1 |
Cztery obserwacje:
- Terminal-Bench 4.0 – przewaga Astry nad Fable 5.1 to 2,1 punktu procentowego. OpenAI dodaje, że przy tym wyniku koszt zadania jest około 63% niższy niż u Fable 5.1.
- FrontierCode 1.1 Main – Astra przegrywa z Claude Fable 5 i Claude Opus 5, choć różnice są w granicach dwóch dziesiątych punktu.
- Artificial Analysis Coding Agent Index – jedyny wiersz liczony przez trzecią stronę. Astra jest tu trzecia, za Opus 5 i Fable 5.
- Największy skok Astra notuje nie wobec Claude, tylko wobec własnego poprzednika: Terminal-Bench z 37,3% na 57,9%.
Do wyników FrontierCode OpenAI dodaje informację, że Astra była uruchamiana z komunikatem deweloperskim zbliżonym do tego, którego używa Codex – z instrukcją unikania nadmiarowych plików testowych i zbędnych porządków w kodzie. Producent zaznacza, że prompt nie był optymalizowany pod ten test. Nasze własne obserwacje z testów modeli w zadaniach programistycznych zebraliśmy w materiale o testach modeli w kodowaniu.
Matematyka i nauka – tu przewaga jest duża
W matematyce i w zadaniach naukowych z użyciem terminala Astra nie wygrywa o dwa punkty, tylko o kilkanaście.
| Test | GPT-6 Astra | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 |
|---|---|---|---|---|
| FrontierMath Tier 4 (v2) | 97,6% | 87,8% | 90,2% | 73,2% |
| Terminal-Bench Science 0.1 | 64,6% | 52,6% | 21,4% | 30,0% |
| GPQA Diamond | 96,0% | 93,7% | 92,6% | 93,7% |
| ARC-AGI-2 | 95,0% | 90,0% | 89,2% | 90,4% |
| ARC-AGI-1 | 98,5% | 97,5% | 98,5% | 97,5% |
Terminal-Bench Science bada, czy agent potrafi przeprowadzić naukowy przepływ pracy z użyciem kodu i narzędzi terminalowych – analizę danych, symulacje, dopasowanie modeli. Przewaga dwunastu punktów nad Fable 5.1 przy, według OpenAI, około 31% niższym szacowanym koszcie API to najmocniejszy pojedynczy wynik w całym tym zestawieniu.
Poza benchmarkami OpenAI pokazała przy premierze dwa wyniki dotyczące odstępów między liczbami pierwszymi – w tym poprawienie granicy krótkich przerw z 240 na 186. Anthropic nie publikuje analogicznych rezultatów dla Fable 5.1, więc tego wątku nie da się porównać.
Gdzie Astra przegrywa
W tabeli OpenAI są dwa wiersze, w których Claude Fable 5.1 wygrywa wyraźnie – i jeden z nich nie pochodzi od OpenAI.
| Test | GPT-6 Astra | Claude Fable 5.1 | Różnica |
|---|---|---|---|
| Humanity’s Last Exam (z narzędziami) | 57,2% | 65,0% | 7,8 pkt na korzyść Claude |
| Artificial Analysis Intelligence Index v4.1.1 | 61,2 | 65,7 | 4,5 pkt na korzyść Claude |
Humanity’s Last Exam to test szerokiej wiedzy eksperckiej z dostępem do narzędzi – zaprojektowany tak, żeby nie dało się go wysycić. Tutaj Astra przegrywa nie tylko z Fable 5.1, ale też z Fable 5 (63,8%) i Opus 5 (63,6%). To jedyny obszar w całym zestawieniu, w którym trzy modele Anthropic wyprzedzają Astrę jednocześnie.
Artificial Analysis Intelligence Index ma status szczególny: jest jedyną liczbą w tej tabeli policzoną przez podmiot niezależny od obu dostawców. Astra uzyskuje w nim 61,2 – mniej niż Fable 5.1 (65,7), Opus 5 (63,1) i Fable 5 (62,1), i tylko o 0,3 punktu więcej niż własny poprzednik, GPT-5.6 Sol (60,9).
To zestawienie jest ważne z jednego powodu. W benchmarkach liczonych przez OpenAI Astra wyprzedza poprzednika o kilkanaście albo kilkadziesiąt punktów. W indeksie liczonym przez kogoś innego – o trzy dziesiąte punktu. Obie liczby są prawdziwe i mierzą co innego, ale tylko jedna z nich trafia do nagłówków.
Ta sama cena, inny rachunek: pamięć podręczna
Nominalnie oba modele kosztują 10 i 50 USD. Pierwsza realna różnica siedzi w cenie odczytu z pamięci podręcznej i wynosi czterokrotność.
| Pozycja | GPT-6 Astra | Claude Fable 5.1 |
|---|---|---|
| Wejście | 10,00 USD | 10,00 USD |
| Wyjście | 50,00 USD | 50,00 USD |
| Zapis do cache’u | 12,50 USD | 12,50 USD (5 min) / 20,00 USD (1 godz.) |
| Odczyt z cache’u | 1,00 USD | 0,25 USD |
Anthropic wycenia odczyt z cache’u dla Fable 5.1 na 0,025× ceny wejścia, podczas gdy standardem w całej branży – i u Anthropic dla pozostałych modeli – jest 0,1×. OpenAI stosuje dla Astry właśnie 0,1×, czyli 1,00 USD.
Dlaczego to jest istotne akurat teraz: przy pracy agentowej ta sama, duża część kontekstu – instrukcje, dokumentacja, struktura repozytorium – wraca do modelu przy każdym kroku. Przy dwudziestu krokach dziennie płacisz za jeden zapis i dziewiętnaście odczytów. To odczyty decydują o rachunku, nie stawka za wejście.
Ta sama cena, inny rachunek: długi kontekst
Druga różnica dotyczy tego, co się dzieje po przekroczeniu progu długiego kontekstu – i tu konstrukcje obu cenników są przeciwstawne.
GPT-6 Astra: powyżej 272 000 tokenów wejścia stawki rosną do 20 USD za wejście i 75 USD za wyjście. Wyższa stawka obejmuje całe zapytanie, nie nadwyżkę ponad próg.
Claude Fable 5.1: modele Claude 4.6 i nowsze obejmują pełne okno miliona tokenów w cenie standardowej. Anthropic podaje to wprost: żądanie na 900 tysięcy tokenów jest rozliczane po tej samej stawce za token co żądanie na 9 tysięcy. Rabaty za cache i przetwarzanie wsadowe działają na całym oknie.
Okno kontekstu Astry jest większe – 1 050 000 tokenów wobec miliona u Claude – ale ostatnie trzy czwarte tego okna kosztuje podwójnie.
Tokenizator, który odwraca część rachunku
Trzecia różnica działa na korzyść Astry i nie wynika z cennika, tylko z tego, jak każdy model liczy tekst.
Anthropic podaje w dokumentacji, że modele Claude 4.7 i nowsze – a więc także Fable 5.1 – korzystają z nowszego tokenizatora, który produkuje około 30% więcej tokenów dla tego samego tekstu. Dokładna wielkość różnicy zależy od treści i charakteru zadania.
Konsekwencja jest prosta i mało oczywista: ta sama stawka za milion tokenów nie oznacza tej samej faktury za tę samą pracę. Jeśli dokument liczy 100 000 tokenów w mierze OpenAI, u Claude będzie ich około 130 000 – i tyle właśnie zapłacisz. Czym jest token i dlaczego liczy się różnie w różnych modelach, wyjaśnia materiał o tokenizacji.
To jest czynnik, którego brakuje w każdym porównaniu opartym wyłącznie na tabeli cenników – i jedyny, który przesuwa wynik na korzyść Astry przy prostych, krótkich zapytaniach.
Trzy scenariusze z policzonym kosztem
Poniższe wyliczenia to działania na cennikach obu dostawców, nie wyniki pomiaru jakości. Dla Claude uwzględniono około 30% więcej tokenów wynikające z tokenizatora. Wszystkie kwoty w USD.
Scenariusz pierwszy: agent na dużym repozytorium
Powtarzalny kontekst 200 000 tokenów w mierze OpenAI, dwadzieścia wywołań dziennie, jeden zapis do cache’u i dziewiętnaście odczytów.
| Model | Zapis | Odczyty | Razem za wejście |
|---|---|---|---|
| GPT-6 Astra | 200 000 × 12,50 / mln = 2,50 | 19 × 200 000 × 1,00 / mln = 3,80 | 6,30 |
| Claude Fable 5.1 | 260 000 × 12,50 / mln = 3,25 | 19 × 260 000 × 0,25 / mln = 1,24 | 4,49 |
Fable 5.1 jest tańszy o około 29% mimo trzydziestu procent więcej tokenów do opłacenia. Decyduje czterokrotnie tańszy odczyt.
Scenariusz drugi: analiza jednego długiego dokumentu
Dokument 500 000 tokenów w mierze OpenAI, 5 000 tokenów odpowiedzi, bez cache’u.
| Model | Wejście | Wyjście | Razem |
|---|---|---|---|
| GPT-6 Astra (powyżej progu) | 500 000 × 20,00 / mln = 10,00 | 5 000 × 75,00 / mln = 0,38 | 10,38 |
| Claude Fable 5.1 (cena standardowa) | 650 000 × 10,00 / mln = 6,50 | 6 500 × 50,00 / mln = 0,33 | 6,83 |
Fable 5.1 jest tańszy o około 34%. Decyduje brak progu długiego kontekstu.
Scenariusz trzeci: wiele krótkich zapytań
10 000 tokenów wejścia, 2 000 wyjścia, bez cache’u.
| Model | Wejście | Wyjście | Razem |
|---|---|---|---|
| GPT-6 Astra | 10 000 × 10,00 / mln = 0,10 | 2 000 × 50,00 / mln = 0,10 | 0,20 |
| Claude Fable 5.1 | 13 000 × 10,00 / mln = 0,13 | 2 600 × 50,00 / mln = 0,13 | 0,26 |
Astra jest tańsza o około 23%. Decyduje tokenizator – przy krótkich zapytaniach ani cache, ani próg długiego kontekstu nie wchodzą w grę.
Wniosek z trzech scenariuszy jest jeden i przeciwny do intuicji, jaką daje tabela cenników: im większy i bardziej powtarzalny kontekst, tym bardziej opłaca się Claude; im krótsze i bardziej jednorazowe zapytanie, tym bardziej opłaca się Astra. Plany abonamentowe obu dostawców rządzą się osobnymi regułami – rozpisują je teksty o cenie GPT-6 Astra i o planach Claude.
Czego to porównanie nie rozstrzyga
Trzy rzeczy, których nie da się dziś ustalić na podstawie dostępnych danych – i warto wiedzieć, że ich brakuje.
Polszczyzna. Żaden z benchmarków w tym zestawieniu nie testuje języka polskiego. Jakość redakcji polskiego tekstu, poprawność fleksji i naturalność stylu to wymiary, w których kolejność modeli bywa inna niż w matematyce. Publiczny test obu modeli na polskim materiale jeszcze nie powstał.
Zachowanie w długiej pracy. Benchmarki mierzą zadania zamknięte. Wielogodzinna praca nad jednym projektem – z poprawkami, zmianami kierunku i narastającym kontekstem – to inny reżim i inne ryzyka.
Wyniki po zmianie cennika. Cena promocyjna GPT-5.6 Sol obowiązuje co najmniej do 21 listopada 2026. Jeśli po tej dacie OpenAI przestawi stawki w rodzinie GPT-5.6, część rachunków w tym tekście trzeba będzie policzyć od nowa. Każde porównanie cen modeli AI ma datę ważności liczoną w tygodniach.
FAQ
Zależy od zadania. Astra wygrywa w obsłudze komputera, automatyzacji, matematyce i cyberbezpieczeństwie. Fable 5.1 prowadzi w Humanity’s Last Exam z narzędziami (65,0% wobec 57,2%) i w niezależnym indeksie Artificial Analysis (65,7 wobec 61,2).
Nominalnie tak – oba po 10 USD za milion tokenów wejścia i 50 USD za wyjścia. Realnie nie: odczyt z cache’u u Astry kosztuje 1,00 USD, u Fable 5.1 tylko 0,25 USD, a Astra podwaja stawkę powyżej 272 000 tokenów wejścia, podczas gdy Claude obejmuje pełny milion ceną standardową.
Bo modele Claude 4.7 i nowsze używają tokenizatora, który produkuje około 30% więcej tokenów dla tego samego tekstu. Przy identycznej stawce za milion tokenów oznacza to wyższy rachunek za tę samą pracę – chyba że kontekst jest duży i powtarzalny, bo wtedy przewaga tańszego cache’u to odwraca.
Wszystkie z wyjątkiem indeksów Artificial Analysis policzyła OpenAI, czyli producent jednego z porównywanych modeli. OpenAI sama zaznacza, że część wyników Claude pochodzi z modelu Mythos, mającego mniej zabezpieczeń niż Fable, a wyniki BenchCAD odzwierciedlają trzy modyfikacje testu.
Przy identycznym obciążeniu z dużym, powtarzalnym kontekstem Claude Fable 5.1 wypada taniej – w przykładowym rachunku o około 29%. W samych wynikach kodowania jest remis: Astra prowadzi na Terminal-Bench 4.0, przegrywa na FrontierCode Main i w Coding Agent Index liczonym przez trzecią stronę.
Tak, 1 050 000 tokenów wobec miliona. Różnica jest jednak pozorna: powyżej 272 000 tokenów wejścia Astra podwaja stawkę dla całego zapytania, a Claude wycenia pełne okno po cenie standardowej.
Źródła
- GPT-6 Astra: A new generation of intelligence, OpenAI – komunikat premierowy z pełnymi tabelami wyników i przypisami do metodyki, dostęp 13.09.2026
- API Pricing, OpenAI API Docs – stawki GPT-6 Astra i rodziny GPT-5.6, progi długiego kontekstu, dostęp 13.09.2026
- Pricing, Anthropic – stawki Claude Fable 5.1 i pozostałych modeli, mnożniki cache’u, wycena długiego kontekstu, nota o tokenizatorze, dostęp 13.09.2026
- GPT-6 Astra Model, OpenAI API Docs – okno kontekstu i limity modelu, dostęp 13.09.2026
- Artificial Analysis, Artificial Analysis – niezależny indeks inteligencji i indeks agentów kodujących, dostęp 13.09.2026
- Claude Fable 5.1 & Claude Mythos 5.1 System Card, Anthropic – dokument, do którego odsyła OpenAI przy zastrzeżeniach do wyników BenchCAD, dostęp 13.09.2026
- GPT-6 Astra System Card, OpenAI Deployment Safety Hub – metodyka ewaluacji i zastrzeżenia do porównań, dostęp 13.09.2026

