Modele AI 2026 – ranking według ceny za token, kontekstu i licencji
Modele AI to systemy generujące tekst, obraz, dźwięk lub kod, a ranking najlepszych z nich w 2026 roku czyta się przez trzy liczby: cenę za milion tokenów, długość okna kontekstu i licencję. Rozstęp cen w tym zestawieniu sięga od 0,007 do 50 dolarów za milion tokenów – siedem tysięcy razy. To ranking modeli bazowych, nie aplikacji: ChatGPT, Claude.ai i Gemini są programami, które korzystają z tych modeli.
Wszystkie ceny i okna kontekstu pochodzą z cenników API dostawców. Wyniki porównań jakościowych oznaczam osobno – z podaniem, czy to deklaracja producenta, czy niezależny pomiar.
Czym jest model AI i czym różni się od aplikacji
Model AI to plik z wagami plus architektura, która mówi, jak te wagi zastosować – a ChatGPT, Claude.ai czy Gemini to aplikacje, które ten model udostępniają przez interfejs. To rozróżnienie decyduje o tym, czy porównanie w ogóle ma sens: 20 dolarów miesięcznie za ChatGPT Plus i 10 dolarów za milion tokenów GPT-6 Astra to dwie różne rzeczy, których nie da się zestawić w jednej tabeli.
| Warstwa | Co to jest | Przykłady | Jak się płaci |
|---|---|---|---|
| Model bazowy | wytrenowany model udostępniany przez API | GPT-6 Astra, Claude Opus 5, Gemini 2.5 Pro, DeepSeek-V4 | za milion tokenów wejścia i wyjścia, osobno |
| Aplikacja / asystent | produkt z interfejsem, historią rozmów, funkcjami | ChatGPT, Claude.ai, Gemini, Perplexity | abonament miesięczny albo darmowy plan z limitami |
| Agent | system planujący kroki i używający narzędzi | asystenci kodowania, agenci obsługi zgłoszeń | zależnie od wdrożenia, zwykle za zużyte tokeny |
Praktyczna konsekwencja. Jeśli szukasz narzędzia do codziennej pracy w przeglądarce, interesuje cię warstwa aplikacji – porównanie tych produktów znajdziesz w zestawieniu czatów AI. Jeśli budujesz coś na API albo liczysz koszt wdrożenia, interesuje cię warstwa modeli i ten ranking. Architekturę, na której wszystkie te modele stoją, wyjaśnia tekst o transformerze, a nadrzędną warstwę sprawczą – materiał o agentach AI.
Jak czytać ten ranking – metodologia i klasy źródeł
Każda liczba w tym rankingu ma przypisaną klasę źródła, bo „najlepszy model” według producenta i według niezależnego pomiaru to dwie różne informacje. Rozdzielenie tych klas jest ważniejsze niż kolejność w tabeli.
| Klasa źródła | Co to jest | Jak traktować |
|---|---|---|
| Dokumentacja dostawcy | cennik API, karta modelu, okno kontekstu | najmocniejsze dla cen i parametrów – producent podaje własny cennik |
| Niezależny benchmark | Artificial Analysis, LMArena, SWE-bench | najmocniejsze dla jakości, z zastrzeżeniem, co dany test mierzy |
| Deklaracja producenta o jakości | wyniki z bloga premierowego | najsłabsza klasa – producent wybiera testy, w których wypada dobrze |
| Agregator branżowy | zestawienia cen w serwisach trzecich | używane tylko wtedy, gdy dostawca nie publikuje liczby, zawsze z adnotacją |
Ceny i okna kontekstu w tym tekście pochodzą z pierwszej klasy – z cenników API. Jeden wyjątek opisuję wprost: Alibaba nie publikuje cennika Qwen w polskiej wersji językowej, a jej oficjalna dokumentacja anglojęzyczna podaje ceny regionalne – w tym artykule użyto stawki z regionu Singapur (2 / 6 USD), zgodnej z niezależnym potwierdzeniem z 1 września 2026. Cennik Kimi K3 od Moonshot AI ma stabilny adres w oficjalnej dokumentacji dostawcy i jest już zaliczony do pierwszej klasy źródeł.
Czego benchmarki nie mierzą
Żaden z popularnych rankingów nie mierzy tego, co interesuje użytkownika najbardziej: zachowania modelu w długiej sesji roboczej nad własnymi dokumentami.
- Artificial Analysis Intelligence Index agreguje wiele testów w jedną liczbę. Zaleta: jedna oś porównania. Wada: traci informację o tym, w czym konkretny model jest dobry.
- LMArena (działająca dziś pod adresem arena.ai) mierzy preferencje ludzi w ślepych porównaniach parami: dwa anonimowe modele odpowiadają na to samo zapytanie, a użytkownik głosuje na lepszą odpowiedź, zanim pozna ich nazwy. Domyślny ranking ocenia głównie pierwszą odpowiedź w rozmowie, nie efekt godzinnej pracy nad jednym zadaniem – dłuższe, wieloturowe rozmowy platforma zbiera w osobnej kategorii, która nie wchodzi do wyniku ogólnego. Ranking liczony jest modelem Bradley-Terry, a przedziały ufności metodą bootstrap – nowe modele mają w tym rankingu szeroki margines błędu, dopóki nie zbiorą dużej liczby głosów.
- SWE-bench sprawdza naprawianie błędów w prawdziwych repozytoriach open source. To wąska domena – głównie Python – i wynik nie przenosi się automatycznie na inne języki programowania.
Przykład, dlaczego to ma znaczenie: 2 września 2026 Qwen3.8 Max prowadził w LMArena, wyprzedzając Claude Opus 5 o cztery punkty – przy błędzie pomiaru rzędu 8-19 punktów dla nowego modelu. To nie jest przewaga, to remis wewnątrz marginesu błędu – potwierdza to fakt, że już 5 września 2026 czoło rankingu ponownie zajmowały warianty Claude, a Qwen3.8 Max wypadł z pierwszej dziesiątki.
Ranking modeli AI 2026 – tabela porównawcza
Na wrzesień 2026 rynek modeli bazowych dzieli się na trzy grupy: flagowce po 10 dolarów za milion tokenów wejścia (GPT-6 Astra, Claude Fable 5.1), warstwę roboczą w przedziale 1-4 dolarów i modele tanie oraz otwarte, gdzie DeepSeek schodzi poniżej centa.
| Model | Lab | Wejście / wyjście ($/1 mln tokenów) | Okno kontekstu | Licencja |
|---|---|---|---|---|
| GPT-6 Astra | OpenAI | 10 / 50 | 1,05 mln | zamknięta |
| Claude Fable 5.1 | Anthropic | 10 / 50 | 200 tys. | zamknięta |
| Claude Opus 5 | Anthropic | 5 / 25 | 200 tys. | zamknięta |
| GPT-5.6 Sol | OpenAI | 4 / 20 | 1,05 mln | zamknięta |
| Kimi K3 | Moonshot AI | 3 / 15 | 1,048 mln | open-weight (MoE) |
| GPT-5.6 Terra | OpenAI | 2 / 12 | 1,05 mln | zamknięta |
| Claude Sonnet 5 | Anthropic | 2 / 10 | 200 tys. | zamknięta |
| Qwen3.8 Max | Alibaba | 2 / 6 | 1 mln | zamknięta |
| Grok 4.6 | xAI | 2 / 6 (do 200 tys. tokenów) | 500 tys. | zamknięta |
| Mistral Medium 3.5 | Mistral AI | 1,50 / 7,50 | 256 tys. | open-weight (Modified MIT) |
| Gemini 2.5 Pro | 1,25 / 10 (do 200 tys. tokenów) | 1 mln | zamknięta | |
| Grok 4.3 | xAI | 1,25 / 2,50 (do 200 tys. tokenów) | 1 mln | zamknięta |
| Claude Haiku 4.5 | Anthropic | 1 / 5 | 200 tys. | zamknięta |
| Gemini 3.8 Flash | 0,75 / 3,75 (cena promocyjna do 31.12.2026) | 1 mln | zamknięta | |
| Mistral Large 3 | Mistral AI | 0,50 / 1,50 | 256 tys. | open-weight, Apache 2.0 |
| GPT-5.6 Luna | OpenAI | 0,20 / 1,20 | 1,05 mln | zamknięta |
| Mistral Small 4 | Mistral AI | 0,15 / 0,60 | 256 tys. | open-weight, Apache 2.0 |
| DeepSeek-V4-Pro | DeepSeek | 0,022-1,32 wejścia / 1,98-3,96 wyjścia | 1 mln | open-weight |
| DeepSeek-V4-Flash | DeepSeek | 0,007-0,44 wejścia / 0,66-1,32 wyjścia | 1 mln | open-weight |
| Bielik-11B-v3.0-Instruct | SpeakLeash | brak API – model do pobrania | 32 768 tokenów | open-weight, Apache 2.0 |
Widełki cenowe DeepSeeka wynikają z dwóch mechanizmów: niższej stawki poza godzinami szczytu i osobnej ceny za trafienie w pamięć podręczną. Dolna wartość dotyczy zapytania powtarzającego wcześniejszy kontekst poza szczytem, górna – nowego zapytania w godzinach szczytu.
Liderzy poszczególnych kategorii
Nie ma jednego zwycięzcy – są zwycięzcy pięciu różnych osi porównania.
| Oś | Lider | Liczba |
|---|---|---|
| Najniższa cena wejścia | DeepSeek-V4-Flash | 0,007 USD za milion tokenów przy trafieniu w cache poza szczytem |
| Najdłuższy kontekst | GPT-6 Astra i GPT-5.6 | 1,05 mln tokenów |
| Najtańszy duży kontekst bez dopłaty | Qwen3.8 Max | 1 mln tokenów w jednej stawce 2 / 6 USD |
| Najtańszy model open-weight z API | Mistral Small 4 | 0,15 / 0,60 USD, Apache 2.0 |
| Polszczyzna trenowana natywnie | Bielik-11B-v3.0-Instruct | 11 mld parametrów, Apache 2.0 |
Modele z rodziny Claude wypadają w tej tabeli słabo na osi kontekstu – 200 tysięcy tokenów wobec miliona u konkurencji. W praktyce oznacza to około 150 tysięcy słów w jednym zapytaniu, czyli więcej niż większość zastosowań wymaga; różnica ujawnia się dopiero przy pracy na dużych zbiorach dokumentów naraz.
Cena za milion tokenów – ile faktycznie kosztują modele w API
Ceny modeli AI liczy się osobno za wejście i za wyjście, a wyjście jest zwykle od trzech do pięciu razy droższe – to najczęściej pomijany element kalkulacji kosztu. Przy GPT-6 Astra stosunek wynosi 10 do 50 dolarów, przy Claude Sonnet 5 – 2 do 10.
Trzy mechanizmy, które realnie zmieniają rachunek:
Pamięć podręczna kontekstu. Jeśli kolejne zapytania powtarzają ten sam początek, dostawcy liczą go taniej – pod warunkiem, że powtórzony fragment trafia dokładnie w zapisany wcześniej prefiks: dopasowanie jest bajt po bajcie, więc zmiana jednego tokena w tej części unieważnia trafienie. Tańsze jest wyłącznie wejście, nie wyjście. OpenAI schodzi przy GPT-6 Astra z 10 do 1 dolara za milion tokenów wejścia, Kimi K3 z 3 dolarów do 30 centów. Qwen3.8 Max ma dwa osobne mechanizmy cache z różną ceną: automatyczny (bez opłaty za utworzenie) obniża stawkę z 2 dolarów do 25 centów, jawny – wymagający wcześniejszego zapisania kontekstu za 2,50 dolara – schodzi do 17 centów przy każdym kolejnym odczycie. To wyjaśnia, dlaczego niezależne zestawienia cen podają dla tego modelu różne stawki cache: każde odnosi się do innego z dwóch mechanizmów. Przy asystencie odpowiadającym na pytania z tej samej instrukcji systemowej to nie optymalizacja, to inny rząd kosztu.
Dopłata za długi kontekst. Część dostawców łamie cenę na progu. Gemini 2.5 Pro kosztuje 1,25 dolara za milion tokenów wejścia do 200 tysięcy tokenów i 2,50 dolara powyżej. Grok 4.6 podwaja stawkę na tym samym progu. OpenAI stosuje analogiczny mechanizm przy GPT-6 Astra i całej rodzinie GPT-5.6 – cennik API wyodrębnia stawkę „długiego kontekstu” dwukrotnie wyższą od podstawowej (np. 20/75 USD zamiast 10/50 USD przy GPT-6 Astra), ale w przeciwieństwie do Gemini i Grok nie publikuje dokładnego progu tokenów, od którego ta wyższa stawka zaczyna obowiązywać. Qwen3.8 Max, Kimi K3 i Gemini 3.8 Flash progu nie mają – Gemini 3.8 Flash oferuje pełny milion tokenów kontekstu w jednej stawce, mimo że droższy Gemini 2.5 Pro dolicza dopłatę już od 200 tysięcy.
Ceny promocyjne z datą wygaśnięcia. Gemini 3.8 Flash kosztuje 0,75 / 3,75 dolara promocyjnie do 31 grudnia 2026, po czym stawka rośnie dwukrotnie, do 1,50 / 7,50 dolara. Kalkulacja wdrożenia oparta na cenie promocyjnej przestanie się zgadzać w styczniu.
Czego w tej tabeli nie ma. Nie ma cen abonamentów konsumenckich, bo dotyczą aplikacji, nie modeli. Ile kosztują plany ChatGPT, opisuje tekst o darmowym ChatGPT i jego limitach, a plany Anthropic – materiał o cenach Claude.
Okno kontekstu – który model przyjmie najwięcej naraz
Okno kontekstu to maksymalna liczba tokenów, którą model przetwarza w jednym zapytaniu razem z własną odpowiedzią – i w 2026 roku granica przebiega na poziomie miliona tokenów. Milion tokenów to z grubsza 700-750 tysięcy słów po angielsku i wyraźnie mniej po polsku, bo polszczyzna dzieli się na tokeny mniej ekonomicznie.
| Okno | Modele | Co się w nim mieści |
|---|---|---|
| 1,05 mln tokenów | GPT-6 Astra, GPT-5.6 Sol / Terra / Luna | kilkanaście długich raportów albo cała dokumentacja projektu |
| 1,048 mln tokenów | Kimi K3 | jak wyżej, bez dopłaty za długi kontekst |
| 1 mln tokenów | Qwen3.8 Max, Gemini 2.5 Pro, Gemini 3.8 Flash, Grok 4.3, DeepSeek-V4 | jak wyżej, przy Gemini 2.5 Pro i Groku z dopłatą powyżej 200 tys.; Gemini 3.8 Flash limituje odpowiedź do 64 tys. tokenów |
| 500 tys. tokenów | Grok 4.6 | obszerna dokumentacja, ale nie cały projekt |
| 256 tys. tokenów | Mistral Large 3, Mistral Medium 3.5, Mistral Small 4 | długi raport albo kilka średnich dokumentów naraz |
| 200 tys. tokenów | cała rodzina Claude | około 150 tys. słów, czyli gruba książka |
| 32 768 tokenów | Bielik-11B-v3.0-Instruct | kilkadziesiąt stron tekstu |
Dwa zastrzeżenia, o których dostawcy nie mówią wprost. Pierwsze: zadeklarowane okno nie znaczy, że model równie dobrze korzysta z całej jego długości – informacja ze środka bardzo długiego kontekstu bywa pomijana. Drugie: DeepSeek-V4-Pro i V4-Flash przyjmują milion tokenów na wejściu, ale oba generują maksymalnie 384 tysiące tokenów odpowiedzi, co jest osobnym limitem.
Historyczne modele OpenAI z serii GPT-5.2 i GPT-5.4 mają w tym samym cenniku kontekst ograniczony do 272 tysięcy tokenów – jeśli gdzieś czytasz o „milionie tokenów w GPT-5”, dotyczy to dopiero serii 5.6 i 6.
Licencja – modele open-weight kontra zamknięte
Model open-weight to taki, którego wagi można pobrać i uruchomić na własnym sprzęcie; model zamknięty jest dostępny wyłącznie przez API dostawcy. Różnica dotyczy nie ceny, a kontroli: przy modelu otwartym dane nie opuszczają twojej infrastruktury i nikt nie może zmienić warunków w trakcie wdrożenia.
| Model | Licencja | Co z niej wynika |
|---|---|---|
| Mistral Large 3, Mistral Small 4 | Apache 2.0 | pełne użycie komercyjne, wagi do pobrania |
| Mistral Medium 3.5 | Modified MIT | wagi do pobrania, ale bez pełnej swobody: firmy o przychodzie miesięcznym powyżej 20 mln USD potrzebują licencji komercyjnej od Mistral AI |
| Bielik-11B-v3.0-Instruct | Apache 2.0 | pełne użycie komercyjne, model trenowany na polskim korpusie |
| DeepSeek-V4 (Flash i Pro) | open-weight | wagi dostępne, obok tego płatne API dostawcy |
| Kimi K3 | własna licencja Moonshot AI (wzorowana na MIT) | 2,8 bln parametrów w architekturze MoE; firmy oferujące K3 jako usługę (Model-as-a-Service) o przychodzie powyżej 20 mln USD rocznie muszą wykupić osobną umowę komercyjną |
| PLLuM | mieszane: Apache 2.0, llama3.1, cc-by-nc-4.0 | część wariantów wyklucza użycie komercyjne |
| GPT, Claude, Gemini, Grok, Qwen Max | zamknięte | wyłącznie API, warunki po stronie dostawcy |
Pułapka licencyjna, którą trzeba znać. „Open-weight” nie znaczy „open source” w rozumieniu klasycznych licencji wolnego oprogramowania – udostępnione są wagi, nie dane treningowe ani kod treningu. Nie znaczy też automatycznie „wolno komercyjnie bez ograniczeń”: rodzina PLLuM ma warianty na licencji cc-by-nc-4.0, która użycie komercyjne wyklucza, Mistral Medium 3.5 udostępnia wagi na licencji Modified MIT z progiem przychodowym 20 mln USD miesięcznie, a własna licencja Kimi K3 wymaga osobnej umowy komercyjnej od firm oferujących model jako usługę przy przychodzie powyżej 20 mln USD rocznie. Przy wdrożeniu firmowym licencję sprawdza się per wariant modelu, nie per rodzina.
Darmowe i otwarte modele, które faktycznie działają
Najtańszym sposobem korzystania z dobrego modelu nie jest darmowy plan aplikacji, lecz uruchomienie modelu otwartego lokalnie. Trzy realne ścieżki:
- Mistral Small 4 – Apache 2.0, 0,15 dolara za milion tokenów w API, jeśli nie chcesz stawiać własnej infrastruktury.
- DeepSeek-V4-Flash – najtańsze API w tym zestawieniu i otwarte wagi do samodzielnego uruchomienia.
- Bielik-11B-v3.0-Instruct – 11 miliardów parametrów, do pobrania z Hugging Face, trenowany pod polszczyznę.
Do pracy na laptopie albo telefonie lepiej sprawdzają się mniejsze modele projektowane pod ten scenariusz – zestawia je przewodnik po małych modelach językowych. Praktyczną stronę uruchamiania modelu bez chmury opisuje materiał o sztucznej inteligencji offline.
Co zmieniło się w ostatnich 12 miesiącach
Największa zmiana na rynku modeli nie dotyczy wyników w benchmarkach, lecz licencji: Meta porzuciła strategię otwartych wag, na której zbudowała pozycję Llamy.
8 kwietnia 2026 – Meta wprowadza Muse Spark. To pierwszy zamknięty model frontier spod szyldu nowo utworzonego Meta Superintelligence Labs, zamiast kolejnej otwartej generacji Llamy. Firmowa strona dla deweloperów wciąż udostępnia do pobrania Llamę 4 i Llamę 3 – Llamy 5 tam nie ma. 10 sierpnia 2026 Meta częściowo zawróciła, wydając Muse Glimmer: gęsty model o 30 miliardach parametrów na licencji Apache 2.0, z wagami na Hugging Face.
Praktyczny wniosek: zdanie „Llama to darmowy, otwarty model Meta” jest od kwietnia 2026 nieaktualne dla modeli flagowych. Otwarte pozostają starsze Llamy, nowa rodzina Muse Spark domyślnie nie.
OpenAI przestawia się na GPT-6 Astra i GPT-5.6. Modele GPT-5, 5.1, 5.2, 5.4 i 5.5 są w cenniku API nadal aktywne, ale strona modeli prezentuje jako wiodące wyłącznie GPT-6 Astra i trzy warianty GPT-5.6 – Sol, Terra i Luna. Pełne okno 1,05 miliona tokenów dotyczy tylko tych nowszych. Historia całej rodziny GPT jest opisana w osobnym przewodniku po modelach GPT.
Anthropic przenosi flagę na Opus 5 i Fable 5.1. Starsze Opus 4.1-4.8 oraz Sonnet 4.5-4.6 producent oznacza jako legacy: nadal działają, ale zostały zastąpione.
3 sierpnia 2026 – premiera Qwen3.8 Max. Alibaba weszła z ceną 2 / 6 dolarów i milionem tokenów kontekstu bez dopłaty, po czym model objął prowadzenie w LMArena – z zastrzeżeniem o marginesie błędu, o którym piszę wyżej.
16 lipca 2026 – start API Kimi K3. Moonshot AI wypuściło model MoE o 2,8 biliona parametrów z oknem 1,048 miliona tokenów, wchodząc w niszę „tani, duży kontekst, otwarte wagi” obok DeepSeeka. Kontekst rynkowy tej rywalizacji opisuje tekst o wojnach modeli AI, a mechanizm, który wyniósł chińskie modele do pierwszej ligi – materiał o DeepSeeku.
Polskie modele językowe – Bielik i PLLuM
Polska ma dwa własne modele językowe o różnym rodowodzie: Bielika ze środowiska open source i PLLuM finansowany przez Ministra Cyfryzacji. Żaden z nich nie konkuruje z modelami frontier na benchmarkach ogólnych – oba istnieją z innego powodu: polszczyzny w danych treningowych i kontroli nad tym, gdzie przetwarzane są dane.
| Cecha | Bielik | PLLuM |
|---|---|---|
| Twórca | Fundacja SpeakLeash (środowisko open source) | konsorcjum: NASK-PIB (lider), Politechnika Wrocławska, IPI PAN, Instytut Slawistyki PAN, OPI-PIB, Uniwersytet Łódzki, ACK Cyfronet AGH, Centralny Ośrodek Informatyki |
| Finansowanie | społecznościowe, z zaplecza obliczeniowego uczelni | Minister Cyfryzacji |
| Warianty | Bielik-11B-v3.0-Instruct (11 mld parametrów) | 4B, 8B, 12B, 8x7B, 70B |
| Licencja | Apache 2.0 – użycie komercyjne dozwolone | mieszane: Apache 2.0, llama3.1, cc-by-nc-4.0 przy części wariantów |
| Okno kontekstu | 32 768 tokenów natywnie | niepodane w karcie modelu |
| Cel | ogólny model polskojęzyczny do zastosowań własnych i komercyjnych | administracja publiczna, suwerenność cyfrowa |
Rodzina PLLuM powiększyła się o kolejne warianty 21 maja 2026. Przy planowaniu wdrożenia komercyjnego licencję trzeba sprawdzić per wariant – część wersji na cc-by-nc-4.0 użycia komercyjnego nie dopuszcza, i to jest realna różnica wobec Bielika, którego Apache 2.0 nie stawia takiego warunku.
Jak Bielik wypada na polskich zadaniach i skąd bierze się jego efektywność przy 11 miliardach parametrów, opisuje osobny tekst o polskim modelu językowym Bielik.
Który model wybrać do konkretnego zadania
Wybór modelu wynika z dominującego ograniczenia w twoim zastosowaniu: kosztu, długości kontekstu, licencji albo języka. Poniżej rekomendacje według tego, co ogranicza cię najbardziej.
| Twoje ograniczenie | Rekomendacja | Dlaczego |
|---|---|---|
| Koszt przy dużym wolumenie | DeepSeek-V4-Flash, GPT-5.6 Luna, Mistral Small 4 | najniższe stawki w zestawieniu, od 0,007 do 0,20 USD za milion tokenów wejścia |
| Bardzo długie dokumenty | Qwen3.8 Max, Kimi K3, Gemini 3.8 Flash | milion tokenów bez progowej dopłaty za długi kontekst |
| Dane nie mogą opuścić firmy | Mistral Large 3, DeepSeek-V4, Bielik | otwarte wagi, uruchomienie na własnej infrastrukturze |
| Teksty po polsku | Bielik, obok niego modele frontier | jedyny model trenowany natywnie na polskim korpusie |
| Administracja publiczna | PLLuM | projekt budowany pod ten scenariusz, z zastrzeżeniem licencji per wariant |
| Najwyższa jakość bez limitu budżetu | GPT-6 Astra, Claude Fable 5.1 | najwyżej wycenione modele flagowe obu laboratoriów |
| Kodowanie | modele flagowe, weryfikowane osobnym benchmarkiem | benchmarki ogólne nie przenoszą się na jakość kodu |
Przy zadaniach programistycznych ranking ogólny mówi mniej niż test na realnym zadaniu – własny benchmark kodowania od zera znajdziesz w tekście o ProgramBench.
Niezależnie od wybranego modelu obowiązuje jedno: żaden z nich nie gwarantuje prawdziwości odpowiedzi. Mechanizm zmyślania faktów i sposoby jego ograniczania opisuje materiał o halucynacjach AI.
FAQ
Nie ma jednego. Na osi ceny wygrywa DeepSeek-V4-Flash, na osi kontekstu GPT-6 Astra i GPT-5.6, w LMArena na 2 września 2026 chwilowo prowadził Qwen3.8 Max – przewagą mieszczącą się w marginesie błędu, a już 5 września 2026 czoło rankingu odzyskały warianty Claude. Wybór zależy od tego, co cię ogranicza.
GPT-6 Astra: 10 dolarów wejście, 50 wyjście. Claude Opus 5: 5 i 25. Gemini 2.5 Pro: 1,25 i 10 dolarów przy kontekście do 200 tysięcy tokenów. Wszystkie stawki według cenników API z 5 września 2026.
ChatGPT jest aplikacją, model to jej silnik. Aplikacja dodaje interfejs, historię rozmów, pamięć i funkcje, a płacisz za nią abonamentem. Za model płaci się za zużyte tokeny, przez API.
Starsze Llama 3 i Llama 4 pozostają dostępne do pobrania, ale od 8 kwietnia 2026 Meta rozwija zamkniętą rodzinę Muse Spark. Wyjątkiem jest Muse Glimmer z 10 sierpnia 2026 – model 30B na licencji Apache 2.0.
Do kodowania sensowną wskazówką jest SWE-bench, ale mierzy on wąską domenę – naprawianie błędów w repozytoriach Pythona. Wynik z benchmarku ogólnego nie przenosi się na jakość kodu w innym języku programowania.
Darmowe do pobrania i uruchomienia są modele open-weight: Mistral Large 3 i Small 4 na Apache 2.0, DeepSeek-V4, Kimi K3 oraz polski Bielik. Koszt przenosi się wtedy z opłaty za tokeny na sprzęt i prąd.
Maksymalna liczba tokenów, którą model przetwarza w jednym zapytaniu razem ze swoją odpowiedzią. Milion tokenów to około 700 tysięcy słów po angielsku i wyraźnie mniej po polsku, bo polszczyzna dzieli się na tokeny mniej ekonomicznie.
Ma, ale z innego powodu niż wynik w benchmarku. Bielik jest jedynym modelem trenowanym natywnie na polskim korpusie i działa na własnej infrastrukturze, więc dane nie wychodzą poza firmę. To dwie rzeczy, których modele frontier nie dają.
Źródła
- OpenAI API – Pricing, OpenAI – ceny i okna kontekstu modeli GPT-6 Astra i GPT-5.6, dostęp 05.09.2026
- OpenAI API – Models, OpenAI – lista modeli wiodących i legacy, dostęp 05.09.2026
- Claude – Pricing, Anthropic – ceny API rodziny Claude, dostęp 05.09.2026
- Gemini API – Pricing, Google – ceny Gemini 2.5 Pro i 3.8 Flash wraz z ceną promocyjną, dostęp 05.09.2026
- Gemini 3.8 Flash – Model Card, Google DeepMind – okno kontekstu 1 mln tokenów wejścia i limit 64 tys. tokenów wyjścia, dostęp 05.09.2026
- xAI – Models and pricing, xAI – ceny i progi kontekstu Grok 4.6 i 4.3, dostęp 05.09.2026
- DeepSeek API Docs – Pricing, DeepSeek – ceny off-peak i cache dla V4-Pro i V4-Flash, dostęp 05.09.2026
- Mistral AI – API Pricing, Mistral AI – ceny i licencje modeli Large 3, Medium 3.5 i Small 4, dostęp 05.09.2026
- Mistral Large 3 – Model Card, Mistral AI – okno kontekstu 256 tys. (262 144) tokenów, dostęp 05.09.2026
- Mistral Medium 3.5 – Model Card, Mistral AI – okno kontekstu 256 tys. tokenów, dostęp 05.09.2026
- Introducing Mistral Small 4, Mistral AI – okno kontekstu 256 tys. tokenów, dostęp 05.09.2026
- Under which license are Mistral’s open models available?, Mistral AI – próg przychodowy 20 mln USD miesięcznie w licencji Modified MIT, dostęp 05.09.2026
- qwen3.8-max – Model Info, Alibaba Cloud Model Studio, Alibaba Cloud – ceny regionalne Qwen3.8 Max (region Singapur: 2 / 6 USD) oraz dwa mechanizmy cache: automatyczny (0,25 USD za odczyt) i jawny (2,50 USD za zapis, 0,17 USD za odczyt), dostęp 05.09.2026
- Kimi K3 – Pricing, Moonshot AI (platform.kimi.ai), Moonshot AI – oficjalny cennik Kimi K3 i okno kontekstu 1 048 576 tokenów, dostęp 05.09.2026
- Kimi K3 License, Moonshot AI / Hugging Face – próg przychodowy 20 mln USD dla operatorów Model-as-a-Service, dostęp 05.09.2026
- Bielik-11B-v3.0-Instruct – karta modelu, SpeakLeash / Hugging Face – parametry, licencja i okno kontekstu, dostęp 05.09.2026
- Advancing Polish Language Modeling, arXiv – potwierdzenie okna kontekstu Bielika, dostęp 05.09.2026
- PLLuM – Polish Large Language Model, konsorcjum PLLuM – warianty modelu i licencje, dostęp 05.09.2026
- Rodzina PLLuM znowu się powiększa – polskie AI coraz silniejsze, NASK – komunikat z 21.05.2026 o rozszerzeniu rodziny PLLuM i konsorcjum, dostęp 05.09.2026
- With Muse Spark, Meta Pivots Away From its Open-Weights Llama Strategy, The Batch (DeepLearning.AI) – zwrot strategiczny Meta, dostęp 05.09.2026
- Meta AI for Developers, Meta – modele udostępniane do pobrania, dostęp 05.09.2026
- Arena Leaderboard, LMArena (dawniej lmarena.ai) – bieżący ranking modeli, potwierdzenie zmiany pozycji Qwen3.8 Max i Claude między 02.09.2026 a 05.09.2026, dostęp 05.09.2026
- How it works, Arena, LMArena – mechanizm głosowania parami i kategorie rankingu (w tym osobna kategoria wieloturowa), dostęp 05.09.2026
- Chatbot Arena: New models & Elo system update, LMSYS Org – metodologia rankingu: model Bradley-Terry i przedziały ufności metodą bootstrap, dostęp 05.09.2026
- SWE-bench: Can Language Models Resolve Real-World GitHub Issues?, Jimenez i in., ICLR 2024 – 2294 zadania z 12 repozytoriów Pythona, dostęp 05.09.2026
- Lost in the Middle: How Language Models Use Long Contexts, Liu i in., Transactions of the Association for Computational Linguistics 12:157-173, 2024 – spadek trafności przy informacji ze środka długiego kontekstu, dostęp 05.09.2026
- The Open Source AI Definition – 1.0, Open Source Initiative – wymóg jednoczesnego udostępnienia danych, kodu i wag, dostęp 05.09.2026
- Open Weights: not quite what you’ve been told, Open Source Initiative – różnica między open-weight a Open Source AI, dostęp 05.09.2026

