Detektor AI po polsku – co naprawdę wykrywa na polskich tekstach
Na polskim tekście detektory działają gorzej niż na angielskim, a jedyne narzędzie mające w Polsce znaczenie formalne – moduł analizy SI w Jednolitym Systemie Antyplagiatowym – jest opcjonalne, oparte na perplexity i z założenia niewiążące. Jego operator, Ośrodek Przetwarzania Informacji, stwierdza w dokumentacji wprost, że stworzenie narzędzia rozstrzygającego o użyciu AI jest „aktualnie praktycznie niemożliwe”. Recenzowane badanie z lipca 2026 roku pokazuje jednocześnie, że polszczyzna jest wykrywalna – ale tylko przez klasyfikatory dostrojone specjalnie do języków Europy Środkowej, a nie przez narzędzia komercyjne.
Ten wpis nie porównuje narzędzi – robi to ranking wykrywaczy AI. Tutaj chodzi wyłącznie o to, co wiadomo o skuteczności detekcji na tekstach polskich i skąd to wiadomo.
Skąd pochodzą liczby w tym tekście
Nie z własnego testu i nie z materiałów producentów. Każda liczba niżej ma podane źródło, autora i datę pomiaru, bo w tym temacie to jest jedyne kryterium wiarygodności.
| Warstwa dowodowa | Źródło | Waga |
|---|---|---|
| Dokumentacja polskiego systemu | baza wiedzy JSA, Ośrodek Przetwarzania Informacji | źródło pierwotne |
| Badanie recenzowane obejmujące polski | CEAID, Findings of ACL 2026 | najwyższa |
| Badanie recenzowane o fałszywych alarmach | APT-Eval, Findings of ACL 2025 | najwyższa |
| Badanie o tym, co detektory faktycznie mierzą | Carnegie Mellon University, maj 2026 | wysoka |
| Deklaracje producentów o własnej skuteczności | strony narzędzi | najniższa, cytowane z zastrzeżeniem |
Jedyny detektor, który w Polsce ma znaczenie formalne
Jeśli piszesz pracę dyplomową w Polsce, liczy się jeden system: Jednolity System Antyplagiatowy prowadzony przez Ośrodek Przetwarzania Informacji. Wszystkie inne detektory są prywatnymi narzędziami bez umocowania w procesie dyplomowania.
Jak działa moduł analizy SI
Funkcjonalność weszła do JSA wraz z wersją 2.15.0, wdrożoną na środowisko testowe 6 grudnia 2023 roku. Dokumentacja była ostatnio aktualizowana 8 lipca 2025 roku.
Metoda jest opisana wprost i jest to metoda klasyczna. System opiera się na modelu językowym wyznaczającym prawdopodobieństwo kolejnych wyrazów w danym kontekście, a klasyfikacja idzie przez perplexity:
„Metoda detekcji wdrożona do systemu JSA opiera się na hipotezie, że im większa regularność w tekście, tym jest większe prawdopodobieństwo, że tekst został wytworzony przez model językowy.”
Kryterium jest progowe: fragment zostaje oznaczony jako podejrzany, gdy jego wartość perplexity spada poniżej ustalonego progu. To jest ta sama rodzina metod, którą opisujemy przy okazji mechaniki detekcji – i ma te same ograniczenia.
Co mówi o tym sam OPI
Dokumentacja JSA jest pod tym względem uczciwsza niż materiały większości komercyjnych detektorów. Trzy zdania warte zacytowania:
O możliwości zbudowania takiego narzędzia:
„Stworzenie narzędzia, które by wskazywało czy autor tekstu korzystał lub nie ze sztucznej inteligencji, jest aktualnie praktycznie niemożliwe.”
O statusie wyniku:
„System nie dokonuje wiążących ustaleń dotyczących wykroczeń.”
O błędach klasyfikacji – dokumentacja osobno definiuje fałszywe pozytywy i fałszywe negatywy, i wskazuje konsekwencje tych pierwszych: „błędne posądzanie o złą wolę, co dalej może utrudniać proces dyplomowy”.
OPI wymienia też konkretną przyczynę fałszywych alarmów, która w pracach dyplomowych występuje masowo: definicje, reguły i akty prawne są sformułowane tak, że prawdopodobieństwo kolejnych słów jest wysokie. Rozdział teoretyczny pracy magisterskiej, pełen definicji i cytowanych przepisów, jest z natury materiałem o niskiej perplexity.
Kiedy moduł w ogóle jest włączany
Analiza SI jest funkcją dodatkową i nieobowiązkową. Uruchamia się ją zaznaczeniem pola przy zakładaniu badania, a raz ustawionej wartości nie da się zmienić w kolejnych próbach – zostaje zablokowana. Sekcja z wynikami pojawia się w raporcie tylko wtedy, gdy pole zaznaczono.
Praktycznie oznacza to trzy rzeczy:
- promotor albo uczelnia decyduje, czy analiza w ogóle zostanie przeprowadzona
- brak sekcji „Analiza SI” w raporcie nie znaczy, że tekst przeszedł test – znaczy, że testu nie było
- decyzja zapada przed badaniem i jest nieodwracalna dla danego zgłoszenia
Co mówi badanie recenzowane o wykrywaniu polskiego tekstu
Najlepszym dostępnym dowodem jest benchmark CEAID – „Benchmark of Multilingual Machine-Generated Text Detection Methods for Central European Languages” autorstwa Dominika Macko i Jakuba Kopála, opublikowany w Findings of the Association for Computational Linguistics: ACL 2026 w lipcu 2026 roku, strony 29177-29190.
To pierwszy benchmark detekcji tekstu maszynowego skupiony na tym regionie językowym i polski jest w nim jednym z siedmiu badanych języków, obok chorwackiego, czeskiego, niemieckiego, węgierskiego, słowackiego i słoweńskiego.
Metodyka
| Element | Wartość |
|---|---|
| Języki | 7, w tym polski |
| Próbki treningowe | 132 168 |
| Próbki testowe | 55 930 |
| Domeny | artykuły prasowe i teksty z mediów społecznościowych |
| Modele generujące | 8 |
| Klasy detektorów | statystyczne, pretrenowane, dostrojone |
Testowano między innymi detektory statystyczne (Binoculars, Fast-DetectGPT), pretrenowane klasyfikatory oraz modele dostrojone (mDeBERTa-v3-base, XLM-RoBERTa-base, Llama-3.2-3B, Gemma-2-2B).
Wyniki
Najlepszy wynik na polskim tekście osiągnął model Llama-3.2-3B dostrojony na kombinacji niemiecki-polski-węgierski: 0,9765 AUC ROC. Dla porównania na węgierskim ten sam model osiągnął 0,9851.
Trzy ustalenia ważniejsze od samej liczby:
Wygrywają detektory dostrojone, nie statystyczne. Autorzy podsumowują, że „nadzorowane, dostrojone detektory w językach Europy Środkowej okazują się najskuteczniejsze w tych językach, a zarazem najbardziej odporne na maskowanie”. To odwraca kolejność z rynku komercyjnego, gdzie dominują rozwiązania ogólne.
Polski jest językiem kluczowym dla treningu. Znalazł się w 8 z 10 najlepszych kombinacji językowych użytych do dostrajania, niemiecki w 9 z 10. Model, który widział polszczyznę w treningu, radzi sobie lepiej także z innymi językami regionu.
Maskowanie homoglifami jest groźniejsze niż parafraza. Podmiana znaków na wizualnie identyczne odpowiedniki z innych alfabetów obniżyła skuteczność Fast-DetectGPT o 89,8%, a modelu mDeBERTa o 20,3%. Autorzy stwierdzają wprost, że ta technika szkodzi detekcji istotnie bardziej niż przepisywanie tekstu.
Czego to badanie nie mówi. CEAID testował modele badawcze, nie komercyjne detektory sprzedawane w abonamencie. Z wyniku 0,9765 nie wynika, że którykolwiek dostępny na rynku detektor osiąga taką skuteczność na polskim tekście. Wynika co innego, i to jest właściwy wniosek: polszczyzna jest wykrywalna, pod warunkiem że klasyfikator był na niej trenowany.
Dlaczego polszczyzna jest dla detektorów trudniejsza
Nie chodzi o „trudność języka”, tylko o trzy mierzalne właściwości, które psują statystyczne miary detekcji.
Fleksja. Polski wyraz występuje w kilkunastu formach. Model językowy szacujący prawdopodobieństwo kolejnego tokenu ma w polszczyźnie z definicji szerszy rozkład niż w angielskim, gdzie form jest mniej. Perplexity liczona tym samym sposobem daje inne wartości – a progi detekcji ustawiano na angielskim.
Szyk swobodny. W angielskim kolejność wyrazów jest w dużej mierze wymuszona składnią, więc odstępstwo od niej jest sygnałem. W polszczyźnie kilka wariantów szyku jest równie poprawnych, a wybór niesie akcent zdaniowy. Sygnał, który w angielskim coś znaczy, w polskim jest szumem.
Reprezentacja w korpusach. Polski stanowi ułamek danych treningowych typowego klasyfikatora. Skoro model gorzej zna rozkład polszczyzny, gorzej odróżnia w niej tekst maszynowy od ludzkiego – w obie strony.
Do tego dochodzi wniosek z badania zespołu Uniwersytetu Stanforda pod kierunkiem Weixina Lianga: detektory karzą tekst za niższą różnorodność językową, przez co ponad 61% esejów osób piszących w języku nierodzimym oznaczyły jako AI. Badanie dotyczyło narzędzi z 2023 roku i nowsze klasyfikatory celują wprost w tę wadę, ale mechanizm pozostaje ten sam: słabiej reprezentowany język plus miara karząca przewidywalność daje podwyższone ryzyko fałszywego alarmu.
Fałszywe alarmy – co ryzykuje autor tekstu napisanego samodzielnie
To jest najważniejsza liczba w całym temacie i pochodzi z badania recenzowanego, nie z rankingu.
Praca „Almost AI, Almost Human” (Shoumik Saha, Soheil Feizi, University of Maryland), opublikowana w Findings of ACL 2025, sprawdziła, co detektory robią z tekstem napisanym przez człowieka i tylko lekko poprawionym narzędziem AI. Zbiór APT-Eval to 14,7 tysiąca próbek i 12 detektorów.
Po skrajnie drobnej poprawce tekst ludzki został zaklasyfikowany jako wygenerowany maszynowo przez:
| Detektor | Odsetek błędnie oznaczonych tekstów ludzkich |
|---|---|
| GPTZero | 64,71% |
| Pangram | 42,56% |
| ZeroGPT | 32,31% |
| GLTR | 40,87% (przy 6,83% na tekście nietkniętym) |
Przy poprawce obejmującej 1% słów GLTR oznaczył jako maszynowe 26,85% próbek.
Przełożenie na sytuację polskiego studenta jest bezpośrednie. Przepuszczenie własnego rozdziału przez narzędzie poprawiające interpunkcję albo stylistykę – czynność powszechna i niebudząca wątpliwości – wystarczy, żeby część detektorów oznaczyła tekst jako maszynowy. Nie dlatego, że go nie napisałeś, tylko dlatego, że przeszedł przez model.
Detektory mierzą nie to, co deklarują
Badanie z Carnegie Mellon University z 19 maja 2026 roku pokazuje, na czym naprawdę opiera się wskazanie detektora – i nie jest to „bycie AI”.
Zespół Yixuana Evena Xu, Ziqiana Zhonga, Aditi Raghunathan, Fei Fanga i J. Zico Koltera („Base Models Look Human To AI Detectors”) porównał ten sam model w wersji bazowej i w wersji dostrojonej instrukcjami. Dla Llama3-8B z ludzkim prefiksem:
| Wersja modelu | GPTZero – prawdopodobieństwo autorstwa ludzkiego | Pangram |
|---|---|---|
| bazowa | 96,7% | 98,8% |
| instrukcyjna | 30,3% | 17,1% |
Ten sam model, ta sama architektura, te same prompty – i przeciwne werdykty. Autorzy formułują wniosek bez ogródek: obecne detektory nie wykrywają „AI” jako takiego, tylko statystyczne ślady dostrajania po treningu.
Dla polskiego czytelnika ma to konkretne znaczenie. Wskazanie detektora nie jest odpowiedzią na pytanie „czy to napisała maszyna”. Jest odpowiedzią na pytanie „czy ten tekst statystycznie przypomina wyjście popularnego, dostrojonego modelu komercyjnego”. To dwa różne pytania i mylenie ich jest źródłem większości krzywd wyrządzonych przez te narzędzia.
Czy detektory rozpoznają teksty polskiego modelu Bielik
Nie ma opublikowanego badania, które by to sprawdziło, i trzeba to powiedzieć wprost zamiast zgadywać. Bielik nie występuje w zestawie modeli generujących w benchmarku CEAID, nie ma go też w innych publicznych benchmarkach detekcji.
Co da się powiedzieć na podstawie ustaleń, które są udokumentowane:
Badanie CMU wykazało, że detektory reagują na ślady dostrajania konkretnych, popularnych modeli, a nie na cechy tekstu maszynowego w ogóle. CEAID wykazał z kolei, że skuteczność zależy od tego, czy klasyfikator był trenowany na danym języku i na danym generatorze – benchmark bada „multi-generator” właśnie dlatego, że wyniki między modelami się nie przenoszą.
Z połączenia obu wynika przewidywanie, nie pomiar: model o innym rozkładzie niż komercyjna czołówka, trenowany na polszczyźnie, ma większe szanse przejść przez detektor uczony na wyjściach ChatGPT, Claude i Gemini. To hipoteza wynikająca z opublikowanych badań, a nie zmierzony wynik – i dopóki ktoś nie przeprowadzi takiego testu, tak trzeba ją traktować.
Co robić przy oskarżeniu o użycie AI w pracy dyplomowej
Wskazanie detektora nie jest dowodem i sam operator polskiego systemu tak to opisuje. Poniżej kolejność działań oparta na dokumentach, na które da się powołać.
1. Zapytaj, jakie narzędzie i jaki wynik. Sam procent nic nie znaczy bez nazwy narzędzia, progu klasyfikacji i daty badania.
2. Powołaj się na dokumentację JSA. Jeśli wynik pochodzi z modułu analizy SI, w bazie wiedzy OPI stoi wprost, że system „nie dokonuje wiążących ustaleń dotyczących wykroczeń”, a stworzenie narzędzia rozstrzygającego o użyciu AI jest „aktualnie praktycznie niemożliwe”. To jest stanowisko operatora systemu, nie opinia z zewnątrz.
3. Wskaż mechanizm fałszywych alarmów w twoim typie tekstu. Dokumentacja OPI wymienia definicje, reguły i akty prawne jako materiał z natury podatny na oznaczenie. Rozdział teoretyczny pracy zbudowany na definicjach i przepisach mieści się w tym opisie dokładnie.
4. Przywołaj badania recenzowane. APT-Eval z Findings of ACL 2025 pokazuje od 32% do 65% fałszywych alarmów na tekstach ludzkich po drobnej korekcie. Badanie zespołu Stanforda – ponad 61% fałszywych alarmów na esejach osób piszących w języku nierodzimym.
5. Pokaż proces pisania. Historia wersji w edytorze, kolejne szkice, notatki, bibliografia z datami. To jedyny materialny dowód po twojej stronie i jedyny, którego nie da się podważyć statystyką.
Profilaktycznie: pisz w edytorze zapisującym historię zmian. Konfiguracja zajmuje kilka sekund, a przy sporze jest jedyną rzeczą, która działa.
Najczęstsze pytania
Gorzej niż na angielskim. Badanie CEAID z Findings of ACL 2026 pokazuje, że polszczyzna jest wykrywalna z wynikiem 0,9765 AUC ROC, ale wyłącznie przez klasyfikatory dostrojone na językach Europy Środkowej. Narzędzia komercyjne trenowano głównie na angielszczyźnie i ich skuteczności na polskim nikt niezależnie nie zmierzył.
JSA ma moduł analizy użycia sztucznej inteligencji oparty na perplexity, dostępny od wersji 2.15.0 systemu. Jest opcjonalny – działa tylko gdy uczelnia zaznaczy odpowiednie pole przy zakładaniu badania. OPI zaznacza, że system nie dokonuje wiążących ustaleń dotyczących wykroczeń.
Nie ma metody dającej pewność. Detektory statystyczne mierzą przewidywalność tekstu, a nie autorstwo, i mylą się w obie strony. Przy tekstach polskich margines błędu jest większy niż przy angielskich. Jedynym twardym materiałem pozostaje historia powstawania dokumentu.
Darmowe wersje oferują między innymi ZeroGPT, GPTZero, Copyleaks i Sapling, zwykle z limitem znaków na sprawdzenie. Porównanie ich zakresów i deklarowanej obsługi języków znajdziesz w rankingu wykrywaczy AI.
Ryzyko rośnie. Detektory oparte na perplexity karzą przewidywalność, więc tekst prosty, formalny, proceduralny albo oparty na definicjach jest bardziej narażony. Dokumentacja JSA wymienia definicje, reguły i akty prawne jako typowe źródło fałszywych alarmów.
Często tak, i to jest głównym problemem tych narzędzi. W badaniu APT-Eval skrajnie drobna korekta tekstu ludzkiego wystarczyła, żeby GPTZero oznaczył jako maszynowe 64,71% próbek, a Pangram 42,56%.
Źródła
- Analiza użycia sztucznej inteligencji, Jednolity System Antyplagiatowy, Ośrodek Przetwarzania Informacji – aktualizacja 08.07.2025, dostęp 30.08.2026
- Analiza użycia Sztucznej Inteligencji (SI) dostępna na DEMO, JSA / OPI, 06.12.2023 – dostęp 30.08.2026
- CEAID: Benchmark of Multilingual Machine-Generated Text Detection Methods for Central European Languages, Macko D., Kopál J., Findings of the Association for Computational Linguistics: ACL 2026, lipiec 2026, s. 29177-29190 – dostęp 30.08.2026
- CEAID – wersja arXiv:2509.26051, Macko D., Kopál J., 30.09.2025 – dostęp 30.08.2026
- Almost AI, Almost Human: The Challenge of Detecting AI-Polished Writing, Saha S., Feizi S., Findings of the Association for Computational Linguistics: ACL 2025 – dostęp 30.08.2026
- Base Models Look Human To AI Detectors, Xu Y. E., Zhong Z., Raghunathan A., Fang F., Kolter J. Z., Carnegie Mellon University, 19.05.2026 – dostęp 30.08.2026
- GPT detectors are biased against non-native English writers, Liang W., Yuksekgonul M., Mao Y., Wu E., Zou J., Stanford University – publikacja w czasopiśmie Patterns, 2023, DOI 10.1016/j.patter.2023.100779 – dostęp 30.08.2026
- Testing of detection tools for AI-generated text, Weber-Wulff D. i in., International Journal for Educational Integrity, 2023 – dostęp 30.08.2026

