Test Turinga – na czym polega i czy sztuczna inteligencja go zdała
Test Turinga sprawdza jedną rzecz: czy w rozmowie da się odróżnić maszynę od człowieka. Nie mierzy inteligencji, rozumienia ani świadomości – mierzy nieodróżnialność. W kontrolowanym badaniu opublikowanym w „Proceedings of the National Academy of Sciences” GPT-4.5 z poleceniem przyjęcia ludzkiej osobowości był wskazywany jako człowiek w 73% rozmów, czyli częściej niż prawdziwy człowiek siedzący po drugiej stronie.
Ten tekst tłumaczy, jak test wygląda w oryginale Turinga, co dokładnie pokazały badania na współczesnych modelach i dlaczego branża od tego testu odeszła, choć nazwa została.
Na czym polega test Turinga
Alan Turing zaproponował test w 1950 roku jako zamiennik pytania „czy maszyny mogą myśleć”, które uznał za zbyt nieostre, żeby dało się na nie odpowiedzieć. Zamiast definiować myślenie, zaproponował grę.
W oryginalnym układzie, który Turing nazwał grą w naśladownictwo, biorą udział trzy osoby: przesłuchujący, mężczyzna i kobieta. Przesłuchujący siedzi w osobnym pokoju i przez wymianę pisanych wiadomości ma ustalić, kto jest kim. Turing zadał wtedy pytanie, które jest sednem całej propozycji: co się stanie, jeśli w tej grze rolę jednego z uczestników przejmie maszyna? Czy przesłuchujący będzie mylił się równie często?
Trzy elementy tego układu decydują o wszystkim:
- Kanał jest tekstowy. Turing celowo odciął głos i wygląd, żeby oceniać wyłącznie treść rozmowy.
- Uczestników jest trzech, nie dwóch. Sędzia rozmawia równocześnie z maszyną i z człowiekiem, i wybiera między nimi. To jest istotne, bo podnosi poprzeczkę: nie wystarczy wypaść wiarygodnie, trzeba wypaść wiarygodniej od żywego rozmówcy.
- Kryterium jest statystyczne. Liczy się, jak często sędzia się myli, a nie czy pojedyncza rozmowa kogoś zwiodła.
Popularna wersja testu, powtarzana w mediach – „komputer rozmawia z człowiekiem, a ten zgaduje” – gubi punkt drugi. A to właśnie on odróżnia rzetelne badanie od efektownej demonstracji.
Czego test Turinga nie mierzy
Zdanie testu dowodzi, że system potrafi naśladować ludzką rozmowę. Nie dowodzi, że rozumie, o czym mówi. To rozróżnienie ma swoją klasyczną postać w filozofii umysłu.
John Searle opisał w 1980 roku eksperyment myślowy zwany chińskim pokojem. Człowiek zamknięty w pokoju dostaje kartki ze znakami chińskimi i księgę reguł w swoim języku, która mówi, jakimi znakami odpowiadać na jakie znaki. Odpowiedzi wychodzące z pokoju są poprawne, więc z zewnątrz wygląda to na znajomość chińskiego. Człowiek w środku nie rozumie ani słowa. Searle wyprowadził z tego wniosek, że manipulowanie symbolami według reguł nie wystarcza, by mówić o rozumieniu.
Zastosowany do testu Turinga argument brzmi: system może przejść test i nadal być chińskim pokojem. Test bada zachowanie, nie stan wewnętrzny.
Druga słabość jest bardziej praktyczna. Test mierzy nie tylko zdolności maszyny, ale też czujność i uprzedzenia sędziego. Człowiek przekonany, że maszyna nie może popełniać literówek, wskaże jako maszynę tego rozmówcę, który pisze zbyt poprawnie. W efekcie wynik mówi tyle samo o ludzkich założeniach co o modelu.
Czy współczesne modele zdały test Turinga
Tak – w kontrolowanym, trzystronnym teście, i to z wynikiem lepszym niż człowiek. To najmocniejszy dostępny dziś dowód i warto znać jego dokładny kształt, bo nagłówki prasowe zwykle go zniekształcają.
Cameron R. Jones i Benjamin K. Bergen z Uniwersytetu Kalifornijskiego w San Diego przeprowadzili dwa randomizowane i kontrolowane testy Turinga na niezależnych populacjach, zarejestrowane przed rozpoczęciem badania. Uczestnik prowadził pięciominutową rozmowę równocześnie z człowiekiem i z systemem, po czym wskazywał, który rozmówca był człowiekiem. Badanie ukazało się najpierw jako preprint, a następnie w recenzowanym „Proceedings of the National Academy of Sciences” pod tytułem mówiącym wprost: duże modele językowe przechodzą standardowy trzystronny test Turinga.
Wyniki dla poszczególnych systemów:
| System | Odsetek wskazań „to człowiek” | Co to znaczy |
|---|---|---|
| GPT-4.5 z poleceniem przyjęcia osobowości | 73% | wskazywany jako człowiek istotnie częściej niż prawdziwy człowiek |
| LLaMa-3.1-405B z tym samym poleceniem | 56% | wynik nieodróżnialny statystycznie od człowieka |
| Te same dwa modele bez polecenia osobowości | 36% i 38% | wyraźny spadek, bez przewagi nad punktem odniesienia |
| GPT-4o jako punkt odniesienia | 21% | wyraźnie poniżej przypadku |
| ELIZA, program Josepha Weizenbauma z 1966 roku | 23% | wyraźnie poniżej przypadku |
Trzy rzeczy w tej tabeli są ważniejsze niż sama liczba 73%.
Po pierwsze, polecenie przyjęcia osobowości było warunkiem. Te same dwa modele, pytane bez takiego polecenia, spadły do 36% i 38% – czyli poniżej progu nieodróżnialności i bez przewagi nad prostymi punktami odniesienia. Wynik nie jest więc własnością modelu, tylko sposobu, w jaki go poprowadzono.
Po drugie, ELIZA wypadła lepiej niż GPT-4o. Program, który Joseph Weizenbaum opisał w „Communications of the ACM” w styczniu 1966 roku i który odpowiada wyłącznie przez dopasowanie słów kluczowych do gotowych reguł przekształcania zdań, oszukał sędziów częściej niż nowoczesny model bez odpowiedniego polecenia. Miejsce ELIZY w historii sztucznej inteligencji jest zresztą osobnym tematem. To najlepszy dowód na to, że test mierzy sposób prowadzenia rozmowy, a nie zdolności poznawcze.
Po trzecie, 73% to nie jest „tyle procent ludzkości model oszukał”. To odsetek sytuacji, w których sędzia postawił na model zamiast na człowieka. Przekroczenie 50% oznacza, że model wypadał bardziej po ludzku niż człowiek – i to jest naprawdę zaskakująca część wyniku, nie sama liczba.
Autorzy sprawdzili też najbardziej oczywisty zarzut wobec tego układu: że pięć minut to za mało. W trzecim badaniu powtórzyli próbę na rozmowach piętnastominutowych i dwa modele z poleceniem osobowości osiągnęły 56% i 59%. Wydłużenie rozmowy trzykrotnie nie przywróciło sędziom przewagi.
Test Turinga a maszyna Turinga – to nie to samo
Te dwa pojęcia łączy tylko nazwisko. Pomyłka jest na tyle częsta, że pojawia się wśród pytań zadawanych w wyszukiwarce, więc warto ją rozstrzygnąć w jednym akapicie.
| Test Turinga | Maszyna Turinga | |
|---|---|---|
| Czym jest | procedurą oceny rozmowy | abstrakcyjnym modelem obliczeń |
| Po co powstała | żeby zastąpić pytanie o myślenie maszyn | żeby zdefiniować, co w ogóle jest obliczalne |
| Gdzie żyje dziś | w dyskusji o AI i w popkulturze | w podstawach informatyki teoretycznej |
| Czy da się „zdać” | tak, to wynik empiryczny | pytanie bez sensu – to nie jest test |
Maszyna Turinga to model teoretyczny z nieskończoną taśmą i głowicą zapisującą symbole, służący do rozstrzygania, które problemy da się obliczyć. Z testem Turinga nie ma wspólnego mechanizmu.
Czym dziś mierzy się zdolności modeli
Branża odeszła od testu Turinga, bo mierzy on udawanie, a nie użyteczność. Model, który ma pomagać w pracy, nie musi udawać człowieka – ma rozwiązywać zadania, i to sprawdzalnie.
Dzisiejsza ocena modeli opiera się na innych podejściach:
- Zestawy zadań z jednoznaczną odpowiedzią – egzaminy, zadania matematyczne, problemy programistyczne. Najczęściej przywoływany jest MMLU, obejmujący pytania zamknięte z 57 dziedzin, od matematyki elementarnej po prawo. Zaleta: wynik da się policzyć. Wada: zadania wyciekają do danych treningowych i przestają mierzyć zdolność, a zaczynają mierzyć pamięć.
- Porównania w ślepych pojedynkach – dwa modele odpowiadają na to samo pytanie, człowiek wybiera lepszą odpowiedź, z czego powstaje ranking. Tak działa LMArena: w trybie pojedynku dostajesz dwie anonimowe odpowiedzi, a twój głos zasila publiczną tabelę wyników. Zaleta: mierzy realną preferencję. Wada: nagradza odpowiedzi, które się podobają, niekoniecznie prawdziwe – a płynna nieprawda to dokładnie mechanizm halucynacji AI.
- Zadania osadzone w narzędziach – czy model doprowadzi zadanie do końca, korzystając z przeglądarki, plików albo kodu. To najbliżej realnej pracy i dlatego ten kierunek dziś dominuje.
Żaden z tych sposobów nie pyta, czy model uchodzi za człowieka. Pytają, czy działa. Jeśli chcesz zobaczyć, jak ta zmiana wygląda w praktyce na konkretnych modelach, opisuje ją porównanie największych modeli AI, a pojęcia z tej dziedziny zbiera słownik AI i LLM. Pytanie, co właściwie miałaby znaczyć inteligencja „ogólna” – i dlaczego każde laboratorium mierzy ją inaczej – rozkłada osobny tekst o AGI.
Test Turinga zostaje jako pytanie kulturowe, nie inżynieryjne. I w tej roli jest dziś ciekawszy niż kiedykolwiek: skoro maszyna potrafi uchodzić za człowieka także w rozmowie trwającej kwadrans, problem przestaje być techniczny, a staje się kwestią tego, czy wiemy, z kim rozmawiamy.
Najczęstsze pytania
Sędzia prowadzi tekstową rozmowę równocześnie z człowiekiem i z maszyną, a następnie wskazuje, który rozmówca był człowiekiem. Jeśli myli się równie często, jak przy dwóch ludziach, maszyna test przechodzi. Kanał jest wyłącznie tekstowy, żeby oceniać treść rozmowy, a nie głos czy wygląd.
W badaniu Jonesa i Bergena model GPT-4.5 z poleceniem przyjęcia ludzkiej osobowości był wskazywany jako człowiek w 73% rozmów, czyli częściej niż prawdziwy uczestnik. GPT-4o bez takiego polecenia osiągnął 21%, więc wynik zależy od sposobu prowadzenia modelu, nie tylko od samego modelu.
Tak, w kontrolowanym trzystronnym teście opisanym w recenzowanej publikacji. Nie oznacza to jednak, że model rozumie rozmowę – test bada nieodróżnialność zachowania, a nie stan wewnętrzny systemu. Argument chińskiego pokoju Searle’a dotyczy dokładnie tej różnicy.
To abstrakcyjny model obliczeń z taśmą i głowicą zapisującą symbole, używany do określania, które problemy są obliczalne. Z testem Turinga łączy go tylko nazwisko autora – maszyna Turinga należy do podstaw informatyki teoretycznej, a nie do oceny sztucznej inteligencji.
Źródła
- Computing Machinery and Intelligence, A. M. Turing, Mind, New Series, vol. LIX, nr 236, s. 433-460, październik 1950 – dostęp 21.09.2026
- Large language models pass a standard three-party Turing test, Cameron R. Jones, Benjamin K. Bergen, Proceedings of the National Academy of Sciences, t. 123, nr 21, e2524472123 – dostęp 21.09.2026
- Large Language Models Pass the Turing Test – preprint tego samego badania, Cameron R. Jones, Benjamin K. Bergen, arXiv, 31.03.2025 – dostęp 21.09.2026
- Minds, brains, and programs, John R. Searle, Behavioral and Brain Sciences, t. 3, nr 3, s. 417-424, 1980 – dostęp 21.09.2026
Ostatnia aktualizacja: · Zgłoś poprawkę








