Test Turinga - dwie zasłonięte kabiny i stanowisko sędziego z włączonym monitorem i pustym krzesłem

Test Turinga – na czym polega i czy sztuczna inteligencja go zdała

Test Turinga sprawdza jedną rzecz: czy w rozmowie da się odróżnić maszynę od człowieka. Nie mierzy inteligencji, rozumienia ani świadomości – mierzy nieodróżnialność. W kontrolowanym badaniu opublikowanym w „Proceedings of the National Academy of Sciences” GPT-4.5 z poleceniem przyjęcia ludzkiej osobowości był wskazywany jako człowiek w 73% rozmów, czyli częściej niż prawdziwy człowiek siedzący po drugiej stronie.

Ten tekst tłumaczy, jak test wygląda w oryginale Turinga, co dokładnie pokazały badania na współczesnych modelach i dlaczego branża od tego testu odeszła, choć nazwa została.

Na czym polega test Turinga

Alan Turing zaproponował test w 1950 roku jako zamiennik pytania „czy maszyny mogą myśleć”, które uznał za zbyt nieostre, żeby dało się na nie odpowiedzieć. Zamiast definiować myślenie, zaproponował grę.

W oryginalnym układzie, który Turing nazwał grą w naśladownictwo, biorą udział trzy osoby: przesłuchujący, mężczyzna i kobieta. Przesłuchujący siedzi w osobnym pokoju i przez wymianę pisanych wiadomości ma ustalić, kto jest kim. Turing zadał wtedy pytanie, które jest sednem całej propozycji: co się stanie, jeśli w tej grze rolę jednego z uczestników przejmie maszyna? Czy przesłuchujący będzie mylił się równie często?

Trzy elementy tego układu decydują o wszystkim:

  1. Kanał jest tekstowy. Turing celowo odciął głos i wygląd, żeby oceniać wyłącznie treść rozmowy.
  2. Uczestników jest trzech, nie dwóch. Sędzia rozmawia równocześnie z maszyną i z człowiekiem, i wybiera między nimi. To jest istotne, bo podnosi poprzeczkę: nie wystarczy wypaść wiarygodnie, trzeba wypaść wiarygodniej od żywego rozmówcy.
  3. Kryterium jest statystyczne. Liczy się, jak często sędzia się myli, a nie czy pojedyncza rozmowa kogoś zwiodła.

Popularna wersja testu, powtarzana w mediach – „komputer rozmawia z człowiekiem, a ten zgaduje” – gubi punkt drugi. A to właśnie on odróżnia rzetelne badanie od efektownej demonstracji.

Czego test Turinga nie mierzy

Zdanie testu dowodzi, że system potrafi naśladować ludzką rozmowę. Nie dowodzi, że rozumie, o czym mówi. To rozróżnienie ma swoją klasyczną postać w filozofii umysłu.

John Searle opisał w 1980 roku eksperyment myślowy zwany chińskim pokojem. Człowiek zamknięty w pokoju dostaje kartki ze znakami chińskimi i księgę reguł w swoim języku, która mówi, jakimi znakami odpowiadać na jakie znaki. Odpowiedzi wychodzące z pokoju są poprawne, więc z zewnątrz wygląda to na znajomość chińskiego. Człowiek w środku nie rozumie ani słowa. Searle wyprowadził z tego wniosek, że manipulowanie symbolami według reguł nie wystarcza, by mówić o rozumieniu.

Zastosowany do testu Turinga argument brzmi: system może przejść test i nadal być chińskim pokojem. Test bada zachowanie, nie stan wewnętrzny.

Druga słabość jest bardziej praktyczna. Test mierzy nie tylko zdolności maszyny, ale też czujność i uprzedzenia sędziego. Człowiek przekonany, że maszyna nie może popełniać literówek, wskaże jako maszynę tego rozmówcę, który pisze zbyt poprawnie. W efekcie wynik mówi tyle samo o ludzkich założeniach co o modelu.

Czy współczesne modele zdały test Turinga

Tak – w kontrolowanym, trzystronnym teście, i to z wynikiem lepszym niż człowiek. To najmocniejszy dostępny dziś dowód i warto znać jego dokładny kształt, bo nagłówki prasowe zwykle go zniekształcają.

Cameron R. Jones i Benjamin K. Bergen z Uniwersytetu Kalifornijskiego w San Diego przeprowadzili dwa randomizowane i kontrolowane testy Turinga na niezależnych populacjach, zarejestrowane przed rozpoczęciem badania. Uczestnik prowadził pięciominutową rozmowę równocześnie z człowiekiem i z systemem, po czym wskazywał, który rozmówca był człowiekiem. Badanie ukazało się najpierw jako preprint, a następnie w recenzowanym „Proceedings of the National Academy of Sciences” pod tytułem mówiącym wprost: duże modele językowe przechodzą standardowy trzystronny test Turinga.

Wyniki dla poszczególnych systemów:

SystemOdsetek wskazań „to człowiek”Co to znaczy
GPT-4.5 z poleceniem przyjęcia osobowości73%wskazywany jako człowiek istotnie częściej niż prawdziwy człowiek
LLaMa-3.1-405B z tym samym poleceniem56%wynik nieodróżnialny statystycznie od człowieka
Te same dwa modele bez polecenia osobowości36% i 38%wyraźny spadek, bez przewagi nad punktem odniesienia
GPT-4o jako punkt odniesienia21%wyraźnie poniżej przypadku
ELIZA, program Josepha Weizenbauma z 1966 roku23%wyraźnie poniżej przypadku

Trzy rzeczy w tej tabeli są ważniejsze niż sama liczba 73%.

Po pierwsze, polecenie przyjęcia osobowości było warunkiem. Te same dwa modele, pytane bez takiego polecenia, spadły do 36% i 38% – czyli poniżej progu nieodróżnialności i bez przewagi nad prostymi punktami odniesienia. Wynik nie jest więc własnością modelu, tylko sposobu, w jaki go poprowadzono.

Po drugie, ELIZA wypadła lepiej niż GPT-4o. Program, który Joseph Weizenbaum opisał w „Communications of the ACM” w styczniu 1966 roku i który odpowiada wyłącznie przez dopasowanie słów kluczowych do gotowych reguł przekształcania zdań, oszukał sędziów częściej niż nowoczesny model bez odpowiedniego polecenia. Miejsce ELIZY w historii sztucznej inteligencji jest zresztą osobnym tematem. To najlepszy dowód na to, że test mierzy sposób prowadzenia rozmowy, a nie zdolności poznawcze.

Po trzecie, 73% to nie jest „tyle procent ludzkości model oszukał”. To odsetek sytuacji, w których sędzia postawił na model zamiast na człowieka. Przekroczenie 50% oznacza, że model wypadał bardziej po ludzku niż człowiek – i to jest naprawdę zaskakująca część wyniku, nie sama liczba.

Autorzy sprawdzili też najbardziej oczywisty zarzut wobec tego układu: że pięć minut to za mało. W trzecim badaniu powtórzyli próbę na rozmowach piętnastominutowych i dwa modele z poleceniem osobowości osiągnęły 56% i 59%. Wydłużenie rozmowy trzykrotnie nie przywróciło sędziom przewagi.

Test Turinga a maszyna Turinga – to nie to samo

Te dwa pojęcia łączy tylko nazwisko. Pomyłka jest na tyle częsta, że pojawia się wśród pytań zadawanych w wyszukiwarce, więc warto ją rozstrzygnąć w jednym akapicie.

Test TuringaMaszyna Turinga
Czym jestprocedurą oceny rozmowyabstrakcyjnym modelem obliczeń
Po co powstałażeby zastąpić pytanie o myślenie maszynżeby zdefiniować, co w ogóle jest obliczalne
Gdzie żyje dziśw dyskusji o AI i w popkulturzew podstawach informatyki teoretycznej
Czy da się „zdać”tak, to wynik empirycznypytanie bez sensu – to nie jest test

Maszyna Turinga to model teoretyczny z nieskończoną taśmą i głowicą zapisującą symbole, służący do rozstrzygania, które problemy da się obliczyć. Z testem Turinga nie ma wspólnego mechanizmu.

Czym dziś mierzy się zdolności modeli

Branża odeszła od testu Turinga, bo mierzy on udawanie, a nie użyteczność. Model, który ma pomagać w pracy, nie musi udawać człowieka – ma rozwiązywać zadania, i to sprawdzalnie.

Dzisiejsza ocena modeli opiera się na innych podejściach:

  • Zestawy zadań z jednoznaczną odpowiedzią – egzaminy, zadania matematyczne, problemy programistyczne. Najczęściej przywoływany jest MMLU, obejmujący pytania zamknięte z 57 dziedzin, od matematyki elementarnej po prawo. Zaleta: wynik da się policzyć. Wada: zadania wyciekają do danych treningowych i przestają mierzyć zdolność, a zaczynają mierzyć pamięć.
  • Porównania w ślepych pojedynkach – dwa modele odpowiadają na to samo pytanie, człowiek wybiera lepszą odpowiedź, z czego powstaje ranking. Tak działa LMArena: w trybie pojedynku dostajesz dwie anonimowe odpowiedzi, a twój głos zasila publiczną tabelę wyników. Zaleta: mierzy realną preferencję. Wada: nagradza odpowiedzi, które się podobają, niekoniecznie prawdziwe – a płynna nieprawda to dokładnie mechanizm halucynacji AI.
  • Zadania osadzone w narzędziach – czy model doprowadzi zadanie do końca, korzystając z przeglądarki, plików albo kodu. To najbliżej realnej pracy i dlatego ten kierunek dziś dominuje.

Żaden z tych sposobów nie pyta, czy model uchodzi za człowieka. Pytają, czy działa. Jeśli chcesz zobaczyć, jak ta zmiana wygląda w praktyce na konkretnych modelach, opisuje ją porównanie największych modeli AI, a pojęcia z tej dziedziny zbiera słownik AI i LLM. Pytanie, co właściwie miałaby znaczyć inteligencja „ogólna” – i dlaczego każde laboratorium mierzy ją inaczej – rozkłada osobny tekst o AGI.

Test Turinga zostaje jako pytanie kulturowe, nie inżynieryjne. I w tej roli jest dziś ciekawszy niż kiedykolwiek: skoro maszyna potrafi uchodzić za człowieka także w rozmowie trwającej kwadrans, problem przestaje być techniczny, a staje się kwestią tego, czy wiemy, z kim rozmawiamy.

Najczęstsze pytania

Na czym polega test Turinga?

Sędzia prowadzi tekstową rozmowę równocześnie z człowiekiem i z maszyną, a następnie wskazuje, który rozmówca był człowiekiem. Jeśli myli się równie często, jak przy dwóch ludziach, maszyna test przechodzi. Kanał jest wyłącznie tekstowy, żeby oceniać treść rozmowy, a nie głos czy wygląd.

Czy ChatGPT zdał test Turinga?

W badaniu Jonesa i Bergena model GPT-4.5 z poleceniem przyjęcia ludzkiej osobowości był wskazywany jako człowiek w 73% rozmów, czyli częściej niż prawdziwy uczestnik. GPT-4o bez takiego polecenia osiągnął 21%, więc wynik zależy od sposobu prowadzenia modelu, nie tylko od samego modelu.

Czy AI przeszło test Turinga?

Tak, w kontrolowanym trzystronnym teście opisanym w recenzowanej publikacji. Nie oznacza to jednak, że model rozumie rozmowę – test bada nieodróżnialność zachowania, a nie stan wewnętrzny systemu. Argument chińskiego pokoju Searle’a dotyczy dokładnie tej różnicy.

Na czym polega maszyna Turinga?

To abstrakcyjny model obliczeń z taśmą i głowicą zapisującą symbole, używany do określania, które problemy są obliczalne. Z testem Turinga łączy go tylko nazwisko autora – maszyna Turinga należy do podstaw informatyki teoretycznej, a nie do oceny sztucznej inteligencji.

Źródła

Ostatnia aktualizacja: · Zgłoś poprawkę

Podobne wpisy