Historia sztucznej inteligencji - cztery stosy raportów w różnym wieku na półce archiwum pod żarówką

Historia sztucznej inteligencji – kto ją wymyślił i jak doszliśmy do dziś

Historia sztucznej inteligencji nie jest prostą drogą w górę. To trzy fale nadziei przedzielone dwiema zimami AI – okresami, w których pieniądze na badania wyschły, bo obietnice okazały się na wyrost. Kto zna ten rytm, inaczej czyta dzisiejsze zapowiedzi przełomu.

Termin „sztuczna inteligencja” ma konkretnego autora i konkretną datę. Poniżej oś czasu prowadzona przez jedno pytanie: co obiecywano i co z tego wyszło.

Dartmouth 1956 – narodziny terminu

Pojęcie sztucznej inteligencji powstało w treści wniosku o grant. Nazwę zaproponował John McCarthy, a wniosek z 31 sierpnia 1955 roku podpisali razem z nim Marvin Minsky, Nathaniel Rochester i Claude Shannon. Czwórka wystąpiła o dwumiesięczne, dziesięcioosobowe badania nad sztuczną inteligencją, które miały się odbyć latem następnego roku w Dartmouth College.

Wniosek zawierał zdanie, które ustawiło całą dziedzinę na dekady: autorzy zakładali, że każdy aspekt uczenia się i każda cecha inteligencji dadzą się opisać na tyle precyzyjnie, by maszyna mogła je symulować. To nie była ostrożna hipoteza, tylko program badawczy.

Warsztat odbył się latem 1956 roku i trwał osiem tygodni. Nie rozwiązał żadnego z postawionych problemów, ale zrobił coś ważniejszego: zebrał ludzi, którzy przez następne dwadzieścia lat tworzyli tę dziedzinę, i dał jej nazwę.

Warto pamiętać, że pytanie było starsze niż termin. Sześć lat wcześniej Alan Turing zaproponował sposób obejścia sporu o myślenie maszyn – opisuje go osobny tekst o teście Turinga.

Pierwsza fala i pierwsza zima

Pierwsza fala ruszyła tuż po warsztacie i przyniosła wyniki, które wyglądały na początek czegoś wielkiego. W lipcu 1958 roku Frank Rosenblatt z Cornell Aeronautical Laboratory pokazał perceptron: po pięćdziesięciu próbach maszyna sama nauczyła się odróżniać karty oznaczone z lewej strony od oznaczonych z prawej. Prasa ogłosiła narodziny maszyny myślącej – „New York Times” pisał o urządzeniu, które uczy się, robiąc. W 1966 roku Joseph Weizenbaum uruchomił w MIT program ELIZA, prowadzący rozmowę w języku naturalnym wyłącznie przez dopasowanie słów kluczowych do gotowych reguł przekształcania zdań. Programy dowodziły twierdzeń matematycznych, rozwiązywały zadania algebraiczne i grały w szachy. Prognozy szły dalej: w ciągu dekady maszyna miała zostać mistrzem świata w szachach i tłumaczyć teksty.

Nic z tego nie wyszło w zapowiadanym czasie. Powody były dwa i oba fundamentalne: moce obliczeniowe były o rzędy wielkości za małe, a metody działające na zabawkowych problemach rozsypywały się przy realnych. Sama obietnica szachowa spełniła się ostatecznie, ale trzy dekady po terminie – w maju 1997 roku Deep Blue firmy IBM jako pierwsza maszyna pokonał urzędującego mistrza świata, Garriego Kasparowa, w meczu rozgrywanym w normalnym tempie turniejowym.

Rozliczenie przyszło wraz z raportem brytyjskiego matematyka Jamesa Lighthilla, który ocenił stan badań nad AI dla Science Research Council. Raport nosi datę lipca 1972 roku, a szerokim echem odbił się po publikacji w 1973. Ocena była miażdżąca – Lighthill pisał wprost o powszechnym poczuciu zawodu wobec dorobku ćwierćwiecza i wskazywał eksplozję kombinatoryczną jako barierę, której ówczesne metody nie przeskakiwały. Skutek był natychmiastowy: finansowanie badań w Wielkiej Brytanii zostało obcięte. Lata siedemdziesiąte przeszły do historii jako pierwsza zima AI.

Systemy eksperckie i druga zima

Druga fala miała inny pomysł: skoro nie da się zbudować ogólnej inteligencji, zbudujmy wąską i sprzedajmy ją firmom. Systemy eksperckie kodowały wiedzę specjalistów w postaci setek reguł „jeżeli, to” i doradzały w konkretnych dziedzinach – diagnostyce, konfiguracji sprzętu, geologii.

To działało na tyle dobrze, że w latach osiemdziesiątych powstał wokół tego prawdziwy rynek – z komputerami budowanymi specjalnie pod te systemy włącznie.

Problem tkwił w samej konstrukcji. Reguły trzeba było wpisywać ręcznie, a system nie uczył się niczego sam. Utrzymanie bazy liczącej tysiące reguł stawało się droższe od korzyści, a każda zmiana w dziedzinie wymagała przepisywania. Pod koniec dekady rynek się załamał i przyszła druga zima AI, głębsza od pierwszej.

Uczenie głębokie odwraca trend

Przełom przyszedł nie z nowej idei, tylko ze starej, której wreszcie starczyło paliwa. Sieci neuronowe znano od dziesięcioleci, ale brakowało dwóch rzeczy: danych i mocy obliczeniowej.

Momentem zwrotnym był rok 2012 i konkurs rozpoznawania obrazów ImageNet. Sieć zbudowana przez Alexa Krizhevsky’ego, Ilyę Sutskevera i Geoffreya Hintona osiągnęła błąd typu top-5 na poziomie 15,3% wobec 26,2% u drugiego zespołu w stawce. Przewaga blisko jedenastu punktów procentowych w konkursie, w którym walczyło się o ułamki, była nie do zignorowania.

Znaczenie tego wyniku nie polegało na samej liczbie. Sieć nie dostała od ludzi żadnych reguł rozpoznawania kotów czy samochodów – wypracowała je sama z przykładów. To odwracało logikę systemów eksperckich: zamiast kodować wiedzę, dostarczało się dane. Jak działa ten mechanizm, wyjaśnia tekst o sieciach neuronowych, a czym uczenie głębokie różni się od klasycznego uczenia maszynowego – tekst o deep learningu.

Transformery i to, co dzieje się teraz

W 2017 roku ośmioosobowy zespół z Google Brain i Google Research opublikował pracę „Attention Is All You Need”, a opisana w niej architektura – transformer – stoi za wszystkim, czego używasz dziś. Jej przewaga polegała na rezygnacji z przetwarzania tekstu po kolei na rzecz mechanizmu uwagi, który patrzy na całą sekwencję naraz – co pozwoliło uczyć modele równolegle, a więc na skalę wcześniej nieosiągalną.

Przez pięć lat była to sprawa badaczy. Zmieniło się to 30 listopada 2022 roku, gdy OpenAI udostępniło ChatGPT i modele językowe trafiły do publicznego użytku w interfejsie czatu – wtedy dziedzina, która dwa razy w historii straciła finansowanie za niespełnione obietnice, stała się tematem rozmów przy stole. Szczegóły architektury rozkłada osobny tekst o transformerach, a polski wątek tej historii – tekst o modelu językowym Bielik.

Czego uczy rytm zim AI

Obie zimy przyszły po okresie, w którym obiecywano więcej, niż dawało się dowieźć – i obie zaczęły się od publicznego rozliczenia obietnic. To jest jedyny powtarzalny wzorzec w tej historii i warto go znać, czytając dzisiejsze zapowiedzi.

Trzy różnice wobec poprzednich fal są jednak realne:

  1. Produkty mają płacących użytkowników. Poprzednie fale finansowały się z grantów i kontraktów wojskowych, nie z rynku konsumenckiego.
  2. Skala jest inna. Systemy z lat osiemdziesiątych obsługiwały działy w firmach, dzisiejsze – setki milionów ludzi.
  3. Postęp jest mierzony publicznie. Wyniki testów i porównania modeli są dostępne od ręki, co utrudnia opieranie się wyłącznie na deklaracjach.

Czy to wystarczy, żeby uniknąć trzeciej zimy, rozstrzygnie się poza tym tekstem. Historia mówi tylko tyle, że każda z poprzednich fal też uważała się za tę, która już nie zawróci.

Najczęstsze pytania

Kto wymyślił sztuczną inteligencję?

Termin ukuł John McCarthy we wniosku z 31 sierpnia 1955 roku o finansowanie warsztatu w Dartmouth College, podpisanym razem z Marvinem Minskym, Nathanielem Rochesterem i Claude’em Shannonem. Sam warsztat odbył się latem 1956 roku i trwał osiem tygodni. Pytanie o myślące maszyny było jednak starsze – Alan Turing postawił je w 1950 roku.

Czym była zima AI?

To okres gwałtownego spadku finansowania badań nad sztuczną inteligencją po fali niespełnionych obietnic. Pierwsza przyszła w latach siedemdziesiątych po krytycznym raporcie Jamesa Lighthilla, datowanym na lipiec 1972 i opublikowanym w 1973 roku, druga pod koniec lat osiemdziesiątych, po załamaniu rynku systemów eksperckich.

Kiedy zaczął się obecny rozwój AI?

Punktem zwrotnym był rok 2012 i wygrana sieci neuronowej w konkursie ImageNet z błędem top-5 na poziomie 15,3% wobec 26,2% u kolejnego zespołu. Drugim przełomem była architektura transformerowa opublikowana przez zespół Google w 2017 roku, a momentem wejścia AI do powszechnego użytku – udostępnienie ChatGPT przez OpenAI 30 listopada 2022 roku.

Dlaczego sieci neuronowe zadziałały dopiero niedawno?

Sama idea była znana od dziesięcioleci, brakowało natomiast dwóch warunków: ogromnych zbiorów danych i mocy obliczeniowej pozwalającej trenować duże modele. Oba pojawiły się dopiero w drugiej dekadzie XXI wieku, wraz z internetowymi zbiorami obrazów i kartami graficznymi używanymi do obliczeń.

Źródła

Ostatnia aktualizacja: · Zgłoś poprawkę

Podobne wpisy