*Perceptrons* (Minsky i Papert, 1969): krytyka i zamrożenie badań

🎯 Po co Ci to?

Perceptron obiecywał maszynę, która sama uczy się rozpoznawać wzorce. Media pisały o świadomych robotach. A jedenaście lat później dwóch matematyków usiadło i policzyło, dokładnie, co Perceptron może, a czego nie może obliczyć w zasadzie — niezależnie od tego, jak długo by go trenować. Wynik tych obliczeń okazał się na tyle druzgocący, że zamroził finansowanie sieci neuronowych na kolejną dekadę i pół. To jedna z najważniejszych lekcji w historii AI: matematyczny dowód potrafi zatrzymać cały nurt badań skuteczniej niż jakakolwiek krytyka publicystyczna.

✅ Czego się nauczysz

Po tej lekcji potrafisz:

  • wyjaśnić, na czym polegało matematyczne ograniczenie pojedynczej warstwy Perceptronu (problem XOR);
  • wskazać autorów i rok publikacji książki Perceptrons oraz jej wpływ na finansowanie badań;
  • odróżnić realne ograniczenie matematyczne od jego (czasem przesadzonej) medialnej i finansowej interpretacji;
  • umiejscowić ten kryzys na osi czasu całej „nogi neuronowej" AI.

🔁 Przypomnij sobie

W jednostce 8.3 poznałeś Perceptron Rosenblatta — sztuczny neuron, który uczy się korygować swoje wagi na podstawie błędów, i medialny entuzjazm, jaki wywołał w 1958 roku. Zapamiętaj to napięcie między obietnicą a realnymi możliwościami — będzie kluczowe w tej jednostce.

📘 Ograniczenie matematyczne — dlaczego pojedynczy Perceptron nie poradzi sobie z XOR

W 1969 roku Marvin Minsky (ten sam, który osiemnaście lat wcześniej współtworzył SNARC — pierwszą samouczącą się maszynę!) i Seymour Papert opublikowali książkę Perceptrons, w której matematycznie dowiedli, że pojedyncza warstwa Perceptronu — a więc dokładnie ten typ sieci, który Rosenblatt zbudował i spopularyzował — ma fundamentalne ograniczenie: potrafi nauczyć się rozróżniać tylko takie kategorie danych, które da się rozdzielić prostą linią (lub, w więcej wymiarach, płaszczyzną). Matematycy nazywają to „separowalnością liniową".

Najsłynniejszym przykładem funkcji, której pojedynczy Perceptron nigdy nie nauczy się poprawnie obliczyć, jest prosta operacja logiczna XOR („dokładnie jedno z dwóch, ale nie oba") — funkcja, którą łatwo zapisać w tabeli prawdy, ale niemożliwa do „rozcięcia" jedną linią prostą na wykresie.

💭 Pomyśl: Wyobraź sobie wykres z czterema punktami: (0,0) i (1,1) oznaczone jako „NIE" (wynik XOR = 0), a (0,1) i (1,0) oznaczone jako „TAK" (wynik XOR = 1). Spróbuj (na kartce albo w wyobraźni) narysować jedną prostą linię, która oddzieli oba punkty „TAK" od obu punktów „NIE". Czy Ci się to udaje?

Sprawdź odpowiedź

Nie — i to nie jest kwestia braku wprawy w rysowaniu, lecz matematyczna niemożliwość. Punkty (0,0) i (1,1) leżą po przeciwnych rogach kwadratu, podobnie punkty (0,1) i (1,0) — a te dwie pary są ułożone „na krzyż". Żadna pojedyncza prosta linia nie potrafi oddzielić jednej pary punktów od drugiej, bo są one wymieszane geometrycznie. Ponieważ pojedynczy Perceptron matematycznie odpowiada właśnie dokładnie takiej linii (a ściślej: hiperpłaszczyźnie rozcinającej przestrzeń danych na dwie części), z góry wiadomo, że nie da się go tak wytrenować, żeby poprawnie obliczał XOR — bez względu na to, jak długo i jak cierpliwie próbowałby się uczyć.

📐 DEFINICJA — separowalność liniowa (i jej brak w XOR): własność zbioru danych polegająca na tym, że da się go podzielić na dwie kategorie za pomocą pojedynczej linii prostej (lub płaszczyzny w większej liczbie wymiarów). Pojedynczy Perceptron potrafi nauczyć się rozróżniać tylko dane liniowo separowalne — funkcja XOR jest klasycznym przykładem danych, które taką własność łamią.

Po ludzku: jeśli dwie kategorie danych są ze sobą „splątane" tak, że nie da się ich rozdzielić jednym prostym cięciem — pojedynczy Perceptron zawsze będzie się mylić na części z nich, niezależnie od treningu. Czym to NIE jest: to NIE jest dowód, że żadna sieć neuronowa nie potrafi obliczyć XOR — chodzi wyłącznie o Perceptron jednowarstwowy. Sam Minsky i Papert wiedzieli, że sieć z dodatkową, „ukrytą" warstwą neuronów matematycznie mogłaby sobie z tym poradzić — problemem był brak znanej wtedy metody, jak taką wielowarstwową sieć skutecznie wytrenować.

📘 Skutek: zamrożenie finansowania

Sam dowód matematyczny to jedno. To, co uczyniło książkę Perceptrons punktem zwrotnym w historii AI, to jej odbiór. Minsky był wpływową postacią (współzałożyciel laboratorium AI na MIT), a książka została odczytana — czy słusznie, czy zbyt szeroko — jako dowód, że cała droga sieci neuronowych jest ślepym zaułkiem. Agencje finansujące badania (w tym DARPA w Stanach Zjednoczonych) w kolejnych latach drastycznie ograniczyły środki na badania nad sieciami neuronowymi. Rok 1969 rozpoczął okres, który historycy nazywają zimą sieci neuronowych — trwającą, z niewielkimi wyjątkami, aż do połowy lat 80.

💭 Pomyśl: Minsky i Papert udowodnili ograniczenie konkretnego, jednowarstwowego modelu. A jednak decyzje o finansowaniu dotknęły całej dziedziny sieci neuronowych, łącznie z modelami wielowarstwowymi, które teoretycznie mogłyby to ograniczenie ominąć. Dlaczego tak się stało?

Sprawdź odpowiedź

Kilka czynników złożyło się na tak szeroki odbiór wąskiego wyniku. Po pierwsze, w 1969 roku nikt nie znał jeszcze praktycznej metody trenowania sieci wielowarstwowych — więc argument „warstwa ukryta rozwiąże problem" był w tamtym momencie czysto teoretyczny, bez działającego algorytmu (dopiero propagacja wsteczna z Działu 11 to zmieni). Po drugie, autorytet Minsky'ego sprawił, że jego opinia o „ślepym zaułku" ważyła bardzo dużo w oczach decydentów rozdzielających pieniądze — nawet jeśli sam dowód matematyczny był węższy niż jego interpretacja. Po trzecie: gdy budżety są ograniczone, prostsza (choć niekoniecznie w pełni uzasadniona) narracja „to się nie uda" łatwo wygrywa z bardziej niuansowanym „to się nie uda w tej konkretnej wersji, ale może się udać w innej". To ważna lekcja o tym, jak nauka, polityka finansowania i medialny odbiór wzajemnie na siebie wpływają.

⚠️ Uwaga, pułapka

To najważniejsza pułapka tej jednostki, więc podkreślmy ją mocno: Minsky i Papert nie udowodnili, że sieci neuronowe „nie działają". Udowodnili konkretne, matematyczne ograniczenie konkretnego, jednowarstwowego modelu z 1958 roku. Sieć z dodatkową warstwą neuronów „w środku" (dziś nazywaną warstwą ukrytą) teoretycznie mogłaby obliczyć XOR bez trudu — brakowało tylko praktycznej metody, jak taką wielowarstwową sieć wytrenować. Ta metoda pojawi się siedemnaście lat później, w postaci propagacji wstecznej (Dział 11), i dopiero wtedy druga „noga" AI naprawdę wybudzi się z zimowego snu. Traktowanie tej jednostki jako „koniec historii sieci neuronowych" byłoby błędem — to raczej przerwa w opowieści, nie jej zakończenie.

🌍 Powiązania

Warto zauważyć zbieżność w czasie: zima sieci neuronowych zaczyna się niemal równolegle z „pierwszą zimą AI" opisaną wcześniej (raport Lighthilla z 1973 roku, Dział 7) — ale to dwa osobne kryzysy, dotyczące dwóch różnych nóg AI z zupełnie różnych powodów: raport Lighthilla krytykował systemy symboliczne za brak praktycznych zastosowań, a krytyka Minsky'ego i Paperta dotyczyła konkretnego matematycznego ograniczenia sieci neuronowych. To, że oba nurty ucichły w podobnym okresie, jest historycznym zbiegiem okoliczności, wynikającym częściowo ze wspólnego źródła finansowania (te same agencje rządowe finansowały obie nogi AI) — nie jednej, wspólnej przyczyny.

📐 Definicje tej lekcji

  • Separowalność liniowa — możliwość rozdzielenia dwóch kategorii danych pojedynczą prostą linią (lub płaszczyzną); Perceptron jednowarstwowy potrafi nauczyć się rozróżniać tylko dane o tej własności.
  • XOR — funkcja logiczna, której dane nie są liniowo separowalne; klasyczny przykład ograniczenia pojedynczego Perceptronu.
  • Zima sieci neuronowych — okres (od ok. 1969 do połowy lat 80.) drastycznie ograniczonego finansowania i zainteresowania badaniami nad sztucznymi sieciami neuronowymi, zapoczątkowany krytyką Minsky'ego i Paperta.

📌 Najważniejsze w pigułce

  • Minsky i Papert (1969, książka Perceptrons) matematycznie udowodnili, że pojedynczy Perceptron nie potrafi nauczyć się funkcji nieseparowalnych liniowo (np. XOR).
  • Dowód dotyczył wyłącznie modelu jednowarstwowego — sieci z warstwą ukrytą teoretycznie mogłyby ominąć to ograniczenie.
  • Odbiór książki był szerszy niż jej właściwa treść: finansowanie całej dziedziny sieci neuronowych zostało drastycznie ograniczone na kilkanaście lat.
  • To osobny kryzys od „pierwszej zimy AI" (raport Lighthilla, Dział 7), choć oba wydarzyły się w podobnym czasie.

🎒 Zadania

Zadanie 8.4.1. Wyjaśnij własnymi słowami, dlaczego dane opisujące funkcję XOR nie są liniowo separowalne, odwołując się do rozmieszczenia punktów (0,0), (0,1), (1,0), (1,1) na wykresie.

Pokaż rozwiązanie

Punkty należące do jednej kategorii wyniku XOR (0,0) i (1,1) leżą po przeciwnych rogach kwadratu jednostkowego, a punkty drugiej kategorii (0,1) i (1,0) leżą po pozostałych dwóch, również przeciwległych rogach. Te dwie pary są ułożone „na krzyż" — nie da się poprowadzić żadnej prostej linii, która oddzieli jedną parę od drugiej, bo są one geometrycznie przemieszane, a nie zgrupowane po dwóch stronach jakiejś granicy. Stąd: brak separowalności liniowej.

Zadanie 8.4.2. Minsky w 1951 roku współtworzył SNARC (jednostka 8.3) — jedną z pierwszych samouczących się maszyn — a osiemnaście lat później napisał książkę, która niemal zabiła całą dziedzinę sieci neuronowych. Czy to sprzeczność w jego postawie naukowej? Uzasadnij.

Pokaż rozwiązanie

Niekoniecznie jest to sprzeczność — może to raczej świadczyć o rzetelności naukowej: ktoś, kto sam eksperymentował z daną technologią, jest w stanie precyzyjnie wskazać jej matematyczne ograniczenia, właśnie dlatego, że dobrze rozumie, jak ona działa „od środka". Można argumentować, że Minsky nie „zwrócił się przeciwko" sieciom neuronowym z ideologicznych powodów, lecz opublikował rzetelny dowód matematyczny dotyczący konkretnego modelu. Problemem historycznym nie był sam dowód, lecz to, jak szeroko — i jak długo — jego wnioski zostały uogólnione przez środowisko finansujące badania, wykraczając poza to, co dowód faktycznie stwierdzał.

Zadanie 8.4.3. (analityczne) Porównaj skutek krytyki matematycznej Minsky'ego i Paperta (ta jednostka) z sytuacją opisaną wcześniej w Dziale 5 — twierdzeniem Gödla i problemem stopu Turinga, które wykazały fundamentalne ograniczenia systemów formalnych. Co łączy, a co różni te dwie sytuacje w historii nauki?

Pokaż rozwiązanie

Podobieństwo: w obu przypadkach ścisły dowód matematyczny wykazał fundamentalne, nieusuwalne ograniczenie pewnego systemu formalnego (odpowiednio: systemu aksjomatycznego u Gödla, maszyny obliczeniowej u Turinga, jednowarstwowego Perceptronu u Minsky'ego i Paperta) — nie chodziło o brak sprzętu czy czasu, lecz o granicę wynikającą z samej struktury problemu. Różnica: twierdzenia Gödla i Turinga dotyczą granic w zasadzie nieprzekraczalnych dla każdego systemu formalnego danego typu — to fundamentalne, ostateczne ograniczenia. Ograniczenie Minsky'ego i Paperta dotyczyło tylko jednej, konkretnej architektury (Perceptron jednowarstwowy) — i, jak się okazało w Dziale 11, dało się je ominąć zupełnie innym środkiem (dodaniem warstwy ukrytej i propagacją wsteczną), bez łamania żadnego prawa matematyki. Łatwo o pomyłkę: traktowanie ograniczenia architektonicznego (które da się obejść lepszą architekturą) jako ograniczenia fundamentalnego (którego obejść się nie da w zasadzie).

🔍 Sprawdź, czy umiesz

  • [ ] Wyjaśnić, na czym polegało matematyczne ograniczenie jednowarstwowego Perceptronu (problem XOR i separowalność liniowa).
  • [ ] Wskazać, kto i kiedy opublikował krytykę oraz jaki miała skutek dla finansowania badań.
  • [ ] Odróżnić realne, wąskie ograniczenie matematyczne od jego szerszej, medialno-finansowej interpretacji.
  • [ ] Wyjaśnić, dlaczego ten kryzys jest „przerwą w opowieści", a nie jej końcem.

Ucz się tej jednostki z asystentem