Sieć neuronowa: co dzieje się w środku
Wstęp do działu
Do tej pory mówiliśmy o sieciach neuronowych z zewnątrz: że powstały z inspiracji mózgiem (Dział 8), że uczą się z danych (Dział 9), że jeden Perceptron nie poradził sobie z prostą funkcją logiczną i pociągnął całą dziedzinę na kilkanaście lat w dół (Jednostka 8.4). Teraz otwieramy pudełko.
Ten dział jest technicznym sercem książki i jest zbudowany tak, żeby nie było w nim ani jednego miejsca, w którym trzeba coś przyjąć na wiarę. Zaczniemy od jednego sztucznego neuronu — i okaże się, że to obiekt zaskakująco prosty: mnoży kilka liczb, dodaje je i sprawdza, czy suma przekroczyła pewien poziom. Nic więcej. Potem połączymy neurony w warstwy i odpowiemy na pytanie, które w tym miejscu jest najważniejsze w całym uczeniu głębokim: dlaczego bez funkcji aktywacji sto warstw jest dokładnie tak samo mądre jak jedna. Następnie przepuścimy przez gotową, nauczoną sieć konkretny obrazek z odręcznie napisaną cyfrą i policzymy, co się z nim dzieje po drodze. Na koniec zapytamy o rzecz najciekawszą: co właściwie sieć w środku wykrywa i dlaczego mówimy, że sama „wymyśla" cechy, których nikt jej nie podał.
Jedna rzecz musi być jasna od początku i będziemy ją powtarzać: w tym dziale sieć jest już nauczona. Wagi są ustawione, my tylko patrzymy, jak liczby płyną od wejścia do wyjścia. Skąd wzięły się te wagi — to Dział 11, i dopiero tam wróci brakujący element, którego nieobecność w 1969 roku zablokowała rozwój sieci.
Mapa pojęć działu
SZTUCZNY NEURON (10.1)
wejścia → wagi → suma → aktywacja → wyjście
s₁..sₙ w₁..wₙ +b f()
|
v
WARSTWY (10.2)
wejściowa → ukryte (wiele) → wyjściowa
| | |
784 16 · 16 10
piksele cechy pośrednie cyfry 0-9
|
v
PRZEPŁYW W PRZÓD (10.3)
obrazek → liczby → warstwy → 10 pewności → decyzja
|
v
REPREZENTACJE (10.4)
krawędzie → kształty → części → obiekt
(im głębiej, tym bardziej abstrakcyjnie)
BEZ FUNKCJI AKTYWACJI: 100 warstw ≡ 1 warstwa
(sedno Jednostki 10.2)
Jednostki w tym dziale
- 10.1 Sztuczny neuron: wejścia, wagi, suma ważona, próg
- 10.2 Warstwy i funkcje aktywacji
- 10.3 Sieć w akcji: przykład działania sieci już nauczonej
- 10.4 Co sieć „widzi": reprezentacje w kolejnych warstwach