Zamknięcie działu 10
Słowniczek działu
- Sztuczny neuron — jednostka obliczeniowa: wagi, suma ważona, obciążenie, funkcja aktywacji, jedno wyjście.
- Waga — liczba mówiąca, jak mocno i w którą stronę wejście wpływa na aktywację.
- Obciążenie (bias) — liczba dodawana do sumy ważonej; przesuwalny próg aktywacji.
- Suma ważona — suma iloczynów wejść i wag.
- Funkcja aktywacji — nieliniowa funkcja przekształcająca sumę ważoną w wyjście neuronu.
- Parametry sieci — wszystkie wagi i obciążenia; w nich zapisane jest wszystko, czego model się nauczył.
- Warstwa wejściowa / ukryta / wyjściowa — miejsce wprowadzenia danych / warstwa pośrednia / warstwa podająca wynik.
- Warstwa gęsta (w pełni połączona) — każdy neuron połączony z każdym neuronem warstwy poprzedniej.
- Funkcja progowa — aktywacja skokowa: 0 albo 1.
- Sigmoida / tanh — gładkie aktywacje ściskające wynik do (0, 1) / (−1, 1).
- ReLU — aktywacja zerująca wartości ujemne, przepuszczająca dodatnie bez zmian.
- Softmax — przekształcenie wyjść końcowych w rozkład pewności sumujący się do 1.
- Uczenie głębokie — uczenie sieci o wielu warstwach ukrytych.
- Przepływ w przód (forward pass) — obliczenie odpowiedzi sieci bez zmiany wag.
- Spłaszczenie — ustawienie pikseli obrazu w jeden ciąg liczb wejściowych.
- Normalizacja wejść — przeskalowanie wartości do wspólnego zakresu.
- Rozkład pewności — zestaw liczb na wyjściu klasyfikatora, sumujących się do 1.
- Działanie poza rozkładem — użycie modelu na danych niepodobnych do treningowych.
- Reprezentacja (osadzenie) — wektor liczb, którym sieć opisuje dane w warstwie ukrytej.
- Hierarchia cech — układ reprezentacji od krawędzi do obiektów w kolejnych warstwach.
- Uczenie reprezentacji — uczenie modelu własnego języka opisu danych.
- Uczenie transferowe — wykorzystanie reprezentacji z jednego modelu do innego zadania.
- Wieloznaczność neuronów — reagowanie jednego neuronu na kilka niepowiązanych pojęć.
- Interpretowalność — dziedzina zajmująca się odczytywaniem, co model zakodował w środku.
W pigułce
- Neuron wykonuje cztery działania: waż, zsumuj, dodaj obciążenie, przepuść przez aktywację. Nic więcej.
- Cała nauczona treść modelu to wagi i obciążenia — liczby, nie reguły ani pojęcia.
- Suma ważona to wzór regresji liniowej; różnicę robi funkcja aktywacji.
- Bez nieliniowości sto warstw jest równoważne jednej. To jedyny powód, dla którego głębokość ma sens — i domknięcie sprawy XOR z Jednostki 8.4.
- ReLU wygrała prostotą: nieliniowa, tania, nie wygasza sygnału uczącego.
- Softmax zamienia surowe wyjścia w pewności sumujące się do 1, wyostrzając różnice.
- Przepływ w przód to mnożenie macierzy — stąd karty graficzne jako naturalne narzędzie (13.1).
- „Pewność 93%" to wewnętrzna zgodność modelu z treningiem, nie prawdopodobieństwo prawdy. Sieć zawsze wybierze jakąś klasę; „nie wiem" trzeba dodać osobno.
- Warstwy ukryte budują hierarchię reprezentacji — od krawędzi do obiektów — i robią to same. To właściwa treść rewolucji uczenia głębokiego.
- Reprezentacje da się przenosić między zadaniami, ale nie należy czytać pojedynczych neuronów jako pojęć.
Sprawdzian działowy
Pytania do refleksji:
-
Opisz sztuczny neuron przez cztery składniki i wskaż, który z nich decyduje o tym, że sieć głęboka jest czymś więcej niż regresją liniową. Uzasadnij rachunkiem.
-
Wyjaśnij, dlaczego zdanie „sieć neuronowa działa jak mózg" jest metaforą, a nie opisem. Wskaż trzy konkretne różnice — i jedno realne podobieństwo, które nie jest przypadkiem (Hubel i Wiesel, Jednostka 10.4).
-
Sieć ma warstwy 784 → 32 → 32 → 10. Policz liczbę parametrów i liczbę mnożeń potrzebnych na jedną odpowiedź. Następnie wyjaśnij, dlaczego te dwie liczby są prawie takie same, a mimo to opisują coś zupełnie innego.
-
Ktoś twierdzi, że wystarczy dodać warstwy, by model był mądrzejszy. Podaj trzy niezależne powody, dla których to nieprawda, i wskaż, w którym dziale każdy z nich jest rozwinięty.
-
Model rozpoznający zmiany skórne zwraca „czerniak, pewność 0,97" dla zdjęcia tatuażu. Wyjaśnij, jak to możliwe przy dobrze wytrenowanym modelu, i zaproponuj, jak zabezpieczyć przed tym system używany w przychodni.
-
Wyjaśnij, na czym polega uczenie reprezentacji i dlaczego uważa się je za istotę przełomu w uczeniu głębokim. Odwołaj się do tego, jak przed 2012 rokiem powstawały cechy do rozpoznawania obrazów.
-
Sieć klasyfikuje krowę na plaży jako psa. Wyjaśnij to zjawisko przez pojęcie reprezentacji i wskaż, dlaczego to nie jest błąd algorytmu, ale skutek postawionego mu zadania.
-
Wagi sieci to wszystko, co model „wie". Napisz, co z tego wynika dla pytania, czy model rozumie to, o czym mówi — i wskaż, gdzie w tej książce ten wątek jest rozstrzygany (albo pokazany jako nierozstrzygnięty).