Zamknięcie działu 12
Słowniczek działu
- Piksel — najmniejszy element obrazu; jedna liczba (0–255) w skali szarości, trzy liczby w RGB.
- Kanał — jedna z warstw liczb opisujących obraz (szarość: 1, kolor: 3).
- Rozdzielczość — liczba pikseli obrazu, wysokość × szerokość.
- Niezmienniczość na przesunięcie — rozpoznanie wzorca niezależnie od jego położenia w obrazie.
- Konwolucja (splot) — przesuwanie filtra po danych i liczenie w każdym położeniu sumy ważonej fragmentu.
- Filtr (jądro splotu) — mała tablica wag (3 × 3, 5 × 5) wykrywająca jeden wzorzec; sięga przez wszystkie kanały wejścia.
- Mapa cech — siatka wyników jednego filtra: gdzie i jak silnie wystąpił jego wzorzec.
- Krok (stride) — o ile pikseli przesuwa się okienko filtra.
- Uzupełnianie zerami (padding) — ramka zer wokół obrazu, pozwalająca zachować wymiar po splocie.
- Współdzielenie wag — użycie tego samego filtra we wszystkich położeniach; źródło taniości CNN i niezmienniczości na przesunięcie.
- Pooling — zmniejszenie mapy cech przez zastąpienie okna jedną liczbą; max pooling zostawia największą. Zero parametrów.
- Spłaszczenie — przepisanie wszystkich map cech w jeden długi wektor przed warstwą gęstą.
- Sieć konwolucyjna (CNN, splotowa) — architektura naprzemiennych splotów i poolingu dla danych przestrzennych (Fukushima 1980; LeCun 1989; LeNet-5 1998).
- Pole recepcyjne — obszar oryginalnego wejścia wpływający na jedną liczbę w danej warstwie; rośnie z głębokością.
- Neocognitron — architektura Fukushimy (1980), poprzednik CNN, uczony bez propagacji wstecznej.
- LeNet-5 — sieć LeCuna (1998) odczytująca cyfry na czekach bankowych; pierwsze duże zastosowanie komercyjne.
- Uczenie skrótów — wyuczenie cechy predykcyjnej w danych, ale niezwiązanej przyczynowo ze zjawiskiem (marker, dren, model aparatu).
- Przesunięcie dziedziny (dataset shift) — zmiana warunków między treningiem a użyciem, przy której skróty przestają działać.
- Walidacja zewnętrzna — ocena modelu na danych z innego źródła niż trening.
- Mapa istotności (Grad-CAM) — nakładka pokazująca, które obszary obrazu wpłynęły na decyzję; pomoc, nie dowód.
- Przykład kontradyktoryjny — minimalnie i niedostrzegalnie zmodyfikowane wejście, przy którym model myli się z wysoką pewnością.
W pigułce
- Do sieci nie wchodzi obraz, tylko tablica liczb: wysokość × szerokość × kanały.
- Sieć gęsta na obrazach zawodzi dwukrotnie: kosztuje setki milionów wag i nie wie, co jest obok czego (można przetasować piksele bez straty).
- Konwolucja rozwiązuje oba problemy jednym ruchem: małe okienko wag przesuwane po całym obrazie, wynik zapisany jako mapa cech.
- Współdzielenie wag to źródło i taniości (320 parametrów wobec 150 milionów), i niezmienniczości na przesunięcie.
- Wartości filtrów są uczone, nie projektowane. „Detektor krawędzi" to opis po fakcie.
- Pooling zmniejsza mapy cech bez ani jednego parametru; zachowuje „czy cecha wystąpiła", wyrzuca „gdzie dokładnie".
- Typowa CNN: splot → pooling → … → spłaszczenie → warstwa gęsta + softmax. Przykładowa sieć MNIST: 104 202 parametry, każdy sprawdzalny rachunkiem.
- Reguła architektury: kanałów coraz więcej, rozdzielczości coraz mniej — wymiana „gdzie" na „co".
- Pole recepcyjne rośnie z głębokością, więc płytkie warstwy mogą pytać tylko o krawędzie, a głębokie o obiekty. To mechaniczna przyczyna hierarchii cech z Jednostki 10.4.
- Wczesne warstwy są przenośne między zadaniami, głębokie — nie; stąd uczenie transferowe.
- CNN działała już w 1998 roku (czeki bankowe). Czternaście lat zwłoki wynikało z braku danych, mocy i technik treningu — nie pomysłu.
- W medycynie obrazowej CNN osiągają wyniki porównywalne ze specjalistami w wąskich zadaniach; pierwszy autonomiczny system dopuszczony przez FDA to IDx-DR (2018).
- Dwie twarde granice: uczenie skrótów (marker, dren, szpital) i przykłady kontradyktoryjne (niewidoczna zmiana, pewna pomyłka).
- Skróty wykrywa walidacja zewnętrzna, nie krzywa walidacyjna z tego samego źródła.
- „Sieć widzi" to metafora: nie ma patrzenia, nazwy filtrów nadajemy po fakcie, a sieć nie wie, na co powinna patrzeć.
Sprawdzian działowy
Pytania do refleksji:
-
Wyjaśnij, dlaczego sieć gęsta jest złym wyborem dla obrazów, podając dwa niezależne powody. Który z nich uważasz za poważniejszy i dlaczego? Podeprzyj pierwszy powód rachunkiem dla zdjęcia 224 × 224 × 3 i warstwy o 1000 neuronach.
-
Opisz operację konwolucji tak, jakbyś tłumaczył ją koledze, który zna pojęcie neuronu z Działu 10. Pokaż w tym opisie, że konwolucja nie wprowadza nowego rodzaju obliczenia.
-
Wejście: 100 × 100 × 3. Warstwa splotowa: 48 filtrów 5 × 5, krok 1, bez uzupełniania. Potem max pooling 2 × 2. Policz wymiary po obu warstwach i liczbę parametrów każdej z nich. Wyjaśnij, skąd bierze się liczba wag w jednym filtrze.
-
Uzasadnij zdanie: „pooling nie ma ani jednego parametru, a bez niego nie byłoby hierarchii cech". Wskaż w swoim uzasadnieniu rolę pola recepcyjnego.
-
Wyjaśnij, dlaczego mapy cech w głębszych warstwach przestają przypominać obrazek wejściowy — i dlaczego nie jest to oznaka, że sieć coś gubi. Powiąż odpowiedź z pojęciem reprezentacji z Jednostki 10.4.
-
Wyjaśnij, dlaczego LeNet-5 z 1998 roku nie wywołała rewolucji, mimo że działała komercyjnie. Wymień trzy brakujące warunki i przy każdym wskaż jednostkę, w której jest omówiony. Sformułuj z tego ogólny wniosek o historii techniki.
-
Model wykrywający zapalenie płuc ma 94% trafności na danych ze szpitala, w którym powstał, i 71% w innym szpitalu. Opisz, jak sprawdziłbyś, czy przyczyną jest uczenie skrótów, i czym ta diagnoza różni się od diagnozy przeuczenia z Jednostki 11.5.
-
Przeczytałeś nagłówek: „Sztuczna inteligencja rozpoznaje czerniaka lepiej niż dermatolodzy". Wypisz cztery pytania, które musisz zadać, żeby ocenić to zdanie, i przy każdym powiedz, jaka odpowiedź osłabiłaby siłę nagłówka.