Zamknięcie działu 12

Słowniczek działu

  • Piksel — najmniejszy element obrazu; jedna liczba (0–255) w skali szarości, trzy liczby w RGB.
  • Kanał — jedna z warstw liczb opisujących obraz (szarość: 1, kolor: 3).
  • Rozdzielczość — liczba pikseli obrazu, wysokość × szerokość.
  • Niezmienniczość na przesunięcie — rozpoznanie wzorca niezależnie od jego położenia w obrazie.
  • Konwolucja (splot) — przesuwanie filtra po danych i liczenie w każdym położeniu sumy ważonej fragmentu.
  • Filtr (jądro splotu) — mała tablica wag (3 × 3, 5 × 5) wykrywająca jeden wzorzec; sięga przez wszystkie kanały wejścia.
  • Mapa cech — siatka wyników jednego filtra: gdzie i jak silnie wystąpił jego wzorzec.
  • Krok (stride) — o ile pikseli przesuwa się okienko filtra.
  • Uzupełnianie zerami (padding) — ramka zer wokół obrazu, pozwalająca zachować wymiar po splocie.
  • Współdzielenie wag — użycie tego samego filtra we wszystkich położeniach; źródło taniości CNN i niezmienniczości na przesunięcie.
  • Pooling — zmniejszenie mapy cech przez zastąpienie okna jedną liczbą; max pooling zostawia największą. Zero parametrów.
  • Spłaszczenie — przepisanie wszystkich map cech w jeden długi wektor przed warstwą gęstą.
  • Sieć konwolucyjna (CNN, splotowa) — architektura naprzemiennych splotów i poolingu dla danych przestrzennych (Fukushima 1980; LeCun 1989; LeNet-5 1998).
  • Pole recepcyjne — obszar oryginalnego wejścia wpływający na jedną liczbę w danej warstwie; rośnie z głębokością.
  • Neocognitron — architektura Fukushimy (1980), poprzednik CNN, uczony bez propagacji wstecznej.
  • LeNet-5 — sieć LeCuna (1998) odczytująca cyfry na czekach bankowych; pierwsze duże zastosowanie komercyjne.
  • Uczenie skrótów — wyuczenie cechy predykcyjnej w danych, ale niezwiązanej przyczynowo ze zjawiskiem (marker, dren, model aparatu).
  • Przesunięcie dziedziny (dataset shift) — zmiana warunków między treningiem a użyciem, przy której skróty przestają działać.
  • Walidacja zewnętrzna — ocena modelu na danych z innego źródła niż trening.
  • Mapa istotności (Grad-CAM) — nakładka pokazująca, które obszary obrazu wpłynęły na decyzję; pomoc, nie dowód.
  • Przykład kontradyktoryjny — minimalnie i niedostrzegalnie zmodyfikowane wejście, przy którym model myli się z wysoką pewnością.

W pigułce

  • Do sieci nie wchodzi obraz, tylko tablica liczb: wysokość × szerokość × kanały.
  • Sieć gęsta na obrazach zawodzi dwukrotnie: kosztuje setki milionów wag i nie wie, co jest obok czego (można przetasować piksele bez straty).
  • Konwolucja rozwiązuje oba problemy jednym ruchem: małe okienko wag przesuwane po całym obrazie, wynik zapisany jako mapa cech.
  • Współdzielenie wag to źródło i taniości (320 parametrów wobec 150 milionów), i niezmienniczości na przesunięcie.
  • Wartości filtrów są uczone, nie projektowane. „Detektor krawędzi" to opis po fakcie.
  • Pooling zmniejsza mapy cech bez ani jednego parametru; zachowuje „czy cecha wystąpiła", wyrzuca „gdzie dokładnie".
  • Typowa CNN: splot → pooling → … → spłaszczenie → warstwa gęsta + softmax. Przykładowa sieć MNIST: 104 202 parametry, każdy sprawdzalny rachunkiem.
  • Reguła architektury: kanałów coraz więcej, rozdzielczości coraz mniej — wymiana „gdzie" na „co".
  • Pole recepcyjne rośnie z głębokością, więc płytkie warstwy mogą pytać tylko o krawędzie, a głębokie o obiekty. To mechaniczna przyczyna hierarchii cech z Jednostki 10.4.
  • Wczesne warstwy są przenośne między zadaniami, głębokie — nie; stąd uczenie transferowe.
  • CNN działała już w 1998 roku (czeki bankowe). Czternaście lat zwłoki wynikało z braku danych, mocy i technik treningu — nie pomysłu.
  • W medycynie obrazowej CNN osiągają wyniki porównywalne ze specjalistami w wąskich zadaniach; pierwszy autonomiczny system dopuszczony przez FDA to IDx-DR (2018).
  • Dwie twarde granice: uczenie skrótów (marker, dren, szpital) i przykłady kontradyktoryjne (niewidoczna zmiana, pewna pomyłka).
  • Skróty wykrywa walidacja zewnętrzna, nie krzywa walidacyjna z tego samego źródła.
  • „Sieć widzi" to metafora: nie ma patrzenia, nazwy filtrów nadajemy po fakcie, a sieć nie wie, na co powinna patrzeć.

Sprawdzian działowy

Pytania do refleksji:

  1. Wyjaśnij, dlaczego sieć gęsta jest złym wyborem dla obrazów, podając dwa niezależne powody. Który z nich uważasz za poważniejszy i dlaczego? Podeprzyj pierwszy powód rachunkiem dla zdjęcia 224 × 224 × 3 i warstwy o 1000 neuronach.

  2. Opisz operację konwolucji tak, jakbyś tłumaczył ją koledze, który zna pojęcie neuronu z Działu 10. Pokaż w tym opisie, że konwolucja nie wprowadza nowego rodzaju obliczenia.

  3. Wejście: 100 × 100 × 3. Warstwa splotowa: 48 filtrów 5 × 5, krok 1, bez uzupełniania. Potem max pooling 2 × 2. Policz wymiary po obu warstwach i liczbę parametrów każdej z nich. Wyjaśnij, skąd bierze się liczba wag w jednym filtrze.

  4. Uzasadnij zdanie: „pooling nie ma ani jednego parametru, a bez niego nie byłoby hierarchii cech". Wskaż w swoim uzasadnieniu rolę pola recepcyjnego.

  5. Wyjaśnij, dlaczego mapy cech w głębszych warstwach przestają przypominać obrazek wejściowy — i dlaczego nie jest to oznaka, że sieć coś gubi. Powiąż odpowiedź z pojęciem reprezentacji z Jednostki 10.4.

  6. Wyjaśnij, dlaczego LeNet-5 z 1998 roku nie wywołała rewolucji, mimo że działała komercyjnie. Wymień trzy brakujące warunki i przy każdym wskaż jednostkę, w której jest omówiony. Sformułuj z tego ogólny wniosek o historii techniki.

  7. Model wykrywający zapalenie płuc ma 94% trafności na danych ze szpitala, w którym powstał, i 71% w innym szpitalu. Opisz, jak sprawdziłbyś, czy przyczyną jest uczenie skrótów, i czym ta diagnoza różni się od diagnozy przeuczenia z Jednostki 11.5.

  8. Przeczytałeś nagłówek: „Sztuczna inteligencja rozpoznaje czerniaka lepiej niż dermatolodzy". Wypisz cztery pytania, które musisz zadać, żeby ocenić to zdanie, i przy każdym powiedz, jaka odpowiedź osłabiłaby siłę nagłówka.