Zamknięcie działu 15
Słowniczek działu
- Model językowy — sieć przewidująca następny token.
- Okno kontekstu / n-gram — stała, krótka historia do predykcji.
- Bag of words — zbiór słów bez kolejności.
- RNN — sieć rekurencyjna; stan ukryty w czasie.
- Stan ukryty — wektor pamięci po kolejnych tokenach.
- Zanik gradientu (w czasie) — sygnał uczący gaśnie na długiej sekwencji.
- LSTM (1997) — RNN z bramkami i stanem komórki.
- Forget / input / output gate — kontrola pamięci w LSTM.
- GRU (2014) — uproszczony wariant z bramkami.
- seq2seq (2014) — sekwencja → sekwencja (enkoder–dekoder).
- <EOS> — token końca sekwencji.
W pigułce
- Generowanie tekstu = wielokrotne „co następne?".
- Sztywne okno nie wystarcza do języka.
- RNN wprowadza pamięć w czasie; płaci zanikiem gradientu i brakiem paralelizmu.
- LSTM przedłuża pamięć bramkami — nadal sekwencyjnie.
- seq2seq uczy tłumaczyć całe ciągi; wąskie gardło długiego wejścia zostaje.
- Historia idzie do transformera (Dział 16): uwaga zamiast pętli.
Sprawdzian działowy
- Zdefiniuj model językowy i zbuduj dwa przykłady treningowe z okna na krótkim zdaniu.
- Wymień dwa ograniczenia podejścia „stałe okno / n-gram" i podaj przykład zdania, które je demaskuje.
- Opisz rolę stanu ukrytego w RNN na przykładzie „Ala ma" → „kota".
- Wyjaśnij, co LSTM dodaje do RNN i jakich problemów nie usuwa.
- Opisz seq2seq (enkoder, dekoder, <EOS>) i powiedz, które dwie bolączki motywowały transformera.