Zamknięcie działu 15

Słowniczek działu

  • Model językowy — sieć przewidująca następny token.
  • Okno kontekstu / n-gram — stała, krótka historia do predykcji.
  • Bag of words — zbiór słów bez kolejności.
  • RNN — sieć rekurencyjna; stan ukryty w czasie.
  • Stan ukryty — wektor pamięci po kolejnych tokenach.
  • Zanik gradientu (w czasie) — sygnał uczący gaśnie na długiej sekwencji.
  • LSTM (1997) — RNN z bramkami i stanem komórki.
  • Forget / input / output gate — kontrola pamięci w LSTM.
  • GRU (2014) — uproszczony wariant z bramkami.
  • seq2seq (2014) — sekwencja → sekwencja (enkoder–dekoder).
  • <EOS> — token końca sekwencji.

W pigułce

  • Generowanie tekstu = wielokrotne „co następne?".
  • Sztywne okno nie wystarcza do języka.
  • RNN wprowadza pamięć w czasie; płaci zanikiem gradientu i brakiem paralelizmu.
  • LSTM przedłuża pamięć bramkami — nadal sekwencyjnie.
  • seq2seq uczy tłumaczyć całe ciągi; wąskie gardło długiego wejścia zostaje.
  • Historia idzie do transformera (Dział 16): uwaga zamiast pętli.

Sprawdzian działowy

  1. Zdefiniuj model językowy i zbuduj dwa przykłady treningowe z okna na krótkim zdaniu.
  2. Wymień dwa ograniczenia podejścia „stałe okno / n-gram" i podaj przykład zdania, które je demaskuje.
  3. Opisz rolę stanu ukrytego w RNN na przykładzie „Ala ma" → „kota".
  4. Wyjaśnij, co LSTM dodaje do RNN i jakich problemów nie usuwa.
  5. Opisz seq2seq (enkoder, dekoder, <EOS>) i powiedz, które dwie bolączki motywowały transformera.