Model językowy i sekwencje
Wstęp do działu
W Dziale 14 zamieniliśmy słowa na wektory. To jeszcze nie wystarczy, żeby maszyna pisała. Brakuje zadania: co jest następnym słowem? Model językowy to sieć, która dla danego ciągu tokenów wskazuje, jaki token pojawi się dalej. ChatGPT, Gemini, Claude — wszystkie robią właśnie to. Reszta (streszczenia, tłumaczenia, kod) wyrasta z tej jednej zdolności.
Najpierw zobaczysz, jak uczyć taki model na oknie sąsiedztwa — prawie tak samo jak word2vec, tylko celem jest następne słowo, a nie brakujące w środku. Potem: dlaczego sztywne okno (idea n-gramu) nie ogarnia długich zależności ani porządku. Odpowiedzią lat 2013–2017 były sieci rekurencyjne (RNN): pętla w czasie, stan ukryty jako „pamięć". Gdy pamięć gasła na długich tekstach (zanik gradientu), pojawiły się LSTM z bramkami. A gdy zamiast jednego następnego słowa potrzebowaliśmy całego tłumaczenia — seq2seq: enkoder czyta, dekoder pisze.
To most między osadzeniami a transformerem (Dział 16). Bez RNN i seq2seq nie zrozumiesz, dlaczego w 2017 wyrzucono pętlę i zastąpiono ją mechanizmem uwagi.

Mapa pojęć działu
MODEL JĘZYKOWY (15.1)
ciąg → rozkład na następny token
okno kontekstu → przykłady treningowe
│
OKNO / n-GRAMY (15.2)
sztywna szerokość · słaba kolejność
brak długich zależności
│
RNN (15.3)
stan ukryty = pamięć krok po kroku
zanik gradientu na długich sekwencjach
│
LSTM (15.4)
bramki + stan komórki
dłuższa pamięć, wciąż sekwencyjne
│
seq2seq (15.5)
enkoder → „podsumowanie" → dekoder
tłumaczenie, streszczenie; <EOS>
│
→ Dział 16 (transformer)
Jednostki w tym dziale
- 15.1 Czym jest model językowy: przewidywanie następnego słowa
- 15.2 n-gramy i ich ograniczenia
- 15.3 Sieci rekurencyjne (RNN): pętla w czasie
- 15.4 LSTM: pamięć długa i krótka
- 15.5 seq2seq: koder–dekoder i tłumaczenie maszynowe