Model językowy i sekwencje

Wstęp do działu

W Dziale 14 zamieniliśmy słowa na wektory. To jeszcze nie wystarczy, żeby maszyna pisała. Brakuje zadania: co jest następnym słowem? Model językowy to sieć, która dla danego ciągu tokenów wskazuje, jaki token pojawi się dalej. ChatGPT, Gemini, Claude — wszystkie robią właśnie to. Reszta (streszczenia, tłumaczenia, kod) wyrasta z tej jednej zdolności.

Najpierw zobaczysz, jak uczyć taki model na oknie sąsiedztwa — prawie tak samo jak word2vec, tylko celem jest następne słowo, a nie brakujące w środku. Potem: dlaczego sztywne okno (idea n-gramu) nie ogarnia długich zależności ani porządku. Odpowiedzią lat 2013–2017 były sieci rekurencyjne (RNN): pętla w czasie, stan ukryty jako „pamięć". Gdy pamięć gasła na długich tekstach (zanik gradientu), pojawiły się LSTM z bramkami. A gdy zamiast jednego następnego słowa potrzebowaliśmy całego tłumaczenia — seq2seq: enkoder czyta, dekoder pisze.

To most między osadzeniami a transformerem (Dział 16). Bez RNN i seq2seq nie zrozumiesz, dlaczego w 2017 wyrzucono pętlę i zastąpiono ją mechanizmem uwagi.

Programista przy modelu językowym — intuicja: uczymy sieć przewidywać następny token
Programista przy modelu językowym — intuicja: uczymy sieć przewidywać następny token

Mapa pojęć działu

        MODEL JĘZYKOWY (15.1)
      ciąg → rozkład na następny token
      okno kontekstu → przykłady treningowe
                     │
        OKNO / n-GRAMY (15.2)
      sztywna szerokość · słaba kolejność
      brak długich zależności
                     │
              RNN (15.3)
      stan ukryty = pamięć krok po kroku
      zanik gradientu na długich sekwencjach
                     │
              LSTM (15.4)
      bramki + stan komórki
      dłuższa pamięć, wciąż sekwencyjne
                     │
            seq2seq (15.5)
      enkoder → „podsumowanie" → dekoder
      tłumaczenie, streszczenie; <EOS>
                     │
              → Dział 16 (transformer)

Jednostki w tym dziale

  • 15.1 Czym jest model językowy: przewidywanie następnego słowa
  • 15.2 n-gramy i ich ograniczenia
  • 15.3 Sieci rekurencyjne (RNN): pętla w czasie
  • 15.4 LSTM: pamięć długa i krótka
  • 15.5 seq2seq: koder–dekoder i tłumaczenie maszynowe