Zamknięcie działu 16

Słowniczek działu

  • Transformer (2017) — architektura na uwadze, bez RNN.
  • Mechanizm uwagi / self-attention — wagi między wszystkimi pozycjami sekwencji.
  • Multi-head attention — wiele równoległych „perspektyw".
  • Query / Key / Value — zapytanie, klucz, wartość (szkic).
  • Kodowanie pozycyjne — wektor pozycji (sin/cos) dodany do osadzenia.
  • Enkoder / dekoder (w transformerze) — reprezentacja wejścia / generowanie wyjścia z uwagą.
  • Autoregresja — kolejny token z poprzednich.
  • Prawa skalowania — empiryczna poprawa z parametrami, danymi, compute.
  • LLM — duży model językowy (zwykle transformer).

W pigułce

  • Po RNN/seq2seq: za drogo, za słabo na długim tekście.
  • Transformer zostawia enkoder–dekoder, wyrzuca pętlę.
  • Uwaga = kontekst naraz; pozycje = kolejność; Softmax = następny token.
  • Paralelizm × GPU × dane = skala → GPT.
  • ChatGPT to jeszcze nie sam papier z 2017 — brakuje douczenia (Dział 17).

Sprawdzian działowy

  1. Co transformer zachował, a co usunął względem seq2seq na LSTM? Czym zastąpił usunięte funkcje?
  2. Wyjaśnij multi-head attention na zdaniu o Ali (co najmniej trzy „perspektywy").
  3. Po co kodowanie pozycyjne? Podaj przykładowe wektory pozycji dla trzech słów (schematycznie).
  4. Opisz przebieg tłumaczenia w uproszczonym transformerze od osadzeń do EOS.
  5. Czym są trzy dźwignie skali i dlaczego sama skala nie wystarcza, by dostać ChatGPT?