Zamknięcie działu 16
Słowniczek działu
- Transformer (2017) — architektura na uwadze, bez RNN.
- Mechanizm uwagi / self-attention — wagi między wszystkimi pozycjami sekwencji.
- Multi-head attention — wiele równoległych „perspektyw".
- Query / Key / Value — zapytanie, klucz, wartość (szkic).
- Kodowanie pozycyjne — wektor pozycji (sin/cos) dodany do osadzenia.
- Enkoder / dekoder (w transformerze) — reprezentacja wejścia / generowanie wyjścia z uwagą.
- Autoregresja — kolejny token z poprzednich.
- Prawa skalowania — empiryczna poprawa z parametrami, danymi, compute.
- LLM — duży model językowy (zwykle transformer).
W pigułce
- Po RNN/seq2seq: za drogo, za słabo na długim tekście.
- Transformer zostawia enkoder–dekoder, wyrzuca pętlę.
- Uwaga = kontekst naraz; pozycje = kolejność; Softmax = następny token.
- Paralelizm × GPU × dane = skala → GPT.
- ChatGPT to jeszcze nie sam papier z 2017 — brakuje douczenia (Dział 17).
Sprawdzian działowy
- Co transformer zachował, a co usunął względem seq2seq na LSTM? Czym zastąpił usunięte funkcje?
- Wyjaśnij multi-head attention na zdaniu o Ali (co najmniej trzy „perspektywy").
- Po co kodowanie pozycyjne? Podaj przykładowe wektory pozycji dla trzech słów (schematycznie).
- Opisz przebieg tłumaczenia w uproszczonym transformerze od osadzeń do EOS.
- Czym są trzy dźwignie skali i dlaczego sama skala nie wystarcza, by dostać ChatGPT?