Transformer (2017): „Attention is all you need"
🎯 Po co Ci to?
Bez tej decyzji architektonicznej nie byłoby ChatGPT. Nie musisz umieć wyprowadzić wzoru uwagi — musisz wiedzieć, co wyrzucono, co zostawiono i dlaczego to otworzyło skalę.
✅ Czego się nauczysz
Po tej lekcji potrafisz:
- wskazać dwa problemy seq2seq/RNN, które motywowały transformera;
- powiedzieć, co transformer zachował z seq2seq, a co usunął;
- nazwać dwa nowe elementy: uwagę i kodowanie pozycyjne;
- powiązać paralelizm z GPU i erą deep learningu (Dział 13).
🔁 Przypomnij sobie
Z 15.5: enkoder czyta, dekoder pisze; LSTM jest sekwencyjny; długie wejście słabo mieści się w jednym finalnym stanie. Z 13.1: GPU lubią tysiące niezależnych obliczeń naraz.
📘 Decyzja z 2017
Artykuł Vaswaniego i współpracowników (Attention Is All You Need) celował głównie w lepsze tłumaczenie maszynowe. Diagnoza po seq2seq:
- brak paralelizmu → wysoki koszt uczenia;
- trudność z bardzo długimi sekwencjami mimo LSTM.
Zostawiono: architekturę enkoder–dekoder oraz ideę reprezentacji tokenów osadzeniami.
Usunięto: sieci rekurencyjne (źródło sekwencyjności i kosztu).
Bez RNN giną dwie rzeczy, które rekurencja dawała „za darmo": poczucie kontekstu w czasie oraz informacja o porządku tokenów. Transformer adresuje je inaczej:
- kontekst → mechanizm uwagi (Jednostka 16.2);
- porządek → kodowanie pozycyjne (Jednostka 16.3).
📐 DEFINICJA — transformer: architektura sieci neuronowej (Vaswani i in., 2017) oparta na mechanizmie uwagi (bez RNN), z enkodera–dekoderem i kodowaniem pozycji; umożliwia równoległe przetwarzanie całej sekwencji.
Po ludzku: zamiast czytać palcem słowo po słowie, model patrzy na cały fragment naraz i liczy, które słowa są dla siebie ważne.
📘 Dlaczego to było przełomowe
Korzyść nie jest tylko „trochę lepsze BLEU w tłumaczeniu". Równoległość pasuje do GPU, które od lat 2010. taniały i rosły w mocy (13.1). Dało się pchać większe modele, większe korpusy, dłuższy trening — bez sekwencyjnego sufitu LSTM. To most do linii GPT (Dział 17).
💭 Pomyśl
Czy „wyrzucenie RNN" oznacza, że model w ogóle nie wie, co było pierwsze w zdaniu? Skąd miałby to wiedzieć?
Podpowiedź
Bez dodatkowej informacji — nie. Osadzenia mówią co znaczy token, nie gdzie stoi. Dlatego dokłada się kodowanie pozycyjne (16.3): osobny sygnał kolejności dodawany do osadzeń.
⚠️ Częsty błąd
Częsty błąd: „Transformer = ChatGPT."
Elenchus: Transformer to architektura. ChatGPT to produkt: konkretny (dekoderowy) transformer + ogromny pretrening + douczanie (SFT/RLHF) — Dział 17. Sam papier z 2017 to jeszcze nie asystent w przeglądarce.
🌍 Powiązania
- 15.5 — problemy, które papier adresuje.
- 16.2–16.4 — mechanika.
- 17 — skala i asystent.
📐 Definicje tej lekcji
- Transformer (2017) — uwaga zamiast rekurencji; enkoder–dekoder + pozycje.
- Paralelizm sekwencji — obliczenia dla wielu pozycji naraz (w przeciwieństwie do kroku t zależnego od t−1 w RNN).
📌 Najważniejsze w pigułce
- Motywacja: koszt i długość w seq2seq/RNN.
- Zostaje enkoder–dekoder i osadzenia; znika pętla.
- Kontekst = uwaga; porządek = pozycje.
- Paralelizm → skala na GPU → droga do GPT.
🎒 Zadania
Zadanie 16.1.1. Wymień w tabeli 2×2: co transformer zostawił / wyrzucił względem seq2seq na LSTM; czym to zastąpił.
Pokaż rozwiązanie
Zostawił: enkoder–dekoder, osadzenia. Wyrzucił: RNN/LSTM. Zastąpił funkcję kontekstu → uwaga; funkcję porządku → kodowanie pozycyjne.
Zadanie 16.1.2. Wyjaśnij jednym akapitem, dlaczego brak zależności „krok t czeka na t−1" jest prezentem dla GPU.
Pokaż rozwiązanie
Gdy pozycje liczą się niezależnie (w jednej warstwie uwagi), tysiące rdzeni GPU mogą pracować równolegle. W RNN krok 50 nie startuje przed 49 — większość mocy stoi bezczynnie. Transformer wykorzystuje sprzęt, który i tak był potrzebny do CNN (Dział 13).
🔍 Sprawdź, czy umiesz
- [ ] Nazwać dwa problemy po seq2seq.
- [ ] Powiedzieć, co zostaje, a co znika w transformerze.
- [ ] Wskazać rolę uwagi i pozycji.
- [ ] Odróżnić architekturę od produktu ChatGPT.