Transformer (2017): „Attention is all you need"

🎯 Po co Ci to?

Bez tej decyzji architektonicznej nie byłoby ChatGPT. Nie musisz umieć wyprowadzić wzoru uwagi — musisz wiedzieć, co wyrzucono, co zostawiono i dlaczego to otworzyło skalę.

✅ Czego się nauczysz

Po tej lekcji potrafisz:

  • wskazać dwa problemy seq2seq/RNN, które motywowały transformera;
  • powiedzieć, co transformer zachował z seq2seq, a co usunął;
  • nazwać dwa nowe elementy: uwagę i kodowanie pozycyjne;
  • powiązać paralelizm z GPU i erą deep learningu (Dział 13).

🔁 Przypomnij sobie

Z 15.5: enkoder czyta, dekoder pisze; LSTM jest sekwencyjny; długie wejście słabo mieści się w jednym finalnym stanie. Z 13.1: GPU lubią tysiące niezależnych obliczeń naraz.

📘 Decyzja z 2017

Artykuł Vaswaniego i współpracowników (Attention Is All You Need) celował głównie w lepsze tłumaczenie maszynowe. Diagnoza po seq2seq:

  1. brak paralelizmu → wysoki koszt uczenia;
  2. trudność z bardzo długimi sekwencjami mimo LSTM.

Zostawiono: architekturę enkoder–dekoder oraz ideę reprezentacji tokenów osadzeniami.
Usunięto: sieci rekurencyjne (źródło sekwencyjności i kosztu).

Bez RNN giną dwie rzeczy, które rekurencja dawała „za darmo": poczucie kontekstu w czasie oraz informacja o porządku tokenów. Transformer adresuje je inaczej:

  • kontekst → mechanizm uwagi (Jednostka 16.2);
  • porządek → kodowanie pozycyjne (Jednostka 16.3).

📐 DEFINICJA — transformer: architektura sieci neuronowej (Vaswani i in., 2017) oparta na mechanizmie uwagi (bez RNN), z enkodera–dekoderem i kodowaniem pozycji; umożliwia równoległe przetwarzanie całej sekwencji.

Po ludzku: zamiast czytać palcem słowo po słowie, model patrzy na cały fragment naraz i liczy, które słowa są dla siebie ważne.

📘 Dlaczego to było przełomowe

Korzyść nie jest tylko „trochę lepsze BLEU w tłumaczeniu". Równoległość pasuje do GPU, które od lat 2010. taniały i rosły w mocy (13.1). Dało się pchać większe modele, większe korpusy, dłuższy trening — bez sekwencyjnego sufitu LSTM. To most do linii GPT (Dział 17).

💭 Pomyśl

Czy „wyrzucenie RNN" oznacza, że model w ogóle nie wie, co było pierwsze w zdaniu? Skąd miałby to wiedzieć?

Podpowiedź

Bez dodatkowej informacji — nie. Osadzenia mówią co znaczy token, nie gdzie stoi. Dlatego dokłada się kodowanie pozycyjne (16.3): osobny sygnał kolejności dodawany do osadzeń.

⚠️ Częsty błąd

Częsty błąd: „Transformer = ChatGPT."

Elenchus: Transformer to architektura. ChatGPT to produkt: konkretny (dekoderowy) transformer + ogromny pretrening + douczanie (SFT/RLHF) — Dział 17. Sam papier z 2017 to jeszcze nie asystent w przeglądarce.

🌍 Powiązania

  • 15.5 — problemy, które papier adresuje.
  • 16.2–16.4 — mechanika.
  • 17 — skala i asystent.

📐 Definicje tej lekcji

  • Transformer (2017) — uwaga zamiast rekurencji; enkoder–dekoder + pozycje.
  • Paralelizm sekwencji — obliczenia dla wielu pozycji naraz (w przeciwieństwie do kroku t zależnego od t−1 w RNN).

📌 Najważniejsze w pigułce

  • Motywacja: koszt i długość w seq2seq/RNN.
  • Zostaje enkoder–dekoder i osadzenia; znika pętla.
  • Kontekst = uwaga; porządek = pozycje.
  • Paralelizm → skala na GPU → droga do GPT.

🎒 Zadania

Zadanie 16.1.1. Wymień w tabeli 2×2: co transformer zostawił / wyrzucił względem seq2seq na LSTM; czym to zastąpił.

Pokaż rozwiązanie

Zostawił: enkoder–dekoder, osadzenia. Wyrzucił: RNN/LSTM. Zastąpił funkcję kontekstu → uwaga; funkcję porządku → kodowanie pozycyjne.

Zadanie 16.1.2. Wyjaśnij jednym akapitem, dlaczego brak zależności „krok t czeka na t−1" jest prezentem dla GPU.

Pokaż rozwiązanie

Gdy pozycje liczą się niezależnie (w jednej warstwie uwagi), tysiące rdzeni GPU mogą pracować równolegle. W RNN krok 50 nie startuje przed 49 — większość mocy stoi bezczynnie. Transformer wykorzystuje sprzęt, który i tak był potrzebny do CNN (Dział 13).

🔍 Sprawdź, czy umiesz

  • [ ] Nazwać dwa problemy po seq2seq.
  • [ ] Powiedzieć, co zostaje, a co znika w transformerze.
  • [ ] Wskazać rolę uwagi i pozycji.
  • [ ] Odróżnić architekturę od produktu ChatGPT.

Ucz się tej jednostki z asystentem