Transformer i mechanizm uwagi
Wstęp do działu
To najważniejszy dział techniczny w tej książce. Wszystko, co dziś nazywamy „sztuczną inteligencją" w potocznym sensie — ChatGPT, generatory obrazów, asystenci kodu — stoi na jednej architekturze z 2017 roku: pracy o zuchwałym tytule Attention Is All You Need. „Uwaga to wszystko, czego potrzebujesz".
Po seq2seq (Jednostka 15.5) zespół Google miał dwa problemy: brak paralelizmu (trening drogi) i słabnącą pamięć na długich sekwencjach. Zostawili enkoder–dekoder i osadzenia. Wyrzucili rekurencję. Za kontekst odpowiada mechanizm uwagi; za porządek słów — kodowanie pozycyjne. Cały tekst da się liczyć naraz — a to znaczy: da się trenować na skali, o której RNN mogły tylko pomarzyć.
„Uwaga" tu nie znaczy ludzkiego skupienia. To obliczenia, które ważą, jak silnie jeden token wpływa na reprezentację drugiego. Metafora — nie przeżycie. Zrozumiesz ją, przejdziesz uproszczony przebieg tłumaczenia „Ala ma kota" → „Alice has a cat" i zobaczysz, czemu skala (parametry × dane × moc) zrobiła z tej architektury GPT.

Mapa pojęć działu
PROBLEM po seq2seq (15.5)
brak paralelizmu · długa sekwencja
|
TRANSFORMER (2017) — 16.1
„Attention Is All You Need"
enkoder–dekoder BEZ RNN
|
┌─────────────┼──────────────┐
UWAGA (16.2) POZYCJE (16.3) RÓWNOLEGŁOŚĆ
multi-head sin / cos cały tekst naraz
|
UPROSZCZONY PRZEBIEG (16.4)
Ala ma kota → Alice has a cat
|
SKALA (16.5) → GPT (Dział 17)
Jednostki w tym dziale
- 16.1 Transformer (2017): „Attention is all you need"
- 16.2 Mechanizm uwagi krok po kroku
- 16.3 Kodowanie pozycyjne: skąd model wie, co było pierwsze
- 16.4 Uproszczony model transformatora: od tokenu do rozkładu prawdopodobieństwa
- 16.5 Skala: parametry, dane, prawa skalowania