Transformer i mechanizm uwagi

Wstęp do działu

To najważniejszy dział techniczny w tej książce. Wszystko, co dziś nazywamy „sztuczną inteligencją" w potocznym sensie — ChatGPT, generatory obrazów, asystenci kodu — stoi na jednej architekturze z 2017 roku: pracy o zuchwałym tytule Attention Is All You Need. „Uwaga to wszystko, czego potrzebujesz".

Po seq2seq (Jednostka 15.5) zespół Google miał dwa problemy: brak paralelizmu (trening drogi) i słabnącą pamięć na długich sekwencjach. Zostawili enkoder–dekoder i osadzenia. Wyrzucili rekurencję. Za kontekst odpowiada mechanizm uwagi; za porządek słów — kodowanie pozycyjne. Cały tekst da się liczyć naraz — a to znaczy: da się trenować na skali, o której RNN mogły tylko pomarzyć.

„Uwaga" tu nie znaczy ludzkiego skupienia. To obliczenia, które ważą, jak silnie jeden token wpływa na reprezentację drugiego. Metafora — nie przeżycie. Zrozumiesz ją, przejdziesz uproszczony przebieg tłumaczenia „Ala ma kota" → „Alice has a cat" i zobaczysz, czemu skala (parametry × dane × moc) zrobiła z tej architektury GPT.

Intuicja uwagi: uważne studiowanie tekstu — metafora, nie psychologia modelu
Intuicja uwagi: uważne studiowanie tekstu — metafora, nie psychologia modelu

Mapa pojęć działu

      PROBLEM po seq2seq (15.5)
      brak paralelizmu · długa sekwencja
                    |
        TRANSFORMER (2017) — 16.1
      „Attention Is All You Need"
      enkoder–dekoder BEZ RNN
                    |
      ┌─────────────┼──────────────┐
 UWAGA (16.2)   POZYCJE (16.3)   RÓWNOLEGŁOŚĆ
 multi-head     sin / cos        cały tekst naraz
                    |
           UPROSZCZONY PRZEBIEG (16.4)
           Ala ma kota → Alice has a cat
                    |
           SKALA (16.5) → GPT (Dział 17)

Jednostki w tym dziale

  • 16.1 Transformer (2017): „Attention is all you need"
  • 16.2 Mechanizm uwagi krok po kroku
  • 16.3 Kodowanie pozycyjne: skąd model wie, co było pierwsze
  • 16.4 Uproszczony model transformatora: od tokenu do rozkładu prawdopodobieństwa
  • 16.5 Skala: parametry, dane, prawa skalowania