Linia GPT-1…GPT-4: skala i predykcja tokenu

🎯 Po co Ci to?

Architektura bez skali to ciekawostka. Seria GPT pokazała, że ta sama idea (dekoderowy transformer + następny token) przy rosnących danych, parametrach i mocy daje skok jakości, którego nie dało się „wydedukować z papieru 2017".

✅ Czego się nauczysz

Po tej lekcji potrafisz:

  • wyjaśnić predykcję następnego tokenu jako silnik GPT;
  • opisać wzrost skali od GPT-1 do GPT-3 (rzędy wielkości);
  • posłużyć się metaforą stron A4 dla rozmiaru korpusu;
  • odróżnić „większy model" od „mądrzejszy jak człowiek".

🔁 Przypomnij sobie

Model językowy (15.1): ciąg → rozkład na następny token. Transformer (16): paralelizm → da się trenować na skali. Prawa skalowania (16.5).

📘 Jedno zadanie, wiele generacji

GPT = Generative Pre-trained Transformer. Trening: miliardy razy zgadnij następny token, porównaj z prawdziwym tekstem, popraw wagi (propagacja wsteczna). Długa odpowiedź = wielokrotne powtórzenie tej operacji.

📐 DEFINICJA — predykcja następnego tokenu: szacowanie prawdopodobieństwa kolejnego tokenu na podstawie wszystkich poprzedzających.

Po ludzku: bardzo zaawansowana podpowiedź klawiatury, która umie ciągnąć całe akapity. Czym to NIE jest: wyszukiwarka faktów ani gwarancja prawdy.

🕰️ Oś czasu (przybliżenia z literatury / komunikatów)

2018 — GPT-1: BooksCorpus, ~5 GB (~7 tys. książek)
2019 — GPT-2: teksty z linków Reddita, ~40 GB
2020 — GPT-3: Common Crawl + inne, ~570 GB
2022 — ChatGPT: interfejs na bazie GPT-3.5 + RLHF (17.5)
2023 — GPT-4: multimodalny; pełna specyfikacja nieujawniona

Trzy dźwignie rosną razem: dane, parametry, compute — intuicja scaling laws (16.5).

Metafora A4: ~2 KB tekstu na stronę, grubość ~0,1 mm. 570 GB ≈ ~300 mln stron → stos wysokości rzędu ~30 km (powyżej typowego pułapu pasażerskiego). GPT-2 (~40 GB) ≈ ~2 km; GPT-1 (~5 GB) ≈ ~250 m.

💭 Pomyśl

Skoro GPT-3 „przeczytał" odpowiednik setek milionów stron, dlaczego nadal pewnie podaje fałsze?

Podpowiedź

Uczy się jak brzmi prawdopodobny tekst, nie czy zdanie jest prawdziwe. Mity z danych wyglądają jak fakty. Halucynacje wrócą w Części V.

⚠️ Częsty błąd

Częsty błąd: „GPT-4 jest po prostu lepiej wykształconym GPT-1."

Elenchus: Skala poprawia mapę wzorców językowych. Nie daje weryfikacji prawdy ani świadomości niewiedzy.

🌍 Powiązania

  • 16.5 — most architektura → skala.
  • 17.2 — pretrening vs problem instrukcji.
  • 18 — granice mimo skali.

📐 Definicje tej lekcji

  • GPT — generatywny, wstępnie trenowany transformer (dekoder jako LM).
  • Prawa skalowania — empiryczna poprawa z danymi/parametrami/compute.
  • Pretrening / fine-tuning — najpierw ogólny LM, potem dopasowanie do zadania.

📌 Najważniejsze w pigułce

  • Silnik: następny token, w kółko.
  • Skala skacze o rzędy wielkości (5 → 40 → 570 GB…).
  • Więcej danych ≠ gwarancja prawdy.
  • Sam LM to jeszcze nie ChatGPT.

🎒 Zadania

Zadanie 17.1.1. Dlaczego „widział dużo tekstu na temat X" nie gwarantuje prawdziwej odpowiedzi o X?

Pokaż rozwiązanie

Trening optymalizuje prawdopodobieństwo ciągów, nie zgodność z rzeczywistością. Błędy w korpusie są reprodukowane jak fakty.

Zadanie 17.1.2. Przy ~2 KB/stronę oszacuj liczbę stron w 1 GB (~1 048 576 KB).

Pokaż rozwiązanie

≈ 1 048 576 / 2 ≈ 524 tys. stron — a GPT-3 to setki takich gigabajtów.

🔍 Sprawdź, czy umiesz

  • [ ] Opisać predykcję tokenu.
  • [ ] Podać rzędy skali GPT-1…3.
  • [ ] Użyć metafory A4.
  • [ ] Oddzielić skalę od „mądrości ludzkiej".

Ucz się tej jednostki z asystentem