Linia GPT-1…GPT-4: skala i predykcja tokenu
🎯 Po co Ci to?
Architektura bez skali to ciekawostka. Seria GPT pokazała, że ta sama idea (dekoderowy transformer + następny token) przy rosnących danych, parametrach i mocy daje skok jakości, którego nie dało się „wydedukować z papieru 2017".
✅ Czego się nauczysz
Po tej lekcji potrafisz:
- wyjaśnić predykcję następnego tokenu jako silnik GPT;
- opisać wzrost skali od GPT-1 do GPT-3 (rzędy wielkości);
- posłużyć się metaforą stron A4 dla rozmiaru korpusu;
- odróżnić „większy model" od „mądrzejszy jak człowiek".
🔁 Przypomnij sobie
Model językowy (15.1): ciąg → rozkład na następny token. Transformer (16): paralelizm → da się trenować na skali. Prawa skalowania (16.5).
📘 Jedno zadanie, wiele generacji
GPT = Generative Pre-trained Transformer. Trening: miliardy razy zgadnij następny token, porównaj z prawdziwym tekstem, popraw wagi (propagacja wsteczna). Długa odpowiedź = wielokrotne powtórzenie tej operacji.
📐 DEFINICJA — predykcja następnego tokenu: szacowanie prawdopodobieństwa kolejnego tokenu na podstawie wszystkich poprzedzających.
Po ludzku: bardzo zaawansowana podpowiedź klawiatury, która umie ciągnąć całe akapity. Czym to NIE jest: wyszukiwarka faktów ani gwarancja prawdy.
🕰️ Oś czasu (przybliżenia z literatury / komunikatów)
2018 — GPT-1: BooksCorpus, ~5 GB (~7 tys. książek) 2019 — GPT-2: teksty z linków Reddita, ~40 GB 2020 — GPT-3: Common Crawl + inne, ~570 GB 2022 — ChatGPT: interfejs na bazie GPT-3.5 + RLHF (17.5) 2023 — GPT-4: multimodalny; pełna specyfikacja nieujawniona
Trzy dźwignie rosną razem: dane, parametry, compute — intuicja scaling laws (16.5).
Metafora A4: ~2 KB tekstu na stronę, grubość ~0,1 mm. 570 GB ≈ ~300 mln stron → stos wysokości rzędu ~30 km (powyżej typowego pułapu pasażerskiego). GPT-2 (~40 GB) ≈ ~2 km; GPT-1 (~5 GB) ≈ ~250 m.
💭 Pomyśl
Skoro GPT-3 „przeczytał" odpowiednik setek milionów stron, dlaczego nadal pewnie podaje fałsze?
Podpowiedź
Uczy się jak brzmi prawdopodobny tekst, nie czy zdanie jest prawdziwe. Mity z danych wyglądają jak fakty. Halucynacje wrócą w Części V.
⚠️ Częsty błąd
Częsty błąd: „GPT-4 jest po prostu lepiej wykształconym GPT-1."
Elenchus: Skala poprawia mapę wzorców językowych. Nie daje weryfikacji prawdy ani świadomości niewiedzy.
🌍 Powiązania
- 16.5 — most architektura → skala.
- 17.2 — pretrening vs problem instrukcji.
- 18 — granice mimo skali.
📐 Definicje tej lekcji
- GPT — generatywny, wstępnie trenowany transformer (dekoder jako LM).
- Prawa skalowania — empiryczna poprawa z danymi/parametrami/compute.
- Pretrening / fine-tuning — najpierw ogólny LM, potem dopasowanie do zadania.
📌 Najważniejsze w pigułce
- Silnik: następny token, w kółko.
- Skala skacze o rzędy wielkości (5 → 40 → 570 GB…).
- Więcej danych ≠ gwarancja prawdy.
- Sam LM to jeszcze nie ChatGPT.
🎒 Zadania
Zadanie 17.1.1. Dlaczego „widział dużo tekstu na temat X" nie gwarantuje prawdziwej odpowiedzi o X?
Pokaż rozwiązanie
Trening optymalizuje prawdopodobieństwo ciągów, nie zgodność z rzeczywistością. Błędy w korpusie są reprodukowane jak fakty.
Zadanie 17.1.2. Przy ~2 KB/stronę oszacuj liczbę stron w 1 GB (~1 048 576 KB).
Pokaż rozwiązanie
≈ 1 048 576 / 2 ≈ 524 tys. stron — a GPT-3 to setki takich gigabajtów.
🔍 Sprawdź, czy umiesz
- [ ] Opisać predykcję tokenu.
- [ ] Podać rzędy skali GPT-1…3.
- [ ] Użyć metafory A4.
- [ ] Oddzielić skalę od „mądrości ludzkiej".