Skala: parametry, dane, prawa skalowania
🎯 Po co Ci to?
Architektura bez skali to ciekawostka. Skala bez tej architektury (na czystym LSTM) była zbyt droga. Razem dały erę LLM. Ta jednostka domyka most do GPT — bez wchodzenia jeszcze w RLHF.
✅ Czego się nauczysz
Po tej lekcji potrafisz:
- powiedzieć, co znaczy „duży" model (parametry, dane, compute);
- wyjaśnić intuicję praw skalowania: więcej zasobów → przewidywalnie lepsza predykcja (w pewnym reżimie);
- powiązać paralelizm transformera z możliwością skalowania;
- wskazać limit: sama skala nie robi jeszcze asystenta (potrzebne douczanie — 17).
🔁 Przypomnij sobie
13.1–13.2: GPU + dane. 15–16: od okna LM do transformera. Model językowy = przewiduj następny token.
📘 Trzy dźwignie
Po 2017 laboratoria zaczęły pchać jednocześnie:
| Dźwignia | Sens |
|---|---|
| Parametry | ile wag ma sieć (pojemność) |
| Dane | ile tokenów tekstu w pretreningu |
| Compute | ile obliczeń (GPU-czas) poświęcono na trening |
Empirycznie obserwowano regularności (scaling laws): w szerokim zakresie inwestycja w te dźwignie przewidywalnie obniża błąd predykcji następnego tokenu. Nie jest to prawo fizyki wyryte w kamieniu — to empiria z krzywych treningu — ale wystarczyła, by usprawiedliwić budowę coraz większych modeli.
Transformer na to pozwala, bo trening nie jest uduszony sekwencyjnością RNN. W 2018 OpenAI pokazuje GPT-1 (Generative Pretrained Transformer): dekoderowy transformer uczony jako model językowy. Potem GPT-2 (2019) — na tyle mocny, że przez chwilę wahano się z pełnym udostępnieniem („too dangerous to release" w narracji mediów i laboratorium). To wciąż nie ChatGPT: brakuje warstwy „odpowiadaj jak asystent" (Dział 17).
📐 DEFINICJA — prawa skalowania (intuicja): empiryczne zależności: jakość modelu językowego (np. błąd predykcji) poprawia się w miarę wzrostu parametrów, danych i compute — w pewnym zakresie w sposób regularny.
📐 DEFINICJA — LLM (large language model): model językowy o dużej skali parametrów i danych, zwykle oparty o transformera.
💭 Pomyśl
Jeśli większy model lepiej przewiduje następny token na internecie, czy automatycznie lepiej mówi prawdę?
Podpowiedź
Nie. Internet zawiera błędy, mity i sprzeczności. Lepsza predykcja stylu i wzorców ≠ gwarancja faktów. Stąd później filtry, narzędzia, douczanie — i ostrożność w Części V.
⚠️ Częsty błąd
Częsty błąd: „Wystarczy dołożyć parametry — reszta (bezpieczeństwo, instrukcje, dialog) wyłoni się sama."
Elenchus: Surowy LM dokańcza tekst, także toksyczny lub zbędny. ChatGPT powstał dopiero po douczeniu na instrukcjach i preferencjach ludzi (17.2–17.5).
🌍 Powiązania
- 13 — warunki sprzętowo-danowe.
- 17.1 — linia GPT jako skalowanie dekoderowego transformera.
- 18 — co model potrafi / czego nie, mimo skali.
📐 Definicje tej lekcji
- Parametry / dane / compute — trzy osie skali.
- Scaling laws — empiryczne krzywe poprawy.
- GPT-1/2 — wczesne skalowanie dekoderowego LM.
📌 Najważniejsze w pigułce
- Transformer odblokował skalę dzięki paralelizmowi.
- Jakość LM rośnie z parametrami, danymi i mocą (w reżimie praw skalowania).
- GPT-1/2 = ta architektura × skala; jeszcze nie „chat".
- Asystent = następny dział (pretrening + SFT + RLHF).
🎒 Zadania
Zadanie 16.5.1. Ułóż jedno zdanie: „Transformer był warunkiem koniecznym skali, bo…".
Pokaż rozwiązanie
…bo usunął sekwencyjne wąskie gardło RNN i pozwolił efektywnie żuć ogromne korpusy na GPU.
Zadanie 16.5.2. (podsumowujące dział) W sześciu punktach: problem seq2seq → decyzja 2017 → uwaga → pozycje → przebieg tłumaczenia → skala → zapowiedź 17.
Pokaż rozwiązanie
(1) seq2seq drogi i słaby na długim tekście. (2) Transformer: bez RNN, z uwagą i pozycjami. (3) Multi-head waży wszystkie tokeny. (4) Sin/cos dodaje kolejność. (5) Enkoder/dekoder + Softmax generuje tłumaczenie. (6) Skala parametrów/danych/compute → GPT; chat wymaga douczenia.
🔍 Sprawdź, czy umiesz
- [ ] Wymienić trzy dźwignie skali.
- [ ] Opisać intuicję scaling laws.
- [ ] Powiązać paralelizm z GPT-1/2.
- [ ] Oddzielić surowy LM od asystenta.