Skala: parametry, dane, prawa skalowania

🎯 Po co Ci to?

Architektura bez skali to ciekawostka. Skala bez tej architektury (na czystym LSTM) była zbyt droga. Razem dały erę LLM. Ta jednostka domyka most do GPT — bez wchodzenia jeszcze w RLHF.

✅ Czego się nauczysz

Po tej lekcji potrafisz:

  • powiedzieć, co znaczy „duży" model (parametry, dane, compute);
  • wyjaśnić intuicję praw skalowania: więcej zasobów → przewidywalnie lepsza predykcja (w pewnym reżimie);
  • powiązać paralelizm transformera z możliwością skalowania;
  • wskazać limit: sama skala nie robi jeszcze asystenta (potrzebne douczanie — 17).

🔁 Przypomnij sobie

13.1–13.2: GPU + dane. 15–16: od okna LM do transformera. Model językowy = przewiduj następny token.

📘 Trzy dźwignie

Po 2017 laboratoria zaczęły pchać jednocześnie:

Dźwignia Sens
Parametry ile wag ma sieć (pojemność)
Dane ile tokenów tekstu w pretreningu
Compute ile obliczeń (GPU-czas) poświęcono na trening

Empirycznie obserwowano regularności (scaling laws): w szerokim zakresie inwestycja w te dźwignie przewidywalnie obniża błąd predykcji następnego tokenu. Nie jest to prawo fizyki wyryte w kamieniu — to empiria z krzywych treningu — ale wystarczyła, by usprawiedliwić budowę coraz większych modeli.

Transformer na to pozwala, bo trening nie jest uduszony sekwencyjnością RNN. W 2018 OpenAI pokazuje GPT-1 (Generative Pretrained Transformer): dekoderowy transformer uczony jako model językowy. Potem GPT-2 (2019) — na tyle mocny, że przez chwilę wahano się z pełnym udostępnieniem („too dangerous to release" w narracji mediów i laboratorium). To wciąż nie ChatGPT: brakuje warstwy „odpowiadaj jak asystent" (Dział 17).

📐 DEFINICJA — prawa skalowania (intuicja): empiryczne zależności: jakość modelu językowego (np. błąd predykcji) poprawia się w miarę wzrostu parametrów, danych i compute — w pewnym zakresie w sposób regularny.

📐 DEFINICJA — LLM (large language model): model językowy o dużej skali parametrów i danych, zwykle oparty o transformera.

💭 Pomyśl

Jeśli większy model lepiej przewiduje następny token na internecie, czy automatycznie lepiej mówi prawdę?

Podpowiedź

Nie. Internet zawiera błędy, mity i sprzeczności. Lepsza predykcja stylu i wzorców ≠ gwarancja faktów. Stąd później filtry, narzędzia, douczanie — i ostrożność w Części V.

⚠️ Częsty błąd

Częsty błąd: „Wystarczy dołożyć parametry — reszta (bezpieczeństwo, instrukcje, dialog) wyłoni się sama."

Elenchus: Surowy LM dokańcza tekst, także toksyczny lub zbędny. ChatGPT powstał dopiero po douczeniu na instrukcjach i preferencjach ludzi (17.2–17.5).

🌍 Powiązania

  • 13 — warunki sprzętowo-danowe.
  • 17.1 — linia GPT jako skalowanie dekoderowego transformera.
  • 18 — co model potrafi / czego nie, mimo skali.

📐 Definicje tej lekcji

  • Parametry / dane / compute — trzy osie skali.
  • Scaling laws — empiryczne krzywe poprawy.
  • GPT-1/2 — wczesne skalowanie dekoderowego LM.

📌 Najważniejsze w pigułce

  • Transformer odblokował skalę dzięki paralelizmowi.
  • Jakość LM rośnie z parametrami, danymi i mocą (w reżimie praw skalowania).
  • GPT-1/2 = ta architektura × skala; jeszcze nie „chat".
  • Asystent = następny dział (pretrening + SFT + RLHF).

🎒 Zadania

Zadanie 16.5.1. Ułóż jedno zdanie: „Transformer był warunkiem koniecznym skali, bo…".

Pokaż rozwiązanie

…bo usunął sekwencyjne wąskie gardło RNN i pozwolił efektywnie żuć ogromne korpusy na GPU.

Zadanie 16.5.2. (podsumowujące dział) W sześciu punktach: problem seq2seq → decyzja 2017 → uwaga → pozycje → przebieg tłumaczenia → skala → zapowiedź 17.

Pokaż rozwiązanie

(1) seq2seq drogi i słaby na długim tekście. (2) Transformer: bez RNN, z uwagą i pozycjami. (3) Multi-head waży wszystkie tokeny. (4) Sin/cos dodaje kolejność. (5) Enkoder/dekoder + Softmax generuje tłumaczenie. (6) Skala parametrów/danych/compute → GPT; chat wymaga douczenia.

🔍 Sprawdź, czy umiesz

  • [ ] Wymienić trzy dźwignie skali.
  • [ ] Opisać intuicję scaling laws.
  • [ ] Powiązać paralelizm z GPT-1/2.
  • [ ] Oddzielić surowy LM od asystenta.

Ucz się tej jednostki z asystentem