ChatGPT (2022) i skok do powszechnego użytku

🎯 Po co Ci to?

Technicznie ChatGPT to (w uproszczeniu książki) model po RLHF na bazie linii GPT. Społecznie: listopad 2022 — technologia z laboratoriów staje się doświadczeniem dziesiątek/setek milionów ludzi w tygodnie.

✅ Czego się nauczysz

Po tej lekcji potrafisz:

  • złożyć pipeline: pretrening → SFT → RM → RLHF;
  • odróżnić GPT-3 (API, surowy LM) od ChatGPT (produkt dialogowy);
  • wskazać, co się zmieniło dla „zwykłego użytkownika";
  • zachować ostrożność: to nie koniec historii AI ani gwarancja prawdy.

🔁 Przypomnij sobie

Cały dział 17. Oś 2013–2017–2018 z wstępu rozdziału w LaTeXu.

📘 Złożenie

Etap Co powstaje
Pretrening LLM przewidujący token (GPT-3 itd.)
SFT model słuchający instrukcji na przykładach
Ranking + RM skorer ludzkich preferencji
RLHF polityka maksymalizująca nagrody → ChatGPT

ChatGPT nie jest „nowym transformerem". Jest douczonym modelem z linii GPT + interfejsem rozmowy, który obniżył próg wejścia do zera (przeglądarka, nie tylko API).

Skok 2022: nagle nauczyciel, uczeń, dziennikarz i programista dostali tego samego rozmówcę. Stąd fala zachwytu, paniki edukacyjnej i pytań o prawo / pracę — Części V–VI.

💭 Pomyśl

Co było większym przełomem dla społeczeństwa: sam GPT-3 w 2020, czy opakowanie go w czat z RLHF w 2022? Argumentuj.

Podpowiedź

GPT-3 już był mocny, ale dostęp i UX były dla deweloperów. ChatGPT złożył jakość odpowiedzi (RLHF) z prostotą czatu — adopcja masowa. Przełom społeczny ≠ wyłącznie przełom papieru naukowego.

⚠️ Częsty błąd

Częsty błąd: „Od 2022 AI myśli i ma wolną wolę."

Elenchus: Nadal predykcja tokenów + douczenie preferencji. Pytania o wolną wolę i umysł — Działy 18–19; nie wynikają automatycznie z popularności czatu.

🌍 Powiązania

  • 16–17 — techniczna droga.
  • 18–20 — granice, umysł, społeczeństwo.
  • 22 — Ty i AI na co dzień.

📐 Definicje tej lekcji

  • ChatGPT — produkt OpenAI (XI 2022): LM z linii GPT po SFT/RLHF + interfejs dialogowy.
  • Adopcja masowa — wejście technologii do codzienności poza labem.

📌 Najważniejsze w pigułce

  • Pipeline z książki: dane korepetytorów → SFT → RM → RLHF.
  • Chat ≠ surowy GPT-3.
  • 2022 = skok społeczny dzięki UX + douczeniu.
  • Dalej: limity i konsekwencje (Część V).

🎒 Zadania

Zadanie 17.5.1. Narysuj (słownie) cztery pudełka pipeline'u i strzałki między nimi.

Pokaż rozwiązanie

Pretrening LLM → SFT (wzorce) → RM (z rankingu) → RLHF (polityka + nagrody) → ChatGPT.

Zadanie 17.5.2. (podsumowujące dział) W pięciu zdaniach: od predykcji tokenu do ChatGPT, bez pominięcia luki „szycia".

Pokaż rozwiązanie

GPT skaluje transformera na predykcji następnego tokenu. Surowy LM płynnie kontynuuje tekst, także zamiast wykonać instrukcję (przykład Stasia). SFT uczy na ludzkich wzorcach Q→A. Ranking buduje RM oceniający odpowiedzi. RLHF dostraja politykę pod nagrody RM (z kotwicą SFT) — stąd ChatGPT i skok 2022.

🔍 Sprawdź, czy umiesz

  • [ ] Złożyć cały pipeline.
  • [ ] Odróżnić GPT-3 od ChatGPT.
  • [ ] Nazwać rolę XI 2022.
  • [ ] Nie mylić popularności z „umysłem".

Ucz się tej jednostki z asystentem