Zamknięcie działu 17
Słowniczek działu
- GPT — Generative Pre-trained Transformer; LM na dekoderze.
- Predykcja następnego tokenu — silnik pretreningu.
- Pretrening / fine-tuning — najpierw język, potem zadanie.
- Prompt — wejście użytkownika / początek ciągu.
- SFT — supervised fine-tuning na parach Q→A.
- Ranking / pary lepsza–gorsza — dane preferencji.
- Model nagród (RM) — (prompt, odpowiedź) → ocena.
- RL / polityka / nagroda — uczenie ze wzmocnieniem.
- RLHF — RL z feedbackiem ludzkim przez RM.
- ChatGPT — produkt po RLHF + czat (XI 2022).
W pigułce
- Skala robi z transformera LLM.
- LLM bez douczenia „szyje" zamiast słuchać.
- SFT: człowiek pokazuje jak odpowiadać.
- RM + RLHF: człowiek ocenia, maszyna optymalizuje nagrody.
- ChatGPT = ta ścieżka + prosty interfejs → szok adopcji 2022.
- Część IV domyka się tu: od słów-jako-liczb do asystenta. Część V pyta o granice.
Sprawdzian działowy
- Opisz predykcję tokenu i podaj rzędy skali GPT-1…GPT-3 (z metaforą A4).
- Na przykładzie Stasia Tarkowskiego wyjaśnij lukę surowego LLM.
- Porównaj SFT i RM: dane, cel, wyjście modelu.
- Zmapuj stan/działanie/politykę/nagrodę w RLHF i rolę kary względem SFT.
- Czym ChatGPT różni się od GPT-3 jako doświadczenia użytkownika i jako pipeline'u treningu?
CZĘŚĆ V — Granice, umysł, społeczeństwo