Zamknięcie działu 17

Słowniczek działu

  • GPT — Generative Pre-trained Transformer; LM na dekoderze.
  • Predykcja następnego tokenu — silnik pretreningu.
  • Pretrening / fine-tuning — najpierw język, potem zadanie.
  • Prompt — wejście użytkownika / początek ciągu.
  • SFT — supervised fine-tuning na parach Q→A.
  • Ranking / pary lepsza–gorsza — dane preferencji.
  • Model nagród (RM) — (prompt, odpowiedź) → ocena.
  • RL / polityka / nagroda — uczenie ze wzmocnieniem.
  • RLHF — RL z feedbackiem ludzkim przez RM.
  • ChatGPT — produkt po RLHF + czat (XI 2022).

W pigułce

  • Skala robi z transformera LLM.
  • LLM bez douczenia „szyje" zamiast słuchać.
  • SFT: człowiek pokazuje jak odpowiadać.
  • RM + RLHF: człowiek ocenia, maszyna optymalizuje nagrody.
  • ChatGPT = ta ścieżka + prosty interfejs → szok adopcji 2022.
  • Część IV domyka się tu: od słów-jako-liczb do asystenta. Część V pyta o granice.

Sprawdzian działowy

  1. Opisz predykcję tokenu i podaj rzędy skali GPT-1…GPT-3 (z metaforą A4).
  2. Na przykładzie Stasia Tarkowskiego wyjaśnij lukę surowego LLM.
  3. Porównaj SFT i RM: dane, cel, wyjście modelu.
  4. Zmapuj stan/działanie/politykę/nagrodę w RLHF i rolę kary względem SFT.
  5. Czym ChatGPT różni się od GPT-3 jako doświadczenia użytkownika i jako pipeline'u treningu?

CZĘŚĆ V — Granice, umysł, społeczeństwo