Od GPT do ChatGPT

Wstęp do działu

Transformer (Dział 16) był architekturą. Ten dział opowiada, co się stało, gdy ktoś potraktował go poważnie i zaczął skalować — oraz dlaczego sam wielki model językowy wciąż nie jest asystentem.

Zobaczysz linię GPT: od 2018 do modeli, które piszą kod i eseje. Mechanizm zostaje ten sam: przewiduj następny token. Nikt nie wpisał gramatyki ani „wiedzy o świecie" ręcznie — wyłaniają się jako produkt uboczny predykcji na gigantycznej skali.

Potem sedno tej części przewodnika: surowy LLM potrafi dokończyć tekst, ale niekoniecznie wykonać instrukcję. Prompt „Napisz charakterystykę Stasia Tarkowskiego…" może dostać plan wypracowania zamiast charakterystyki — bo model traktuje prompt jak początek dokumentu do kontynuacji (garbage in, garbage out). Poznasz SFT (człowiek pisze wzorcowe odpowiedzi), model nagród (RM) (człowiek rankinguje) i RLHF (maszyna dostraja się pod nagrody). Zamyka listopad 2022: ChatGPT.

Mapa pojęć działu

       TRANSFORMER + SKALA (17.1)
      GPT-1 → … → GPT-3/4
      przewidź następny token
               |
      PRETRENING (17.2)
      internet → LLM „statystyczny"
      problem: prompt ≠ wykonana instrukcja
               |
      SFT (17.3)     40 korepetytorów, ~13k par Q→A
               |
      ranking + RM (17.3–17.4)
      lepsza/gorsza → model nagród
               |
      RLHF (17.4)    polityka + nagroda − kara za odejście od SFT
               |
      ChatGPT (17.5)  XI 2022 — skok do powszechnego użytku

Jednostki w tym dziale

  • 17.1 Linia GPT-1…GPT-4: skala i predykcja tokenu
  • 17.2 Pretrening: czytanie internetu słowo po słowie
  • 17.3 Człowiek doucza maszynę: instrukcje i przykłady (SFT)
  • 17.4 RLHF: maszyna doucza się z ludzkich ocen
  • 17.5 ChatGPT (2022) i skok do powszechnego użytku