Od GPT do ChatGPT
Wstęp do działu
Transformer (Dział 16) był architekturą. Ten dział opowiada, co się stało, gdy ktoś potraktował go poważnie i zaczął skalować — oraz dlaczego sam wielki model językowy wciąż nie jest asystentem.
Zobaczysz linię GPT: od 2018 do modeli, które piszą kod i eseje. Mechanizm zostaje ten sam: przewiduj następny token. Nikt nie wpisał gramatyki ani „wiedzy o świecie" ręcznie — wyłaniają się jako produkt uboczny predykcji na gigantycznej skali.
Potem sedno tej części przewodnika: surowy LLM potrafi dokończyć tekst, ale niekoniecznie wykonać instrukcję. Prompt „Napisz charakterystykę Stasia Tarkowskiego…" może dostać plan wypracowania zamiast charakterystyki — bo model traktuje prompt jak początek dokumentu do kontynuacji (garbage in, garbage out). Poznasz SFT (człowiek pisze wzorcowe odpowiedzi), model nagród (RM) (człowiek rankinguje) i RLHF (maszyna dostraja się pod nagrody). Zamyka listopad 2022: ChatGPT.
Mapa pojęć działu
TRANSFORMER + SKALA (17.1)
GPT-1 → … → GPT-3/4
przewidź następny token
|
PRETRENING (17.2)
internet → LLM „statystyczny"
problem: prompt ≠ wykonana instrukcja
|
SFT (17.3) 40 korepetytorów, ~13k par Q→A
|
ranking + RM (17.3–17.4)
lepsza/gorsza → model nagród
|
RLHF (17.4) polityka + nagroda − kara za odejście od SFT
|
ChatGPT (17.5) XI 2022 — skok do powszechnego użytku
Jednostki w tym dziale
- 17.1 Linia GPT-1…GPT-4: skala i predykcja tokenu
- 17.2 Pretrening: czytanie internetu słowo po słowie
- 17.3 Człowiek doucza maszynę: instrukcje i przykłady (SFT)
- 17.4 RLHF: maszyna doucza się z ludzkich ocen
- 17.5 ChatGPT (2022) i skok do powszechnego użytku