Halucynacje: dlaczego model kłamie z pełnym przekonaniem
🎯 Po co Ci to?
Najgroźniejsza wpadka nie brzmi jak błąd. Brzmi jak pewna, ładna odpowiedź. Zrozumienie mechanizmu chroni Cię lepiej niż lista „modele czasem się mylą".
✅ Czego się nauczysz
Po tej lekcji potrafisz:
- powiązać halucynację z predykcją następnego tokenu;
- odróżnić płynność / pewność stylu od prawdziwości;
- przywołać garbage in, garbage out z książki;
- powiedzieć, czego RLHF nie gwarantuje (17.4).
🔁 Przypomnij sobie
Model wybiera tokeny o wysokim prawdopodobieństwie (15.1). Softmax nie ma osobnego wyjścia „nie wiem, bo nie sprawdziłem w świecie". Douczenie (SFT/RLHF) zmienia preferowany styl odpowiedzi, nie instaluje wyroczni faktów.
📘 Prawdopodobne, nie prawdziwe
📐 DEFINICJA — halucynacja (w LLM): wygenerowanie treści przedstawionej jak fakt, która jest fałszywa, zmyślona lub niepoparta źródłem — przy zachowaniu płynnego, pewnego stylu.
Po ludzku: model „dopowiada" tak, jakby wiedział — bo tak wyglądają prawdopodobne ciągi tokenów. Czym to NIE jest: świadome kłamstwo z intencją; to uboczny skutek celu treningu.
W Dziale 17: bez dodatkowych zabiegów modele mogą generować treści nieprawdziwe, dyskryminujące lub niepomocne. Skoro uczyły się z tekstów zawierających błędy i mity, reprodukują wzorce — garbage in, garbage out.
Typowe objawy w szkole:
- zmyślona bibliografia / cytat z „artykułu", którego nie ma;
- daty i nazwiska „pasujące" do tematu, ale złe;
- pewny ton przy sprzecznych faktach.
RLHF (17.4) uczy preferowanych odpowiedzi korepetytorów — nie instaluje weryfikatora prawdy. Dlatego ChatGPT też potrafi halucynować; mniej „szyje" przy instrukcjach, ale nadal jest modelem językowym.
💭 Pomyśl
Dlaczego wymyślona pozycja literatury często wygląda bardziej wiarygodnie niż przyznanie „nie wiem"?
Podpowiedź
W danych treningowych eseje zwykle mają przypisy w standardowym formacie. Ciąg „Autor (rok). Tytuł. Wydawnictwo." jest bardzo prawdopodobny. Ciąg „Nie znam źródła" — rzadszy w „gotowych" pracach. Model optymalizuje wzorzec formy, nie istnienie książki w katalogu.
⚠️ Częsty błąd
Częsty błąd: „Jak brzmi pewnie, to sprawdziłem — model by się zawahał przy błędzie."
Elenchus: Czy Softmax ma osobny sygnał „wahania epistemicznego", czy tylko rozkład na tokeny? Pewność stylu ≠ pewność wiedzy.
🌍 Powiązania
- 17.2 — „szycie" vs instrukcja (pokrewne, inna oś).
- 18.2 — RAG: fakty spoza wag modelu.
- 22.3 — checklista krytycznego odbiorcy.
📐 Definicje tej lekcji
- Halucynacja — fałsz w pewnym stylu.
- GIGO — śmieci na wejściu treningu → śmieci we wzorcach wyjścia.
📌 Najważniejsze w pigułce
- Cel treningu = prawdopodobny tekst, nie prawda.
- Brak wbudowanego licznika „sprawdziłem w świecie".
- RLHF ≠ wyrocznia faktów.
- Bronisz się weryfikacją zewnętrzną, nie wyczuciem tonu.
🎒 Zadania
Zadanie 18.1.1. Podaj przykład szkolnego zadania, w którym halucynacja jest szczególnie groźna — i jedną konkretną metodę weryfikacji.
Pokaż rozwiązanie
Np. „Podaj trzy źródła o powstaniu styczniowym" → sprawdź każde w katalogu biblioteki / Google Scholar / podręczniku; nie ufaj samemu formatowi APA.
Zadanie 18.1.2. Wyjaśnij jednym zdaniem, dlaczego GIGO dotyczy także „ładnych" korpusów internetowych.
Pokaż rozwiązanie
Internet zawiera powtarzalne mity i błędy; model uczy się częstości wzorców, więc popularny fałsz może wygrać z rzadką prawdą.
🔍 Sprawdź, czy umiesz
- [ ] Zdefiniować halucynację bez moralizowania.
- [ ] Połączyć ją z predykcją tokenu.
- [ ] Oddzielić RLHF od weryfikacji faktów.
- [ ] Zaproponować weryfikację zewnętrzną.