Halucynacje: dlaczego model kłamie z pełnym przekonaniem

🎯 Po co Ci to?

Najgroźniejsza wpadka nie brzmi jak błąd. Brzmi jak pewna, ładna odpowiedź. Zrozumienie mechanizmu chroni Cię lepiej niż lista „modele czasem się mylą".

✅ Czego się nauczysz

Po tej lekcji potrafisz:

  • powiązać halucynację z predykcją następnego tokenu;
  • odróżnić płynność / pewność stylu od prawdziwości;
  • przywołać garbage in, garbage out z książki;
  • powiedzieć, czego RLHF nie gwarantuje (17.4).

🔁 Przypomnij sobie

Model wybiera tokeny o wysokim prawdopodobieństwie (15.1). Softmax nie ma osobnego wyjścia „nie wiem, bo nie sprawdziłem w świecie". Douczenie (SFT/RLHF) zmienia preferowany styl odpowiedzi, nie instaluje wyroczni faktów.

📘 Prawdopodobne, nie prawdziwe

📐 DEFINICJA — halucynacja (w LLM): wygenerowanie treści przedstawionej jak fakt, która jest fałszywa, zmyślona lub niepoparta źródłem — przy zachowaniu płynnego, pewnego stylu.

Po ludzku: model „dopowiada" tak, jakby wiedział — bo tak wyglądają prawdopodobne ciągi tokenów. Czym to NIE jest: świadome kłamstwo z intencją; to uboczny skutek celu treningu.

W Dziale 17: bez dodatkowych zabiegów modele mogą generować treści nieprawdziwe, dyskryminujące lub niepomocne. Skoro uczyły się z tekstów zawierających błędy i mity, reprodukują wzorce — garbage in, garbage out.

Typowe objawy w szkole:

  • zmyślona bibliografia / cytat z „artykułu", którego nie ma;
  • daty i nazwiska „pasujące" do tematu, ale złe;
  • pewny ton przy sprzecznych faktach.

RLHF (17.4) uczy preferowanych odpowiedzi korepetytorów — nie instaluje weryfikatora prawdy. Dlatego ChatGPT też potrafi halucynować; mniej „szyje" przy instrukcjach, ale nadal jest modelem językowym.

💭 Pomyśl

Dlaczego wymyślona pozycja literatury często wygląda bardziej wiarygodnie niż przyznanie „nie wiem"?

Podpowiedź

W danych treningowych eseje zwykle mają przypisy w standardowym formacie. Ciąg „Autor (rok). Tytuł. Wydawnictwo." jest bardzo prawdopodobny. Ciąg „Nie znam źródła" — rzadszy w „gotowych" pracach. Model optymalizuje wzorzec formy, nie istnienie książki w katalogu.

⚠️ Częsty błąd

Częsty błąd: „Jak brzmi pewnie, to sprawdziłem — model by się zawahał przy błędzie."

Elenchus: Czy Softmax ma osobny sygnał „wahania epistemicznego", czy tylko rozkład na tokeny? Pewność stylu ≠ pewność wiedzy.

🌍 Powiązania

  • 17.2 — „szycie" vs instrukcja (pokrewne, inna oś).
  • 18.2 — RAG: fakty spoza wag modelu.
  • 22.3 — checklista krytycznego odbiorcy.

📐 Definicje tej lekcji

  • Halucynacja — fałsz w pewnym stylu.
  • GIGO — śmieci na wejściu treningu → śmieci we wzorcach wyjścia.

📌 Najważniejsze w pigułce

  • Cel treningu = prawdopodobny tekst, nie prawda.
  • Brak wbudowanego licznika „sprawdziłem w świecie".
  • RLHF ≠ wyrocznia faktów.
  • Bronisz się weryfikacją zewnętrzną, nie wyczuciem tonu.

🎒 Zadania

Zadanie 18.1.1. Podaj przykład szkolnego zadania, w którym halucynacja jest szczególnie groźna — i jedną konkretną metodę weryfikacji.

Pokaż rozwiązanie

Np. „Podaj trzy źródła o powstaniu styczniowym" → sprawdź każde w katalogu biblioteki / Google Scholar / podręczniku; nie ufaj samemu formatowi APA.

Zadanie 18.1.2. Wyjaśnij jednym zdaniem, dlaczego GIGO dotyczy także „ładnych" korpusów internetowych.

Pokaż rozwiązanie

Internet zawiera powtarzalne mity i błędy; model uczy się częstości wzorców, więc popularny fałsz może wygrać z rzadką prawdą.

🔍 Sprawdź, czy umiesz

  • [ ] Zdefiniować halucynację bez moralizowania.
  • [ ] Połączyć ją z predykcją tokenu.
  • [ ] Oddzielić RLHF od weryfikacji faktów.
  • [ ] Zaproponować weryfikację zewnętrzną.

Ucz się tej jednostki z asystentem