Okno kontekstu, pamięć i dosypywanie wiedzy (RAG)

🎯 Po co Ci to?

Model „pamięta" w rozmowie tylko to, co mieści się w oknie kontekstu — plus to, co ma w wagach z pretreningu (zastarzałe, niekompletne). Gdy potrzebujesz świeżych lub prywatnych faktów, dosypujesz je z zewnątrz (RAG).

✅ Czego się nauczysz

Po tej lekcji potrafisz:

  • wyjaśnić okno kontekstu jako limit tokenów na wejściu;
  • odróżnić „pamięć rozmowy" od wiedzy w wagach;
  • opisać ideę RAG (wyszukaj → wklej do promptu → odpowiedz);
  • wskazać, kiedy RAG pomaga, a kiedy nie zastąpi myślenia.

🔁 Przypomnij sobie

Wczesne LM miały sztywne krótkie okno (15.1–15.2). Transformer pozwala na dłuższy kontekst, ale skończony (tysiące–setki tysięcy tokenów zależnie od modelu). Kwadratowa złożoność uwagi (16.2) historycznie ograniczała długość.

📘 Okno kontekstu

📐 DEFINICJA — okno kontekstu: maksymalna liczba tokenów (prompt + historia rozmowy + odpowiedź), które model może przetworzyć naraz w jednym wywołaniu.

Po ludzku: ile tekstu „widzi" naraz. Powyżej limitu wcześniejsze fragmenty wypadają albo są ściśnięte — model „zapomina" początek długiej rozmowy.

Skutki praktyczne:

  • wklejasz cały lektorat → część może nie wejść;
  • długa rozmowa → model gubi ustalenia z początku;
  • „pamiętasz, co mówiłem wczoraj?" — tylko jeśli system zapisał to poza modelem i znowu włożył do okna.

Wagi modelu to nie aktualna encyklopedia z datą dzisiejszą. Pytanie o wynik meczu z wczoraj bez narzędzi = zgadywanie z wzorców.

📘 RAG — Retrieval-Augmented Generation

📐 DEFINICJA — RAG: schemat: najpierw wyszukaj fragmenty z bazy / internetu / Twoich plików, potem doklej je do promptu, potem model generuje odpowiedź warunkowaną tym materiałem.

Po ludzku: podajesz ściągawkę z faktami, zanim model odpowie — zamiast liczyć, że „ma to w głowie".

Połączenie z wcześniejszą treścią: problem „odpowiedz zgodnie z prawdą na pytanie o stolicę" (Dział 17) łatwiej rozwiązać, gdy do promptu wejdzie zaufane źródło, a nie tylko wagi z 2021 roku.

Limity RAG: złe wyszukanie → złe źródło w kontekście → pewna halucynacja na bazie śmieci; model może zignorować wklejony tekst; nadal trzeba sprawdzać cytaty.

Dłuższy kontekst w praktyce czatu — wciąż skończony
Dłuższy kontekst w praktyce czatu — wciąż skończony

💭 Pomyśl

Czy powiększenie okna kontekstu do miliona tokenów usuwa halucynacje?

Podpowiedź

Nie. Większe okno = więcej miejsca na fakty jeśli je podasz. Model nadal generuje prawdopodobne tokeny; może zmyślać w lukach albo źle połączyć odległe fragmenty.

⚠️ Częsty błąd

Częsty błąd: „Model ma dostęp do internetu, więc zawsze jest na bieżąco."

Elenchus: Dostęp do sieci to narzędzie produktu (wyszukiwanie), nie właściwość samego transformera. Bez narzędzia — tylko wagi + okno.

🌍 Powiązania

  • 15.2 / 16.2 — okno i koszt uwagi.
  • 18.1 — RAG zmniejsza, nie kasuje ryzyka.
  • 18.4 — agenci = RAG + narzędzia w pętli.

📐 Definicje tej lekcji

  • Okno kontekstu — limit tokenów na wywołanie.
  • RAG — retrieval + generacja.
  • Wiedza w wagach vs w kontekście — zapamiętane w treningu vs podane teraz.

📌 Najważniejsze w pigułce

  • Pamięć rozmowy = to, co w oknie (i co system doklei).
  • Wagi ≠ aktualny świat.
  • RAG dosypuje źródła do promptu.
  • Źródła nadal trzeba krytycznie czytać.

🎒 Zadania

Zadanie 18.2.1. Uczennica prowadzi z modelem 40-stronicową rozmowę o projekcie. Na końcu model „zapomina" ustalony temat. Co najpewniej się stało?

Pokaż rozwiązanie

Wypadnięcie wczesnych wiadomości poza okno kontekstu (albo agresywne streszczanie historii przez aplikację). Rozwiązanie: przypomnieć kluczowe ustalenia / wkleić krótkie brief na nowo.

Zadanie 18.2.2. Opisz trzema krokami RAG dla pytania „Co mówi nasz regulamin szkoły o telefonach?".

Pokaż rozwiązanie

(1) Znajdź fragmenty regulaminu o telefonach. (2) Wklej je do promptu z pytaniem. (3) Poproś o odpowiedź tylko na podstawie wklejonego tekstu + cytat.

🔍 Sprawdź, czy umiesz

  • [ ] Zdefiniować okno kontekstu.
  • [ ] Odróżnić wagi od kontekstu.
  • [ ] Opisać RAG.
  • [ ] Wskazać limity RAG.

Ucz się tej jednostki z asystentem