Okno kontekstu, pamięć i dosypywanie wiedzy (RAG)
🎯 Po co Ci to?
Model „pamięta" w rozmowie tylko to, co mieści się w oknie kontekstu — plus to, co ma w wagach z pretreningu (zastarzałe, niekompletne). Gdy potrzebujesz świeżych lub prywatnych faktów, dosypujesz je z zewnątrz (RAG).
✅ Czego się nauczysz
Po tej lekcji potrafisz:
- wyjaśnić okno kontekstu jako limit tokenów na wejściu;
- odróżnić „pamięć rozmowy" od wiedzy w wagach;
- opisać ideę RAG (wyszukaj → wklej do promptu → odpowiedz);
- wskazać, kiedy RAG pomaga, a kiedy nie zastąpi myślenia.
🔁 Przypomnij sobie
Wczesne LM miały sztywne krótkie okno (15.1–15.2). Transformer pozwala na dłuższy kontekst, ale skończony (tysiące–setki tysięcy tokenów zależnie od modelu). Kwadratowa złożoność uwagi (16.2) historycznie ograniczała długość.
📘 Okno kontekstu
📐 DEFINICJA — okno kontekstu: maksymalna liczba tokenów (prompt + historia rozmowy + odpowiedź), które model może przetworzyć naraz w jednym wywołaniu.
Po ludzku: ile tekstu „widzi" naraz. Powyżej limitu wcześniejsze fragmenty wypadają albo są ściśnięte — model „zapomina" początek długiej rozmowy.
Skutki praktyczne:
- wklejasz cały lektorat → część może nie wejść;
- długa rozmowa → model gubi ustalenia z początku;
- „pamiętasz, co mówiłem wczoraj?" — tylko jeśli system zapisał to poza modelem i znowu włożył do okna.
Wagi modelu to nie aktualna encyklopedia z datą dzisiejszą. Pytanie o wynik meczu z wczoraj bez narzędzi = zgadywanie z wzorców.
📘 RAG — Retrieval-Augmented Generation
📐 DEFINICJA — RAG: schemat: najpierw wyszukaj fragmenty z bazy / internetu / Twoich plików, potem doklej je do promptu, potem model generuje odpowiedź warunkowaną tym materiałem.
Po ludzku: podajesz ściągawkę z faktami, zanim model odpowie — zamiast liczyć, że „ma to w głowie".
Połączenie z wcześniejszą treścią: problem „odpowiedz zgodnie z prawdą na pytanie o stolicę" (Dział 17) łatwiej rozwiązać, gdy do promptu wejdzie zaufane źródło, a nie tylko wagi z 2021 roku.
Limity RAG: złe wyszukanie → złe źródło w kontekście → pewna halucynacja na bazie śmieci; model może zignorować wklejony tekst; nadal trzeba sprawdzać cytaty.

💭 Pomyśl
Czy powiększenie okna kontekstu do miliona tokenów usuwa halucynacje?
Podpowiedź
Nie. Większe okno = więcej miejsca na fakty jeśli je podasz. Model nadal generuje prawdopodobne tokeny; może zmyślać w lukach albo źle połączyć odległe fragmenty.
⚠️ Częsty błąd
Częsty błąd: „Model ma dostęp do internetu, więc zawsze jest na bieżąco."
Elenchus: Dostęp do sieci to narzędzie produktu (wyszukiwanie), nie właściwość samego transformera. Bez narzędzia — tylko wagi + okno.
🌍 Powiązania
- 15.2 / 16.2 — okno i koszt uwagi.
- 18.1 — RAG zmniejsza, nie kasuje ryzyka.
- 18.4 — agenci = RAG + narzędzia w pętli.
📐 Definicje tej lekcji
- Okno kontekstu — limit tokenów na wywołanie.
- RAG — retrieval + generacja.
- Wiedza w wagach vs w kontekście — zapamiętane w treningu vs podane teraz.
📌 Najważniejsze w pigułce
- Pamięć rozmowy = to, co w oknie (i co system doklei).
- Wagi ≠ aktualny świat.
- RAG dosypuje źródła do promptu.
- Źródła nadal trzeba krytycznie czytać.
🎒 Zadania
Zadanie 18.2.1. Uczennica prowadzi z modelem 40-stronicową rozmowę o projekcie. Na końcu model „zapomina" ustalony temat. Co najpewniej się stało?
Pokaż rozwiązanie
Wypadnięcie wczesnych wiadomości poza okno kontekstu (albo agresywne streszczanie historii przez aplikację). Rozwiązanie: przypomnieć kluczowe ustalenia / wkleić krótkie brief na nowo.
Zadanie 18.2.2. Opisz trzema krokami RAG dla pytania „Co mówi nasz regulamin szkoły o telefonach?".
Pokaż rozwiązanie
(1) Znajdź fragmenty regulaminu o telefonach. (2) Wklej je do promptu z pytaniem. (3) Poproś o odpowiedź tylko na podstawie wklejonego tekstu + cytat.
🔍 Sprawdź, czy umiesz
- [ ] Zdefiniować okno kontekstu.
- [ ] Odróżnić wagi od kontekstu.
- [ ] Opisać RAG.
- [ ] Wskazać limity RAG.