Zamknięcie działu 14
Słowniczek działu
- Token / tokenizacja / słownik — jednostka tekstu, cięcie, lista unikalnych tokenów z indeksami.
- Reprezentacja — sposób zapisu danych użyteczny do celu.
- Kodowanie z gorącą jedynką (one-hot) — wektor zer z jedynką na pozycji indeksu.
- Wektoryzacja tekstu — zamiana tekstu na wektory liczb.
- Odległość euklidesowa — miara odległości między wektorami.
- Hipoteza dystrybucyjna (Firth) — znaczenie z kontekstu użycia; „poznasz słowo po towarzystwie".
- Okno kontekstu — sąsiedztwo wokół słowa docelowego.
- word2vec (2013) — uczenie osadzeń z predykcji słowa w kontekście (Mikolov, Google).
- Osadzenie słowa (embedding) — gęsty wektor reprezentujący słowo w przestrzeni znaczeń.
- Analogia wektorowa — A − B + C ≈ D na osadzeniach.
- Polisemia / stałe osadzenie — wiele znaczeń vs jeden wektor niezależny od zdania.
W pigułce
- Sieć nie czyta — liczy; tekst trzeba zamienić na liczby.
- One-hot jest prosty i zły do znaczenia: gubi kolejność, puchnie, nie koduje podobieństwa.
- Ręczne cechy uczą intuicji geometrii znaczeń, ale nie skalują się.
- Firth: sens z towarzystwa słów.
- word2vec uczy osadzeń jako produktu ubocznego zgadywania słowa w oknie.
- Geometria bywa zaskakująco bogata (analogie) — i ma twardą granicę: jeden napis = jeden punkt.
- Dalej: model językowy i sekwencje (15), transformer z kontekstem (16).
Sprawdzian działowy
- Wyjaśnij trzema problemami, dlaczego one-hot nie wystarcza do „rozumienia" słów przez sieć.
- Policz (schematycznie) odległość euklidesową między dwoma wektorami 3D i zinterpretuj wynik.
- Opisz jednym akapitem CBOW: co jest wejściem, co wyjściem, skąd biorą się osadzenia.
- Rozwiąż słowami analogię „król − mężczyzna + kobieta" i powiedz, czego ten sukces nie dowodzi.
- Podaj przykład polisemii i wyjaśnij, dlaczego word2vec tu przegrywa, a transformer ma szansę wygrać.