Zamknięcie działu 14

Słowniczek działu

  • Token / tokenizacja / słownik — jednostka tekstu, cięcie, lista unikalnych tokenów z indeksami.
  • Reprezentacja — sposób zapisu danych użyteczny do celu.
  • Kodowanie z gorącą jedynką (one-hot) — wektor zer z jedynką na pozycji indeksu.
  • Wektoryzacja tekstu — zamiana tekstu na wektory liczb.
  • Odległość euklidesowa — miara odległości między wektorami.
  • Hipoteza dystrybucyjna (Firth) — znaczenie z kontekstu użycia; „poznasz słowo po towarzystwie".
  • Okno kontekstu — sąsiedztwo wokół słowa docelowego.
  • word2vec (2013) — uczenie osadzeń z predykcji słowa w kontekście (Mikolov, Google).
  • Osadzenie słowa (embedding) — gęsty wektor reprezentujący słowo w przestrzeni znaczeń.
  • Analogia wektorowa — A − B + C ≈ D na osadzeniach.
  • Polisemia / stałe osadzenie — wiele znaczeń vs jeden wektor niezależny od zdania.

W pigułce

  • Sieć nie czyta — liczy; tekst trzeba zamienić na liczby.
  • One-hot jest prosty i zły do znaczenia: gubi kolejność, puchnie, nie koduje podobieństwa.
  • Ręczne cechy uczą intuicji geometrii znaczeń, ale nie skalują się.
  • Firth: sens z towarzystwa słów.
  • word2vec uczy osadzeń jako produktu ubocznego zgadywania słowa w oknie.
  • Geometria bywa zaskakująco bogata (analogie) — i ma twardą granicę: jeden napis = jeden punkt.
  • Dalej: model językowy i sekwencje (15), transformer z kontekstem (16).

Sprawdzian działowy

  1. Wyjaśnij trzema problemami, dlaczego one-hot nie wystarcza do „rozumienia" słów przez sieć.
  2. Policz (schematycznie) odległość euklidesową między dwoma wektorami 3D i zinterpretuj wynik.
  3. Opisz jednym akapitem CBOW: co jest wejściem, co wyjściem, skąd biorą się osadzenia.
  4. Rozwiąż słowami analogię „król − mężczyzna + kobieta" i powiedz, czego ten sukces nie dowodzi.
  5. Podaj przykład polisemii i wyjaśnij, dlaczego word2vec tu przegrywa, a transformer ma szansę wygrać.