Odborná definícia
Význam a odborné vymedzenie pojmu
Word2Vec je rodina plytkých neurónových tréningových cieľov na učenie statických word embeddingov z lokálneho kontextu. Continuous Bag of Words predikuje cieľové slovo z okolitých slov, skip-gram predikuje okolité slová z centrálneho slova. Praktické implementácie používajú negative sampling alebo hierarchický softmax, subsampling častých slov a pohyblivé kontextové okno. Výsledkom je jedna tabuľka vektorov pre slovník, nie generatívny jazykový model schopný vytvárať text. Reprezentácie zachytávajú distribučné pravidelnosti korpusu, ale nerozlišujú význam slova podľa vety a slabo spracúvajú neznáme alebo veľmi zriedkavé výrazy.
Zrozumiteľné vysvetlenie
Ako sa pojem používa v praxi
Model dostane jednoduchú hru. Pri skip-gram vidí slovo banka a má odhadnúť, ktoré slová sa objavujú v jeho okolí. Po miliónoch príkladov sa jeho vektor posunie blízko výrazov s podobným použitím. CBOW robí opačný smer, z okolia odhaduje stred. Tréning je oveľa jednoduchší než pri dnešných transformeroch a výsledné vektory sa dajú rýchlo použiť v klasifikátore alebo na hľadanie podobných slov. Slovo banka však dostane jediný vektor, ktorý mieša finančnú inštitúciu aj breh rieky, preto moderné kontextové embeddingy riešia polysémiu lepšie.
Časté otázky
Otázky, ktoré spresňujú význam
Aký je rozdiel medzi CBOW a skip-gram?
CBOW skladá kontext a predikuje stredové slovo, skip-gram používa stredové slovo na predikciu okolia. Skip-gram býva vhodnejší pre zriedkavejšie výrazy, CBOW je rýchlejší.
Čo je negative sampling?
Namiesto výpočtu pravdepodobnosti nad celým slovníkom model rozlišuje skutočné dvojice slovo-kontext od malej vzorky náhodných negatívnych slov.
Prečo sa časté slová subsamplujú?
Výrazy ako a alebo je vytvárajú obrovské množstvo málo informatívnych dvojíc. Ich náhodné vynechávanie zrýchľuje tréning a zvýrazňuje obsahové vzťahy.
Vie Word2Vec vytvoriť embedding nového slova?
Základná verzia nie, ak slovo nebolo v slovníku. Subword metódy ako fastText skladajú reprezentáciu z častí slova a zvládajú neznáme tvary lepšie.
Na čo sa používa dnes?
Ako rýchly baseline, pri menších korpusoch, na inicializáciu, lexikálnu analýzu alebo tam, kde je potrebná malá statická tabuľka bez drahej kontextovej inferencie.
Súvisiace pojmy
Významové a tematické súvislosti
Pojem v rozhodovaní
Odborné články, ktoré tento pojem používajú v praxi
Zdroje a redakčná stopa
Použité východiská a odborná revízia
- Efficient Estimation of Word Representations in Vector Space
- TensorFlow, word2vec tutorial
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
