Distribučná sémantika a NLP

rodina metod na učení slovních vektorů

Word2Věc je rodina plytkých neuronových tréninkových cílů na učení statických word embeddingů z lokálneho kontextu. Continuous Bag of Words predikuje cílové slovo z okolitých slov, skip-gram predikuje okolité slova z centrálneho slova. Praktické implementace používají negative sampling nebo hierarchický softmax, subsampling častých slov a pohyblivé kontextové okno. Výsledkem je jedna tabulka vektorů pro slovník, ne generativní jazykový model schopný vytvářet text. Reprezentace zachycují distribuční pravidelnosti korpusu, ale nerozlišují význam slova podle věty a slabo spracúvají neznámé nebo velmi vzácné výrazy.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-W-24

Odborná definice

Odborná definice

Word2Věc je rodina plytkých neuronových tréninkových cílů na učení statických word embeddingů z lokálneho kontextu. Continuous Bag of Words predikuje cílové slovo z okolitých slov, skip-gram predikuje okolité slova z centrálneho slova. Praktické implementace používají negative sampling nebo hierarchický softmax, subsampling častých slov a pohyblivé kontextové okno. Výsledkem je jedna tabulka vektorů pro slovník, ne generativní jazykový model schopný vytvářet text. Reprezentace zachycují distribuční pravidelnosti korpusu, ale nerozlišují význam slova podle věty a slabo spracúvají neznámé nebo velmi vzácné výrazy.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Model dostane jednoduchou hru. Při skip-gram vidí slovo banka a má odhadnout, které slova se objavují v jeho okolí. Po miliónoch příkladů se jeho vektor posune blízko výrazů s podobným použitím. CBOW dělá opačný směr, z okolia odhaduje střed. Trénink je ovela jednodušší než při dnešných transformerech a výsledné vektory se dají rychle použít v klasifikátore nebo na hladání podobných slov. Slovo banka však dostane jediný vektor, který mieša finančnou inštitúci i breh rieky, proto moderní kontextové embeddingy řeší polysémiu lépe.

Časté otázky

Časté otázky

Jaký je rozdíl mezi CBOW a skip-gram?

CBOW skládá kontext a predikuje stredové slovo, skip-gram používá stredové slovo na predikci okolia. Skip-gram bývá vhodnější pro zriedkavejšie výrazy, CBOW je rychlejší.

Co je negative sampling?

Místo výpočtu pravděpodobnosti nad celým slovníkem model rozlišuje skutečné dvojice slovo-kontext od malé vzorku náhodných negativních slov.

Proč se časté slova subsamplují?

Výrazy jako a nebo je vytvářejí obrovské množství málo informatívnych dvojic. Jejich náhodné vynechávání zrýchluje trénink a zvýrazňuje obsahové vztahy.

Ví Word2Věc vytvořit embedding nového slova?

Základní verze ne, pokud slovo nebolo v slovníku. Subword metody jako fasttext skladají reprezentaci z částí slova a zvládají neznámé tvary lépe.

Na co se používá dnes?

Jako rychlý baseline, při menších korpusoch, na inicializaci, lexikálnu analýzu nebo tam, kde je potřebná malá statická tabulka bez drahej kontextovej inference.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Efficient Estimation of Word Representations in Vector Space
  • TensorFlow, word2vec tutorial

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.