RAG, vyhledávání a znalostní báze

Dělení dokumentů na úseky

Chunking je rozdělení dokumentu nebo datového toku na menší jednotky, které lze samostatně indexovat, embedovat, vyhladávat nebo posielat modelu. V RAG systéme chunk nese text a metadata o zdroji, pozici, nadpise či oprávnění. Strategie může být pevná podle tokenů, rekurzívna, štruktúrna nebo sémantická a často používá překryv. Cílem není vytvořit co najmenšie kusy, ale zachovat významovou súdržnost při prijatelnej granularite, recalli, kontextovej ceně a přesnosti citování.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-C-10

Odborná definice

Odborná definice

Chunking je rozdělení dokumentu nebo datového toku na menší jednotky, které lze samostatně indexovat, embedovat, vyhladávat nebo posielat modelu. V RAG systéme chunk nese text a metadata o zdroji, pozici, nadpise či oprávnění. Strategie může být pevná podle tokenů, rekurzívna, štruktúrna nebo sémantická a často používá překryv. Cílem není vytvořit co najmenšie kusy, ale zachovat významovou súdržnost při prijatelnej granularite, recalli, kontextovej ceně a přesnosti citování.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Pokud se dvadsaťstranová smernica uloží jako jeden vektor, vyhledávání může najít dokument, ale model dostane mnoho nerelevantného textu. Pokud ji rozsekáte po každé vete, definice může zůstat v jednom chunke a výnimka v jiném. Dobré dělení respektuje nadpisy, odseky, tabulky a logické celky. Při odpovedi se vrátia pouze najvhodnejšie úseky spolu s názvem dokumentu a miestom původu. Velikost se nenastavuje pocitovo, ale experimentom nad reálnymi otázkami a meráním retrievalu i finálnej odpovědi.

Časté otázky

Časté otázky

Jaký velký má být chunk?

Neexistuje univerzálne číslo. Závisí na typu dokumentu, embeddingového modelu, otázek a množství kontextu, který aplikace skládá. Kratšie úseky zvyšují přesnost lokalizace, déle zachovávají souvislosti. Velikost se testuje spolu s top-k a rerankingom.

Na co slouží overlap?

Opakování okrajovej části v susednom chunke snižuje riziko, že důležitá věta nebo definice bude prerušená hranicou. Velký overlap však vytváří duplicity v indexe, zvyšuje cenu a může naplnit kontext téměř rovnakými pasážami.

Proč je štruktúrne dělení často lépe než pevný počet znaků?

Nadpisy, zoznamy, články zákona a tabulky nesou významové hranice. Štruktúrny chunker jejich využije a zachová čitatelnou jedničku. Pevná délka je jednoduchá a stabilní, ale může spojit dvě nesúvisiace témy nebo rozdelit jednu podmínku.

Jako chunkovat tabulky?

Tabulka potřebuje hlavičky, jednotky a kontext riadků. Někdy se uloží celý menší objekt, inokedy se vytvoří riadkové úseky s opakovanou hlavičkou a súhrnom. Holé bunky bez názvů stlpců mají slabou interpretačnou i retrievalovou hodnotu.

Jaké metadata má chunk obsahovat?

Minimálně stabilní ID dokumentu a úseku, název, sekci, verzi, datum, jazyk, přístupové oprávnění a odkaz na originál. Metadata umožnia filtrování, citování, deduplikaci, aktualizaci indexu a odstranění neplatného obsahu.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • Microsoft Learn, Chunk Documents for Vector Search Microsoft Azure Architecture Center, RAG Chunking Phase

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.