Dátové inžinierstvo a zber obsahu

Web scraping

automatizované získavanie údajov z webu

Web scraping je programové načítanie webových stránok a extrakcia vybraných údajov z HTML, DOM, vložených štruktúr alebo sieťových odpovedí. V AI projektoch sa používa pri tvorbe korpusov, monitoringu, vyhľadávaní a obohacovaní dát. Technická schopnosť načítať stránku neznamená oprávnenie obsah ukladať, kombinovať alebo použiť na tréning. Návrh musí zohľadniť robots.txt, podmienky služby, autorské právo, ochranu osobných údajov, rýchlostné limity, pôvod dát a zmeny štruktúry stránky.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-W-09

Odborná definícia

Odborná definícia

Web scraping je programové načítanie webových stránok a extrakcia vybraných údajov z HTML, DOM, vložených štruktúr alebo sieťových odpovedí. V AI projektoch sa používa pri tvorbe korpusov, monitoringu, vyhľadávaní a obohacovaní dát. Technická schopnosť načítať stránku neznamená oprávnenie obsah ukladať, kombinovať alebo použiť na tréning. Návrh musí zohľadniť robots.txt, podmienky služby, autorské právo, ochranu osobných údajov, rýchlostné limity, pôvod dát a zmeny štruktúry stránky.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Scraper je robotický zberač, ktorý navštívi stránku, nájde napríklad cenu, názov a dostupnosť a uloží ich do štruktúrovanej podoby. Kým človek vidí vizuálnu kartu produktu, program pracuje s HTML značkami alebo API volaniami. Problém vznikne, keď sa stránka zmení, údaje sa načítavajú až JavaScriptom alebo rovnaký text patrí viacerým položkám. Pri AI knowledge base treba okrem technickej extrakcie evidovať URL, čas získania, licenciu, povolený účel, deduplikáciu a možnosť odstránenia záznamu.

Časté otázky

Časté otázky

Je robots.txt právne povolenie na scraping?

Nie. Robots Exclusion Protocol vyjadruje preferencie crawlerov, ale nenahrádza licenciu, zmluvné podmienky, autorské právo ani pravidlá spracovania osobných údajov.

Kedy je vhodnejšie použiť API?

Ak poskytovateľ ponúka stabilné rozhranie s jasnými právami, autentifikáciou a limitmi. API znižuje krehkosť selektorov a často poskytuje presnejšiu štruktúru.

Ako sa zabraňuje duplicitám v korpuse?

Kombinuje sa kanonická URL, hash normalizovaného obsahu, detekcia near-duplicate dokumentov a evidencia verzií. Rovnaký článok môže existovať pod viacerými adresami.

Prečo treba ukladať čas získania?

Webový obsah sa mení. Časová stopa umožní vysvetliť, z akej verzie systém čerpal, obnoviť zdroj a rozhodnúť, či údaj potrebuje aktualizáciu.

Aké osobné údaje môže scraper neúmyselne zbierať?

Mená, kontakty, identifikátory, fotografie, názory alebo údaje odvodené z profilu. Pred zberom treba určiť právny základ, minimalizáciu a retenčné pravidlá.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • RFC 9309, Robots Exclusion Protocol
  • W3C, Data on the Web Best Practices

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.