Odborná definice
Odborná definice
Web scraping je programové načtení webových stránok a extrakce vybraných údajů z HTML, DOM, vložených štruktúr nebo sieťových odpovědí. V AI projektoch se používá při tvorbě korpusů, monitoringu, vyhledávání a obohacování dat. Technická schopnost načíst stránku neznamená oprávnění obsah ukladat, kombinovat nebo použít na trénink. Návrh musí zohladnit robots.txt, podmínky služby, autorské právo, ochranu osobních údajů, rýchlostné limity, původ dat a změny struktury stránky.
Srozumitelné vysvětlení
Srozumitelné vysvětlení
Scraper je robotický zberač, který navštívi stránku, najde například cenu, název a dostupnost a uloží jejich do štruktúrovanej podoby. Zatímco člověk vidí vizuálnu kartu produktu, program pracuje s HTML značkami nebo API volaniami. Problém vznikne, když se stránka změní, údaje se načítavají až Javascriptom nebo stejný text patří viacerým položkám. Při AI knowledge base je třeba kromě technickej extrakce evidovat URL, čas získání, licenci, povolený účel, deduplikaci a možnost odstranění záznamu.
Časté otázky
Časté otázky
Je robots.txt právně povolení na scraping?
Ne. Robots Exclusion Protocol vyjadřuje preference crawlerů, ale nenahrádza licenci, zmluvné podmínky, autorské právo ani pravidla zpracování osobních údajů.
Kdy je vhodnější použít API?
Pokud poskytovatel ponúka stabilní rozhraní s jasnými právami, autentifikací a limitmi. API snižuje krehkosť selektorů a často poskytuje presnejšiu strukturu.
Jak se zabraňuje duplicitám v korpuse?
Kombinuje se kanonická URL, hash normalizovaného obsahu, detekce near-duplicate dokumentů a evidence verzií. Stejný článek může existovat pod více adresami.
Proč je třeba ukladat čas získání?
Webový obsah se mění. Časová stopa umožní vysvetlit, z jaké verze systém čerpal, obnovit zdroj a rozhodnout, či údaj potřebuje aktualizaci.
Jaké osobní údaje může scraper neúmyselne zbierat?
Jména, kontakty, identifikátory, fotografie, názory nebo údaje odvozené z profilu. Před zberom je třeba určit právní základ, minimalizaci a retenčné pravidla.
Související pojmy
Související pojmy
Zdroje a redakční stopa
Zdroje a redakční stopa
- RFC 9309, Robots Exclusion Protocol
- W3C, Data on the Web Best Practices
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
