Odborná definícia
Odborná definícia
Web scraping je programové načítanie webových stránok a extrakcia vybraných údajov z HTML, DOM, vložených štruktúr alebo sieťových odpovedí. V AI projektoch sa používa pri tvorbe korpusov, monitoringu, vyhľadávaní a obohacovaní dát. Technická schopnosť načítať stránku neznamená oprávnenie obsah ukladať, kombinovať alebo použiť na tréning. Návrh musí zohľadniť robots.txt, podmienky služby, autorské právo, ochranu osobných údajov, rýchlostné limity, pôvod dát a zmeny štruktúry stránky.
Zrozumiteľné vysvetlenie
Zrozumiteľné vysvetlenie
Scraper je robotický zberač, ktorý navštívi stránku, nájde napríklad cenu, názov a dostupnosť a uloží ich do štruktúrovanej podoby. Kým človek vidí vizuálnu kartu produktu, program pracuje s HTML značkami alebo API volaniami. Problém vznikne, keď sa stránka zmení, údaje sa načítavajú až JavaScriptom alebo rovnaký text patrí viacerým položkám. Pri AI knowledge base treba okrem technickej extrakcie evidovať URL, čas získania, licenciu, povolený účel, deduplikáciu a možnosť odstránenia záznamu.
Časté otázky
Časté otázky
Je robots.txt právne povolenie na scraping?
Nie. Robots Exclusion Protocol vyjadruje preferencie crawlerov, ale nenahrádza licenciu, zmluvné podmienky, autorské právo ani pravidlá spracovania osobných údajov.
Kedy je vhodnejšie použiť API?
Ak poskytovateľ ponúka stabilné rozhranie s jasnými právami, autentifikáciou a limitmi. API znižuje krehkosť selektorov a často poskytuje presnejšiu štruktúru.
Ako sa zabraňuje duplicitám v korpuse?
Kombinuje sa kanonická URL, hash normalizovaného obsahu, detekcia near-duplicate dokumentov a evidencia verzií. Rovnaký článok môže existovať pod viacerými adresami.
Prečo treba ukladať čas získania?
Webový obsah sa mení. Časová stopa umožní vysvetliť, z akej verzie systém čerpal, obnoviť zdroj a rozhodnúť, či údaj potrebuje aktualizáciu.
Aké osobné údaje môže scraper neúmyselne zbierať?
Mená, kontakty, identifikátory, fotografie, názory alebo údaje odvodené z profilu. Pred zberom treba určiť právny základ, minimalizáciu a retenčné pravidlá.
Súvisiace pojmy
Súvisiace pojmy
Zdroje a redakčná stopa
Zdroje a redakčná stopa
- RFC 9309, Robots Exclusion Protocol
- W3C, Data on the Web Best Practices
Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.
