Modely a architektúry · Hlboké učenie a vizuálne architektúry

Konvolučná neurónová sieť

Convolutional neural network

Posledná odborná revízia
28. júla 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-C-21

Odborná definícia

Význam a odborné vymedzenie pojmu

Convolutional neural network je neurónová architektúra, ktorá používa zdieľané konvolučné filtre na spracovanie lokálnych vzorov v mriežkových dátach, najmä obrazoch. Filter sa posúva po vstupe a vytvára feature mapu, vďaka čomu rovnaký detektor hrany alebo textúry funguje na rôznych pozíciách. Vrstvy postupne skladajú lokálne príznaky do komplexnejších reprezentácií a môžu používať pooling, stride, dilation či reziduálne bloky. CNN poskytuje silný induktívny bias pre lokalitu a transláciu, ale jej výkon stále závisí od dát, mierky a cieľovej úlohy.

Zrozumiteľné vysvetlenie

Ako sa pojem používa v praxi

Namiesto samostatného učenia vzoru pre každý pixel používa CNN malý filter, ktorý prechádza celým obrázkom. Ten istý filter môže nájsť zvislú hranu vľavo aj vpravo. Ďalšia vrstva kombinuje hrany na rohy, tvary a nakoniec časti objektu. Zdieľanie váh výrazne znižuje počet parametrov oproti plne prepojenej sieti. Model však nie je automaticky odolný voči ľubovoľnému otočeniu, zmene mierky alebo novému typu kamery. Tieto vlastnosti sa podporujú dátami, augmentáciou a návrhom architektúry.

Časté otázky

Otázky, ktoré spresňujú význam

Čo je kernel alebo konvolučný filter?

Malá matica naučiteľných váh, ktorá sa aplikuje na lokálne okno vstupu. Výsledkom je aktivácia vyjadrujúca zhodu s naučeným vzorom. Hlbšia vrstva má filtre nad viacerými kanálmi a vytvára nové feature maps.

Na čo slúži stride?

Určuje, o koľko pozícií sa filter posunie. Väčší stride zmenší priestorové rozlíšenie a výpočet, ale môže stratiť jemné detaily. Jeho efekt sa podobá downsamplingu a musí zodpovedať minimálnej veľkosti dôležitého objektu.

Čo robí padding?

Pridá hodnoty okolo okraja vstupu, aby filter mohol spracovať aj hraničné pixely a aby sa riadila veľkosť výstupu. Zero padding je bežný, no na okrajoch vytvára umelý kontext. Iné úlohy môžu použiť reflection alebo valid režim.

Sú CNN nahradené vision transformermi?

Nie úplne. Vision transformery sú silné pri veľkých dátach a globálnych vzťahoch, CNN zostávajú efektívne v mnohých mobilných, priemyselných a menších úlohách. Moderné architektúry často kombinujú konvolúcie s attention alebo používajú podobné návrhové princípy.

Ako zistiť, čo CNN používa pri rozhodnutí?

Vizualizácie aktivácií, saliency mapy alebo Grad-CAM môžu ukázať citlivé oblasti. Nie sú však dokonalým kauzálnym vysvetlením a môžu byť nestabilné. Overenie zahŕňa oklúzne testy, kontrafaktuálne zmeny obrazu a doménovú kontrolu.

Súvisiace pojmy

Významové a tematické súvislosti

Pojem v rozhodovaní

Odborné články, ktoré tento pojem používajú v praxi

Zdroje a redakčná stopa

Použité východiská a odborná revízia

  • LeCun, Bottou, Bengio a Haffner, Gradient-Based Learning Applied to Document Recognition
  • Google Machine Learning Glossary

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.