Detekcia a segmentácia objektov

Mask R-CNN

Mask R-CNN architektúra

Mask R-CNN je dvojstupňová architektúra pre instance segmentation, ktorá rozširuje Faster R-CNN o paralelnú vetvu predikujúcu binárnu masku pre každý detegovaný objekt. Region Proposal Network navrhne kandidátne oblasti, následné hlavy určia triedu, upravia bounding box a vytvoria pixelovú masku. Kľúčovým prvkom je RoIAlign, ktorý obmedzuje stratu priestorovej presnosti pri výbere príznakov z regiónu. Model oddeľuje jednotlivé inštancie rovnakej triedy, nie iba sémantické oblasti obrazu.

Posledná odborná revízia
1. augusta 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-M-07

Odborná definícia

Odborná definícia

Mask R-CNN je dvojstupňová architektúra pre instance segmentation, ktorá rozširuje Faster R-CNN o paralelnú vetvu predikujúcu binárnu masku pre každý detegovaný objekt. Region Proposal Network navrhne kandidátne oblasti, následné hlavy určia triedu, upravia bounding box a vytvoria pixelovú masku. Kľúčovým prvkom je RoIAlign, ktorý obmedzuje stratu priestorovej presnosti pri výbere príznakov z regiónu. Model oddeľuje jednotlivé inštancie rovnakej triedy, nie iba sémantické oblasti obrazu.

Zrozumiteľné vysvetlenie

Zrozumiteľné vysvetlenie

Ak sú na fotografii tri autá, obyčajná segmentácia môže vyfarbiť všetky pixely patriace autám jednou spoločnou triedou. Mask R-CNN najprv nájde každé auto ako samostatný objekt a potom preň vytvorí vlastnú presnú masku. Výstup preto obsahuje triedu, obdĺžnik aj tvar každej inštancie. Také rozlíšenie je vhodné pri počítaní kusov, robotickom uchopení alebo meraní plochy objektu. Model je však výpočtovo náročnejší a kvalita masiek závisí od presnosti anotácií aj rozlíšenia vstupu.

Časté otázky

Časté otázky

Ako sa Mask R-CNN líši od Faster R-CNN?

Faster R-CNN predikuje triedu a bounding box. Mask R-CNN pridáva samostatnú konvolučnú vetvu, ktorá pre každý pozitívny región vytvorí masku objektu.

Načo slúži RoIAlign?

Odoberá príznaky z navrhnutého regiónu bez hrubého zaokrúhľovania súradníc. Tým zachová lepšie zarovnanie medzi vstupným objektom a predikovanou maskou.

Potrebuje tréning pixelové masky?

Áno, pre plnohodnotnú vetvu segmentácie sú potrebné masky jednotlivých inštancií. Samotné bounding boxy nestačia na priamy dohľad nad tvarom.

Dokáže model oddeliť prekrývajúce sa objekty?

Môže, pretože masky predikuje pre jednotlivé detekované regióny. Úspech však závisí od viditeľných čŕt, návrhov regiónov a tréningových príkladov prekrytia.

Je Mask R-CNN vhodný na spracovanie videa v reálnom čase?

Môže byť príliš pomalý pre prísne latencie. Používa sa optimalizácia, menší backbone alebo rýchlejšia segmentačná architektúra podľa hardvéru a požiadaviek.

Súvisiace pojmy

Súvisiace pojmy

Zdroje a redakčná stopa

Zdroje a redakčná stopa

  • He et al., Mask R-CNN

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.