Detekce a segmentace objektů

Mask R-CNN architektura

Mask R-CNN je dvojstupňová architektura pro instance segmentation, která rozširuje Faster R-CNN o paralelnou vetvu predikujúcu binárnu masku pro každý detegovaný objekt. Region Proposal Network navrhne kandidátne oblasti, následné hlavy určia třídu, upravia bounding box a vytvoří pixelovou masku. Klúčovým prvkem je Roialign, který omezuje ztrátu prostorové přesnosti při výběru příznaků z regiónu. Model oddeluje jednotlivé inštance stejné třídy, ne pouze sémantické oblasti obrazu.

Poslední odborná revize
7. srpna 2026
Odborný garant
Miroslav Schmiedt
ID
AI-GEO-M-07

Odborná definice

Odborná definice

Mask R-CNN je dvojstupňová architektura pro instance segmentation, která rozširuje Faster R-CNN o paralelnou vetvu predikujúcu binárnu masku pro každý detegovaný objekt. Region Proposal Network navrhne kandidátne oblasti, následné hlavy určia třídu, upravia bounding box a vytvoří pixelovou masku. Klúčovým prvkem je Roialign, který omezuje ztrátu prostorové přesnosti při výběru příznaků z regiónu. Model oddeluje jednotlivé inštance stejné třídy, ne pouze sémantické oblasti obrazu.

Srozumitelné vysvětlení

Srozumitelné vysvětlení

Pokud jsou na fotografii tri autá, obyčajná segmentace může vyfarbit všechny pixely patriace autám jednou společnou třídou. Mask R-CNN nejprve najde každé auto jako samostatný objekt a potom preň vytvoří vlastní přesnou masku. Výstup proto obsahuje třídu, obdlžnik i tvar každé inštance. Také rozlišení je vhodné při počítaní kusů, robotickém uchopení nebo měření plochy objektu. Model je však výpočetně náročnejší a kvalita masiek závisí na přesnosti anotací i rozlišení vstupu.

Časté otázky

Časté otázky

Jak se Mask R-CNN liší od Faster R-CNN?

Faster R-CNN predikuje třídu a bounding box. Mask R-CNN přidává samostatnou konvoluční vetvu, která pro každý pozitivní region vytvoří masku objektu.

K čemu slouží Roialign?

Odebírá příznaky z navrhnutého regiónu bez hrubého zaokrúhlování souřadnic. Tím zachová lépe zarovnání mezi vstupním objektem a predikovanou maskou.

Potřebuje trénink pixelové masky?

Ano, pro plnohodnotnou vetvu segmentace jsou potřebné masky jednotlivých inštancií. Samotné bounding boxy nestačia na přímý dohled nad tvarem.

Dokáže model oddělit prekrývajúce se objekty?

Může, protože masky predikuje pro jednotlivé detekované regiony. Úspěch však závisí na viditelných črt, návrhů regionů a tréninkových příkladů prekrytia.

Je Mask R-CNN vhodný na zpracování videa v reálném čase?

Může být příliš pomalý pro prísne latence. Používá se optimalizace, menší backbone nebo rýchlejšia segmentačná architektura podle hardwaru a požadavků.

Související pojmy

Související pojmy

Zdroje a redakční stopa

Zdroje a redakční stopa

  • He et al., Mask R-CNN

Definícia je autorská odborná syntéza. Pri právnych a regulačných rozhodnutiach má prednosť aktuálne oficiálne znenie predpisu a posúdenie konkrétneho prípadu.