Mask R-CNN: Piksel Düzeyinde Maskelerle Örnek Bölütleme
Mask R-CNN (Instance Segmentation) · Ayrıca şöyle bilinir: Mask Region-based Convolutional Neural Network, Instance Segmentation R-CNN, He et al. 2017 Segmentation Model, Maske R-CNN
Mask R-CNN, Kaiming He, Georgia Gkioxari, Piotr Dollár ve Ross Girshick tarafından 2017'de Facebook AI Research (FAIR) bünyesinde tanıtılan bir örnek bölütleme (instance segmentation) derin öğrenme çerçevesidir. Tespit edilen her bir nesne örneği için ikili bir piksel düzeyi maskesi tahmin eden paralel bir dal ekleyerek Faster R-CNN'yi genişletir; bu sayede tek bir ileri geçişte (forward pass) nesne tespiti, sınıflandırması ve ince taneli bölütlemesi aynı anda gerçekleştirilebilir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Maske düzeyinde bireysel nesne örneklerini, yalnızca sınır kutularını veya anlamsal etiketleri değil, ayırt etmeniz gerektiğinde Mask R-CNN'yi kullanın. Tıbbi görüntü analizi (hücre sayımı, tümör sınırlaması), otonom sürüş (yaya silüetleri), uydu görüntüleri (bina ayak izleri) ve endüstriyel denetim için uygundur. Yeterli etiketlenmiş maske eğitim verisi varsayar. Yalnızca sınır kutularına ihtiyaç duyulduğunda (Faster R-CNN kullanın) veya örnek ayrımı olmaksızın anlamsal bölütlemenin yeterli olduğu durumlarda (FCN veya DeepLab kullanın) ideal değildir. Hesaplama açısından yoğundur; daha hafif alternatifler arasında YOLOv8-seg veya SOLO bulunur.
Güçlü yönler & sınırlılıklar
- Maske tahminini sınıflandırmadan temiz bir şekilde ayırarak her dalın kendi hedefi için optimize edilmesini sağlar
- RoIAlign, niceleme hatalarını ortadan kaldırarak RoIPool tabanlı öncüllere göre önemli ölçüde daha doğru maskeler elde eder
- Mimari değişikliği minimumda tutarak anahtar nokta tahmini gibi ek görevlere kolayca genişletilebilir
- ImageNet/COCO önceden eğitilmiş omurgalardan transfer öğrenme ile alanlar (tıbbi, uydu, robotik) arasında güçlü genelleme yeteneği
- Çıkarım sırasında yüksek hesaplama maliyeti: omurga üzerinden birden çok ileri geçiş artı öneri başına üç ayrı başlık
- Üretimi pahalı ve zaman alıcı olan büyük miktarda piksel düzeyinde etiketlenmiş eğitim verisi gerektirir
- Sabit ızgara maske çözünürlüğü (tipik olarak 28×28) çok küçük veya çok uzun nesneler için ince ayrıntı kurtarmayı sınırlar
- İki aşamalı tasarım, tek aşamalı örnek bölütleme yöntemlerine göre daha yüksek gecikme süresine sahiptir, bu da özel donanım olmadan gerçek zamanlı dağıtımı zorlaştırır
SSS
Mask R-CNN, FCN veya DeepLab gibi anlamsal bölütleme modellerinden nasıl farklıdır?
Anlamsal bölütleme, her piksele bir sınıf etiketi atar ancak aynı sınıftan farklı örnekleri ayırt etmez. Mask R-CNN, örnek bölütleme yapar: her bir nesneyi tespit eder, bir sınıf ve sınır kutusu atar ve her örnek için ayrı bir ikili maske tahmin eder. Üst üste binen iki yaya, birleştirilmiş bir anlamsal bölge yerine iki farklı maske alır.
RoIAlign neden kritiktir ve tam olarak neyi düzeltir?
RoIPool, havuzlama (pooling) yapmadan önce kayan nokta bölge koordinatlarını en yakın tam sayıya yuvarlar, bu da yarım hücreye kadar hizalanmama hatasına neden olur. Sınır kutusu tespiti için bu hata kabul edilebilir olsa da, piksel düzeyinde maskeler için tek piksellik bir hizalanmama bile kaliteyi gözle görülür şekilde bozar. RoIAlign, her havuzlama bölmesi içindeki tam alt piksel örnek noktalarında çift doğrusal enterpolasyon kullanarak yuvarlamayı tamamen önler ve özellikler ile görüntü pikselleri arasındaki uzamsal karşılığı korur.
Mask R-CNN video örnek bölütleme için kullanılabilir mi?
Mask R-CNN, bireysel kareler üzerinde çalışır ve yerleşik bir zamansal akıl yürütme yeteneği yoktur. Video için, kare başına maskeleri tipik olarak harici bir izleyici (örn. SORT, DeepSORT) ile eşleştirilir veya MaskTrack R-CNN veya VisTR gibi özel video örnek bölütleme çerçeveleri içinde tespit omurgası olarak kullanılır. Bu, temel modelin ötesinde ek mühendislik gerektirir.
Kaynaklar
- He, K., Gkioxari, G., Dollár, P., & Girshick, R. (2017). Mask R-CNN. IEEE International Conference on Computer Vision (ICCV), 2980–2988. DOI: 10.1109/ICCV.2017.322 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 2). Mask R-CNN (Instance Segmentation). ScholarGate. https://scholargate.app/tr/deep-learning/mask-rcnn
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Faster R-CNNDerin öğrenme↔ karşılaştır
- U-NetDerin öğrenme↔ karşılaştır