Masked Autoencoders (MAE)
Masked Autoencoders are Scalable Vision Learners · Ayrıca şöyle bilinir: MAE, Vision MAE
Masked Autoencoders (MAE), He ve arkadaşları tarafından 2021'de tanıtılan, rastgele görüntü yamalarını maskeleyip modelin eksik içeriği yeniden oluşturmasını eğiten bir öz-denetimli öğrenme yaklaşımıdır. Doğal dil işlemedeki (NLP) maskelenmiş dil modelleme paradigmasını vizyona uyarlayarak, MAE etiket gerektirmeyen zorlu bir yeniden oluşturma görevini çözerek zengin görsel temsiller öğrenir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
+2 tane daha
Ne zaman kullanılır
Maskelenmiş Otomatik Kodlayıcılar, etiketli verinin az veya elde edilmesi pahalı olduğu durumlarda öz-denetimli ön eğitim için idealdir. Sınıflandırma, tespit ve segmentasyon gibi aşağı akış görevlerine aktarılan görsel temsiller öğrenmek için olağanüstü iyi çalışırlar. MAE, gizlilik endişeleri veri etiketlemesini sınırladığında denetimli ön eğitime tercih edilir. Genellikle daha az ön eğitimle daha yüksek aşağı akış görev performansı elde ettikleri için büyük etiketli veri kümeleri mevcut olduğunda denetimli yöntemler kullanılır.
Güçlü yönler & sınırlılıklar
- Etiketlenmemiş görüntü verilerinden ölçekte öğrenmeyi sağlar, bu da onu ek açıklamaların eksik olduğu alanlar için pratik hale getirir
- Sınırlı etiketlerle ince ayar yapıldığında aşağı akış görevlerinde performansı artıran aktarılabilir temsiller öğrenir
- Asimetrik kodlayıcı-kodlayıcı tasarımı, simetrik mimarilere göre daha az hesaplama gerektirerek ön eğitimi verimli hale getirir
- Etiket kullanmadan ImageNet üzerinde denetimli ön eğitimle rekabetçi performans elde eder
- Yeniden oluşturma kaybı her zaman aşağı akış görev hedefleriyle uyumlu olmayabilir, dikkatli ince ayar gerektirir
- Maske oranı ve maskeleme stratejisi, farklı alanlar için ayarlanması gereken kritik hiperparametrelerdir
- Önceden eğitilmiş modeller, ön eğitim verilerinden önemli ölçüde farklı dağılımlara sahip görevlere iyi aktarılmayabilir
SSS
Vizyondaki maskeleme, NLP'deki maskelemeden nasıl farklıdır?
NLP'de belirteçler ayrık kelimeleri temsil eder. Vizyonda, yamalar çeşitli içerik içeren uzamsal bölgeleri temsil eder. Vizyon maskeleme, görüntüler yerel yapı içerdiğinden genellikle daha yüksek maske oranları (%60-75) kullanır; %75 yamayı maskelemek bile yeterli görünür bağlam bırakır. NLP genellikle belirteçlerin %15'ini maskeler. Görüntüler ayrıca ayrık belirteç tahmininden ziyade sürekli piksel değerlerinin yeniden oluşturulmasını gerektirir.
Kodlayıcı-kodlayıcı neden asimetriktir?
Kodlayıcı yalnızca görünür yamaları işleyerek hesaplamayı azaltır. Eğitim örneği başına bir kez çalışan kodlayıcı, eğitim verimliliğini önemli ölçüde etkilemeden daha ağır olabilir. Ön eğitimden sonra kodlayıcı atılır ve yalnızca kodlayıcı kullanılır. Bu tasarım, simetrik mimarilere göre daha iyi verimlilik-doğruluk dengesi sağlar.
Doğru maske oranı nedir?
Doğal görüntüler için %60-75 maske oranları en iyi sonucu verir. Daha yüksek maskeler (%80+), güçlü öğrenme sinyalleri sağlar ancak model için imkansız olabilir. Daha düşük maskeler (%30-50), daha az zorlayıcıdır ve daha az ayırt edici özellikler öğrenir. Optimal değer görüntü alanına bağlıdır; seyrek yapılı tıbbi görüntüler daha düşük oranlar gerektirebilir.
Kaynaklar
- He, K., Chen, X., Xie, S., Li, Y., Dollár, P., & Girshick, R. (2022). Masked autoencoders are scalable vision learners. In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (pp. 16000-16009). DOI: 10.1109/CVPR52688.2022.01553 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Masked Autoencoders are Scalable Vision Learners. ScholarGate. https://scholargate.app/tr/deep-learning/masked-autoencoders
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Gizil Yayılım ModelleriDerin öğrenme↔ karşılaştır
- SimCLRDerin öğrenme↔ karşılaştır
- Swin TransformerDerin öğrenme↔ karşılaştır
- Vision TransformerDerin öğrenme↔ karşılaştır