Kendi Kendine Denetimli Görüntü Sınıflandırma
Self-supervised Learning for Image Classification · Ayrıca şöyle bilinir: SSL image classification, contrastive visual representation learning, self-supervised visual learning, unsupervised pretraining for image classification
Kendi kendine denetimli görüntü sınıflandırma, derin bir görsel kodlayıcıyı büyük etiketlenmemiş görüntü veri kümeleri üzerinde, aynı görüntünün artırılmış iki görünümünün ne kadar benzer olduğunu tahmin etmek gibi vekil görevleri çözerek eğitir ve ardından yalnızca hafif bir sınıflandırıcı başlığı etiketli örnekler üzerinde ince ayar yapar. Yaklaşık 2020'de SimCLR ve MoCo gibi çerçeveler tarafından öncülük edilen bu yöntem, pahalı manuel etiketleme ihtiyacını önemli ölçüde azaltırken, tamamen denetimli modellere rakip doğruluk seviyelerine ulaşır.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Kendi kendine denetimli görüntü sınıflandırma, etiketli eğitim görüntülerinin az, elde edilmesi pahalı veya etik olarak kısıtlı olduğu, ancak büyük etiketlenmemiş görüntü koleksiyonlarının mevcut olduğu durumlarda tercih edilen yöntemdir. Tıbbi görüntüleme, uydu uzaktan algılama, endüstriyel denetim ve uzman etiketleme maliyetlerinin yüksek olduğu diğer alanlarda üstün başarı gösterir. Büyük, yüksek kaliteli etiketli bir veri kümesi zaten mevcut olduğunda ve hesaplama gücü sınırlı olduğunda daha az gereklidir, çünkü standart denetimli eğitim veya ImageNet'ten önceden eğitilmiş bir modelin ince ayarı yeterli olabilir. Alanın son derece dar olduğu ve etiketlenmemiş havuzun anlamlı temsiller öğrenmek için çok küçük olduğu veya özelliklerin yorumlanabilirliğinin katı bir gereklilik olduğu durumlarda uygulanmaktan kaçınılmalıdır.
Güçlü yönler & sınırlılıklar
- Etiketlenmemiş görüntülerden zengin, aktarılabilir görsel temsiller öğrenir, etiketleme maliyetini önemli ölçüde azaltır.
- Sınırlı etiket rejimlerinde denetimliye yakın veya hatta denetimli düzeyde doğruluk elde eder.
- Önceden eğitilmiş kodlayıcılar, aşağı akış görevleri arasında genelleşir ve birden çok sınıflandırma probleminde verimli ince ayar sağlar.
- Alan-spesifik ön eğitim (örn. tıbbi taramalar üzerinde), alan farkı büyük olduğunda ImageNet önceden eğitilmiş temel modellerden daha iyi performans gösterebilir.
- Karşıtlık tabanlı olmayan varyantlar (BYOL, DINO), büyük parti boyutlarına veya negatif madencilik stratejilerine olan ihtiyacı ortadan kaldırır.
- Ön eğitim, faydalı temsiller öğrenmek için büyük etiketlenmemiş görüntü korpusları ve önemli GPU hesaplama gücü gerektirir.
- Dikkatli artırma tasarımı kritik ve alana bağımlıdır; yanlış artırmalar temsil kalitesini düşürebilir.
- Farklı mimariler, artırma boru hatları ve eğitim bütçeleri nedeniyle yöntemler arası değerlendirme ve karşılaştırma karmaşıktır.
- Veriler yanlı ise, temsiller etiketlenmemiş havuzdan sahte korelasyonları kodlayabilir.
- Bol miktarda yüksek kaliteli etiket mevcut olduğunda, kendi kendine denetimli özellikler hala tamamen denetimli eğitimden daha düşük performans gösterebilir.
SSS
Ön eğitimin faydalı olması için ne kadar etiketlenmemiş veriye ihtiyaç vardır?
Faydalar genellikle on binlerce veya daha fazla etiketlenmemiş görüntü ile önemli hale gelir. Çok küçük etiketlenmemiş havuzlarla, mevcut halka açık kendi kendine denetimli bir kontrol noktasının (örn. ImageNet ölçekli ön eğitimden) ince ayarı, sıfırdan eğitimden genellikle daha pratiktir.
Karşıtlık tabanlı ve karşıtlık tabanlı olmayan kendi kendine denetimli yöntemler arasındaki fark nedir?
Karşıtlık tabanlı yöntemler (SimCLR, MoCo), negatif çiftler kullanarak farklı görüntülerin gömmelerini açıkça birbirinden uzaklaştırır; karşıtlık tabanlı olmayan yöntemler (BYOL, DINO), asimetrik ağlar, momentum kodlayıcılar veya merkezleme kullanarak negatiflerden kaçınır ve önemsiz çökmüş çözümleri önlemek için mimari kısıtlamalara güvenir.
Kendi kendine denetimli ön eğitim, ImageNet önceden eğitilmiş modellerin yerini alabilir mi?
Alana özgü görevler için, alan içi etiketlenmemiş veriler üzerinde kendi kendine denetimli ön eğitim, özellikle alan farkı büyük olduğunda (örn. tıbbi görüntüler), ImageNet önceden eğitilmiş modellerden genellikle daha iyi performans gösterir. Yeterli etiketlere sahip genel doğal görüntü görevleri için, her iki yaklaşım da rekabetçidir.
Hangi kodlayıcı mimarisini kullanmalıyım?
ResNet-50, tekrarlanabilirlik için yaygın bir temeldir. DINO veya MAE ile birleştirilmiş Görsel Dönüştürücüler (ViT) genellikle daha yüksek doğruluk elde eder ancak daha fazla hesaplama gücü gerektirir. Etiketlenmemiş veri kümenizin ölçeğine ve mevcut GPU bütçenize göre seçim yapın.
Doğrusal yoklama mı yoksa tam ince ayar mı daha iyi bir değerlendirme protokolüdür?
Her ikisi de önemlidir ve farklı şeyleri ölçer. Doğrusal yoklama, dondurulmuş temsillerin ne kadar doğrusal olarak ayrılabilir olduğunu test eder; tam ince ayar, tüm ağırlıklar güncellendiğinde tavan performansını ölçer. Yöntemleri karşılaştırırken her ikisini de rapor edin.
Kaynaklar
- Chen, T., Kornblith, S., Norouzi, M., & Hinton, G. (2020). A Simple Framework for Contrastive Learning of Visual Representations. Proceedings of the 37th International Conference on Machine Learning (ICML), PMLR 119, 1597–1607. link ↗
- He, K., Fan, H., Wu, Y., Xie, S., & Girshick, R. (2020). Momentum Contrast for Unsupervised Visual Representation Learning. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 9729–9738. DOI: 10.1109/CVPR42600.2020.00975 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Self-supervised Learning for Image Classification. ScholarGate. https://scholargate.app/tr/deep-learning/self-supervised-image-classification
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Üretken Çekişmeli AğDerin öğrenme↔ karşılaştır
- Bilgi DamıtmaDerin öğrenme↔ karşılaştır
- Transfer LearningMakine öğrenmesi↔ karşılaştır
- Vision TransformerDerin öğrenme↔ karşılaştır