Yarı denetimli Görsel Dönüştürücü
Semi-supervised Vision Transformer (Semi-supervised ViT) · Ayrıca şöyle bilinir: Semi-supervised ViT, SSL-ViT, Semi-supervised Patch-based Transformer, Semi-supervised Self-Attention Image Model
Yarı denetimli Görsel Dönüştürücü (Semi-supervised Vision Transformer - SSViT), ViT'nin yama tabanlı öz-dikkat mimarisini, yalnızca etiketlenmiş görüntülerden oluşan küçük bir alt kümenin bulunduğu ortamlara uygular. Bu yaklaşım, büyük etiketlenmemiş veri kümelerinden, sözde-etiketleme (pseudo-labeling), tutarlılık düzenlemesi (consistency regularization) veya öz-denetimli ön-metin görevleri (self-supervised pretext tasks) yoluyla yararlanır ve ardından küçük etiketli küme üzerinde ince ayar (fine-tuning) yapılır. Bu yöntem, etiketlenmiş görüntüler az olduğunda bile denetimli öğrenmeye yakın doğruluk oranları elde eder.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Büyük miktarda etiketlenmemiş görüntü havuzunuz olduğunda ancak yalnızca küçük bir kısmının insan tarafından doğrulanmış etiketleri olduğunda ve ham sınıflandırma veya tanıma doğruluğunun birincil hedef olduğu durumlarda yarı denetimli ViT kullanın. Tıbbi görüntüleme, uydu görüntüleme veya ince taneli tür tanıma gibi küresel bağlamın önemli olduğu yüksek çözünürlüklü veya karmaşık görsel verilerde üstündür. Etiketli örneklerin sınıf başına birkaç yüzden az olduğu durumlarda, düz denetimli bir ViT'ye tercih edin. Etiketlenmiş verinin tam denetimli eğitim için yeterince bol olduğu durumlarda, hesaplama kaynaklarının ciddi şekilde kısıtlı olduğu durumlarda (ViT ön eğitimi pahalıdır) veya kararların kesin yorumlanabilirliğinin gerekli olduğu durumlarda kullanmayın — ViT dikkat haritaları nitel içgörü sunar ancak nicel katsayılar sunmaz.
Güçlü yönler & sınırlılıklar
- Güçlü temsiller oluşturmak için büyük etiketlenmemiş görüntü koleksiyonlarından yararlanır, etiketlenmiş veri gereksinimlerini önemli ölçüde azaltır.
- Öz-dikkat, CNN'lerin kaçırabileceği uzun menzilli uzamsal bağımlılıkları yakalar, karmaşık görsel sahnelerde performansı artırır.
- Önceden eğitilmiş kontrol noktaları (örneğin, MAE, DINO) kamuya açıktır, bu da öz-denetimli ön-metin aşamasını hızlı bir şekilde başlatmayı sağlar.
- İyi ölçeklenir: daha fazla etiketlenmemiş veri veya daha büyük ViT varyantları eklendikçe performans güvenilir bir şekilde iyileşir.
- Sözde-etiketleme ve tutarlılık düzenlemesi, standart ViT kod tabanlarının üzerine uygulamak için basittir.
- Birçok kıyaslama ortamında, etiketleme maliyetinin bir kısmı ile tam denetimli modellerle rekabetçidir.
- Hesaplama açısından pahalıdır: büyük ViT omurgalarını önceden eğitmek önemli GPU kaynakları ve eğitim süresi gerektirir.
- Dağıtım dışı (out-of-distribution) veya belirsiz görüntüler için sözde-etiket kalitesi düşer, potansiyel olarak erken hataları pekiştirir.
- ViT, eğitim verisi (etiketli veya etiketsiz) gerçekten küçük olduğunda CNN'lerden daha düşük performans gösterir, çünkü dönüştürücülerin iyi endüktif önyargılar (inductive biases) öğrenmesi için ölçeğe ihtiyacı vardır.
- Hiperparametre duyarlılığı: sözde-etiketler için güvenilirlik eşiği, artırma gücü ve denetimsiz kayıp ağırlığı hepsi etkileşir ve ayarlanması gerekir.
- Özellik tabanlı yöntemlerden daha az yorumlanabilir; dikkat haritaları sezgi sağlar ancak denetlenebilir karar kuralları sağlamaz.
SSS
Yarı denetimli ViT'nin iyi çalışması için kaç tane etiketlenmiş görüntüye ihtiyacım var?
Uygulamada, güçlü öz-denetimli ön eğitim (örneğin, DINO veya MAE) ile sınıf başına 1-10 kadar az etiketlenmiş örnek gösterilmiştir. Güvenilir sonuçlar genellikle sınıf başına 50-200 etiketle daha yaygındır, ancak bu büyük ölçüde veri kümesine bağlıdır. Her zaman aynı etiketli alt küme üzerinde tam denetimli bir CNN taban çizgisine karşı kıyaslayın.
Önceden eğitilmiş bir ViT kontrol noktasından mı başlamalıyım yoksa sıfırdan mı eğitmeli miyim?
Kamuya açık olarak mevcut olan önceden eğitilmiş bir kontrol noktasından (örneğin, ImageNet üzerinde MAE veya DINO ile önceden eğitilmiş ViT-B/16) başlamanız şiddetle tavsiye edilir. Sıfırdan eğitim, büyük miktarda etiketlenmemiş veri ve hesaplama gerektirir. Alanınız ImageNet'ten çok farklıysa, ince ayardan önce etiketlenmemiş verileriniz üzerinde alan uyarlamalı ön eğitim (domain-adaptive pre-training) önerilir.
Yarı denetimli ViT ile öz-denetimli ViT arasındaki fark nedir?
Öz-denetimli ViT, eğitim boyunca yalnızca etiketlenmemiş verileri kullanır ve tamamen ön-metin görevlerine dayanır. Yarı denetimli ViT, görev özel denetim için etiketlenmemiş verileri (temsil öğrenmesi veya sözde-etiketleme için) küçük bir etiketli küme ile birleştirir. Yarı denetimli eğitim, doğrudan aşağı akış sınıflandırma hedefini optimize ederken, öz-denetimli eğitim daha sonra ince ayarlanması gereken genel özellikler üretir.
ViT ile hangi yarı denetimli strateji en iyi çalışır: sözde-etiketleme mi yoksa tutarlılık düzenlemesi mi?
Her ikisi de etkilidir ve genellikle birleştirilir. Sözde-etiketleme (örneğin, ViT için uyarlanmış FixMatch), modelin güvenilirliği kalibre edilebildiğinde iyi çalışır. Tutarlılık düzenlemesi (örneğin, MixMatch, UDA), kalibrasyon sorunlarına karşı daha dayanıklıdır. Uygulamada, güçlü bir öz-denetimli ön eğitim aşamasını (MAE veya DINO) ince ayar adımında FixMatch tarzı sözde-etiketleme ile birleştirmek genellikle en iyi sonuçları verir.
Yarı denetimli ViT, ImageNet benzeri olmayan görüntü alanları için uygun mudur?
Evet, ancak daha fazla dikkat gerektirir. Doğal fotoğraflardan (örneğin, histopatoloji, X-ışınları, uydu görüntüleri) uzak alanlar için, genel bir ViT kontrol noktasını ince ayarlamak, alan verileri üzerinde sıfırdan eğitilmiş bir CNN'den daha düşük performans gösterebilir. Alan uyarlamalı ön eğitim — denetimli ince ayardan önce etiketlenmemiş alan görüntüleriniz üzerinde maskelenmiş görüntü modellemesi veya zıt ön eğitimi devam ettirmek — genellikle bu farkı kapatır.
Kaynaklar
- Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., Uszkoreit, J., & Houlsby, N. (2021). An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. International Conference on Learning Representations (ICLR 2021). link ↗
- Zhai, X., Kolesnikov, A., Houlsby, N., & Beyer, L. (2022). Scaling Vision Transformers. Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 12104–12113. link ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Semi-supervised Vision Transformer (Semi-supervised ViT). ScholarGate. https://scholargate.app/tr/deep-learning/semi-supervised-vision-transformer
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- İnce Ayarlı Vision TransformerDerin öğrenme↔ karşılaştır
- Görüntü SınıflandırmaDerin öğrenme↔ karşılaştır
- Öz-denetimli Görsel TransformerDerin öğrenme↔ karşılaştır
- Yarı denetimli BERT tabanlı SınıflandırmaDerin öğrenme↔ karşılaştır
- Vision TransformerDerin öğrenme↔ karşılaştır