Alan Adaptif Görsel Dönüştürücü
Domain-Adaptive Vision Transformer (DA-ViT) · Ayrıca şöyle bilinir: DA-ViT, Domain Adaptation with Vision Transformer, ViT with Domain Adaptation, Domain-Adaptive ViT
Alan Adaptif Görsel Dönüştürücü (DA-ViT), önceden eğitilmiş bir Görsel Dönüştürücü (Vision Transformer - ViT) omurgası üzerine düşman hizalaması, kendi kendine öğrenme veya dikkat seviyesi köprüleme gibi alan uyum tekniklerini uygulayarak etiketli bir kaynak alandan etiketlenmemiş veya az etiketlenmiş bir hedef alana görsel bilgiyi aktarır ve standart ViT ince ayarını sınırlayan dağılım kaymasını azaltır.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Etiketli bir kaynak veri kümeniz ve görsel olarak farklı ancak anlamsal olarak ilişkili bir alandan etiketlenmemiş (veya minimum düzeyde etiketlenmiş) bir hedef veri kümeniz olduğunda Alan Adaptif ViT'yi kullanın - örneğin, sentetikten gerçeğe görüntülere, gündüzden geceye manzaralara, bir tıbbi görüntüleme modalitesinden diğerine veya bir kurumun verilerini diğerine uyarlamak. Özellikle hedef alanda tam denetimli ince ayar için çok az etiket olduğunda etkilidir. Kaynak ve hedef alanlar neredeyse aynıysa (standart ince ayar yeterlidir), uyumlu önceden eğitilmiş bir omurga yoksa (örneğin, olağandışı giriş çözünürlüğü veya özel modalite) veya alan boşluğu o kadar büyükse ki kaynak alan etiket alanı hedefle anlamlı bir şekilde örtüşmüyorsa (örneğin, bir göğüs röntgeni modelini uydu görüntülerine uyarlamak) kullanmayın.
Güçlü yönler & sınırlılıklar
- Büyük önceden eğitilmiş ViT omurgalarından yararlanır, bu da uyumdan önce bile güçlü başlangıç temsilleri sağlar.
- Küresel kendi kendine dikkat, modelin yalnızca yerel dokuları değil, aynı zamanda bütünsel, bağlam-farkında özellikleri de hizalamasını sağlar, bu da genellikle CNN tabanlı alan uyumundan daha iyi performans gösterir.
- Tamamen denetimsiz uyum modunda çalışabilir - isteğe bağlı sözde etiketleme dışında hedef etiketleri gerekmez.
- Esnek mimari: düşman, optimal taşıma, karşıtlık veya dikkat düzenlemesi tabanlı hizalama eklenebilir.
- Dikkat haritaları, alan boşluğunu hangi görüntü bölgelerinin yönlendirdiğini hata ayıklamak için yorumlanabilir ipuçları sağlar.
- Birkaç standart kıyaslama üzerinde CNN tabanlı DA yöntemlerine göre üstün performans gösterdiği kanıtlanmıştır (Office-31, VisDA, DomainNet).
- Hesaplama açısından yoğundur: ViT omurgaları büyüktür ve alan ayrımcıları ile çok turlu kendi kendine öğrenme eklemek maliyeti önemli ölçüde artırır.
- İyi eşleşmiş bir önceden eğitilmiş kontrol noktası gerektirir; eğer mevcut değilse (örneğin, olağandışı giriş çözünürlüğü veya özel modalite), performans kazanımları sınırlı olabilir.
- Düşman eğitimi hiperparametrelere (lambda, öğrenme oranı çizelgeleri) duyarlıdır ve kararsız olabilir.
- Sözde etiketlerle kendi kendine öğrenme onay yanlılığı riski taşır: sözde etiketlerdeki erken hatalar birleşebilir.
- Değerlendirme önemsizdir - doğrulama için hedef etiketleri mevcut değildir, bu da hiperparametre seçimini ve erken durdurmayı zorlaştırır.
SSS
Herhangi bir etiketli hedef veriye ihtiyacım var mı?
Hayır - temel DA-ViT kurulumu denetimsiz alan uyumudur (UDA), eğitim sırasında sıfır hedef etiket gerektirir. İsteğe bağlı sözde etiketleme, insan ek açıklamaları yerine model tarafından oluşturulan etiketleri kullanır. Eğer birkaç hedef etiket bile mevcutsa, yarı denetimli veya az sayıda etiketli uyum varyantları genellikle daha fazla kazanç sağlar.
DA-ViT, hedef veriler üzerinde basitçe bir ViT'yi ince ayarlamaktan nasıl farklıdır?
İnce ayar, etiketli hedef veriler gerektirir ve dağılım kaymasını göz ardı eder. DA-ViT, hedef etiketler olmadan çalışır ve düşman veya diğer hizalama hedefleri aracılığıyla kaynak ve hedef özellik dağılımlarını açıkça hizalar, bu da hedef alanı etiketlemenin çok pahalı veya imkansız olduğu durumlarda uygulanabilir hale getirir.
Hangi ViT omurgasıyla başlamalıyım?
ImageNet-21k üzerinde önceden eğitilmiş ViT-B/16, en yaygın başlangıç noktasıdır ve performansı hesaplama ile dengeler. DeiT tabanlı kontrol noktaları daha hafiftir. Özel alanlar (tıbbi, uydu) için, alanlara özgü önceden eğitilmiş omurgalar (örneğin, radyoloji için BioViL) daha iyi bir başlangıç sağlayabilir.
Doğrulama için hedef etiketler olmadan düşman ağırlığı lambda'yı nasıl seçeceğim?
Yaygın uygulama, lambda'yı kaynak doğrulama doğruluğu (bir vekil) üzerinde yaklaşık 0.5 civarında bir alan sınıflandırıcı doğruluğu hedefiyle (başarılı karışıklığı gösterir) birlikte ayarlamaktır. Bazı çalışmalar, düşman aşamasını stabilize eden, eğitim sırasında lambda'yı kademeli olarak artıran bir çizelge kullanır.
DA-ViT'yi değerlendirmek için standart kıyaslama veri kümeleri nelerdir?
Office-31, Office-Home, VisDA-2017 ve DomainNet en yaygın kullanılanlardır. VisDA ve DomainNet, büyük ölçekli değerlendirme için tercih edilir çünkü uyum sağlamlığının stres testini yapan çoklu kaynak ve çoklu hedef senaryolarına modeli maruz bırakırlar.
Kaynaklar
- Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., ... & Houlsby, N. (2021). An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. International Conference on Learning Representations (ICLR). link ↗
- Yang, L., Balaji, Y., Lim, S. N., & Shrivastava, A. (2023). TVT: Transferable Vision Transformer for Unsupervised Domain Adaptation. Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV), 520-530. link ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Domain-Adaptive Vision Transformer (DA-ViT). ScholarGate. https://scholargate.app/tr/deep-learning/domain-adaptive-vision-transformer
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Alan-uyarlanmış BERT tabanlı SınıflandırmaDerin öğrenme↔ karşılaştır
- Alan-uyarlanmış Evrişimli Sinir AğıDerin öğrenme↔ karşılaştır
- İnce Ayarlı Vision TransformerDerin öğrenme↔ karşılaştır
- Semantik SegmentasyonDerin öğrenme↔ karşılaştır
- Vision TransformerDerin öğrenme↔ karşılaştır