Swin Transformer
Shifted Window Transformer for Vision · Ayrıca şöyle bilinir: Swin, Hierarchical Vision Transformer
Swin Transformer, Liu ve arkadaşları tarafından 2021 yılında tanıtılan hiyerarşik bir görüntü transformatörüdür. Bilgisayar görüşü görevlerinde güçlü performansını korurken hesaplama verimliliği elde etmek için kaydırılmış pencere dikkat mekanizmasını kullanır. Küresel öz-dikkat uygulayan orijinal Vision Transformer'ın aksine, Swin, ifade gücü ile verimliliği dengelemek için periyodik kaydırma ile yerel pencere tabanlı dikkat mekanizmasını kullanır.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Swin Transformer, özellikle küresel dikkatin hesaplama açısından aşırı maliyetli hale geldiği yüksek çözünürlüklü görüntülerde, nesne tespiti, anlamsal bölümleme ve örnek bölümleme gibi yoğun tahmin görevlerinde üstün performans gösterir. Hesaplama verimliliğinin kritik olduğu ve en son teknoloji doğruluğunun korunması gerektiği durumlarda tercih edilir. Hiyerarşik tasarımı, alt görevler (downstream tasks) için bir omurga (backbone) olarak uygun olmasını sağlar. Daha küçük modellerde görüntü sınıflandırması için veya hesaplamadan bağımsız olarak maksimum ifade gücüne ihtiyaç duyulduğunda Vision Transformer'lar gibi alternatifler kullanılabilir.
Güçlü yönler & sınırlılıklar
- Kaydırılmış pencere dikkat mekanizması sayesinde hesaplama verimliliği, görüntü çözünürlüğünde karmaşıklığı kareselden doğrusala düşürür.
- Güçlü hiyerarşik temsil, tespit ve bölümleme gibi alt görevlere doğal olarak uygundur.
- ImageNet, COCO ve ADE20K kıyaslama testlerinde en son teknoloji sonuçlar elde eder.
- Pencere boyutundaki esneklik, belirli uygulamalar için yerellik-küresellik dengesinin ayarlanmasına olanak tanır.
- Pencere tabanlı dikkat, küresel dikkat varyantlarına kıyasla uzun menzilli bağımlılık öğrenimini sınırlayabilir.
- Uygulama karmaşıklığı ve kod optimizasyon gereksinimleri, daha basit CNN temel çizgilerini aşar.
- Verimli CNN'lere göre performans kazanımları, bazı uygulamalar için artan uygulama yükünü haklı çıkarmayabilir.
SSS
Swin Transformer, Vision Transformer'dan nasıl farklıdır?
Vision Transformer, tüm yamalara küresel öz-dikkat uygulayarak karesel karmaşıklıkla sonuçlanır. Swin, CNN'ler gibi hiyerarşik bir yapıyı korurken doğrusal karmaşıklık elde etmek için periyodik kaydırma ile yerel pencere tabanlı dikkat kullanır. Vision Transformer tipik olarak sınıflandırma için kullanılırken, Swin yoğun tahmin görevlerinde üstün performans gösterir.
Kaydırılmış pencere nedir ve neden gereklidir?
Pencereler, verimli dikkat için görüntüyü yerel bölgelere ayırır. Pencereleri kaydırmak, bitişik bölgelerin etkileşime girebilmesi için bu sınırları periyodik olarak yerinden oynatır. Kaydırma olmadan, bir pencere sınırı ile ayrılmış bölgeler asla birbirine dikkat etmez, bu da modelin küresel bağlamı yakalama yeteneğini sınırlar.
Pencere boyutu nasıl seçilir?
Pencere boyutu, alıcı alan boyutu ile hesaplama maliyeti arasında bir denge kuran bir hiperparametredir. Tipik değerler 7 ila 14 piksel arasında değişir. Daha küçük pencereler hesaplamayı azaltır ancak uzun menzilli etkileşimleri sınırlar; daha büyük pencereler hesaplamayı artırır. Değer, görüntü çözünürlüğüne ve mevcut hesaplama gücüne göre ayarlanmalıdır.
Kaynaklar
- Liu, Z., Lin, Y., Cao, Y., Hu, H., Wei, Y., Zhang, Z., Lin, S., & Guo, B. (2021). Swin Transformer: Hierarchical vision transformer using shifted windows. In Proceedings of the IEEE/CVF International Conference on Computer Vision (pp. 10012-10022). DOI: 10.1109/ICCV48922.2021.00986 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Shifted Window Transformer for Vision. ScholarGate. https://scholargate.app/tr/deep-learning/swin-transformer
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- DETR (Tespit Transformatörü)Derin öğrenme↔ karşılaştır
- Masked Autoencoders (MAE)Derin öğrenme↔ karşılaştır
- Vision MambaDerin öğrenme↔ karşılaştır
- Vision TransformerDerin öğrenme↔ karşılaştır