VGGNet (Çok Derin Evrişimli Ağlar)
Very Deep Convolutional Networks for Large-Scale Image Recognition (VGGNet) · Ayrıca şöyle bilinir: VGG, VGG-16, VGG-19, Very Deep ConvNet, Oxford Net
VGGNet, Karen Simonyan ve Andrew Zisserman tarafından 2014 yılında Oxford Üniversitesi Görsel Geometri Grubu'nda (Visual Geometry Group) tanıtılan derin evrişimli sinir ağı mimarisidir (ICLR 2015'te yayımlanmıştır). Ağ derinliğinin – yalnızca küçük 3x3 evrişimli filtrelerin istiflenmesiyle elde edilen – yüksek görüntü sınıflandırma doğruluğu için en kritik faktör olduğunu göstermiştir ve iki standart varyantı (VGG-16 ve VGG-19), 2010'ların ortalarında Evrişimli Sinir Ağı (CNN) tasarımı için baskın referans mimarileri haline gelmiştir.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
VGGNet, görüntü sınıflandırması veya aşağı akış görsel görevleri (nesne algılama, segmentasyon, stil aktarımı) için iyi anlaşılmış, tekrarlanabilir bir derin CNN mimarisi gerektiğinde uygundur. En az 32x32 piksel mekansal çözünürlüğe sahip görüntü verilerine en iyi şekilde uygulanır. Yeterli eğitim verisi veya transfer öğrenme için ImageNet ile önceden eğitilmiş ağırlıkların kullanılabilirliğini varsayar. VGGNet, kaynak kısıtlı dağıtımlar için uygun değildir – 138M parametresi önemli miktarda GPU belleği gerektirir – ve ham doğruluk açısından artık kalıtsal ağlar (ResNets) ve daha sonraki mimariler tarafından geride bırakılmıştır. Öncelikle yorumlanabilirlik ve tekrarlanabilirliğin öncelikli olduğu durumlarda kanonik bir referans veya transfer öğrenme omurgası olarak kullanın.
Güçlü yönler & sınırlılıklar
- Mimari basitlik: tek bir tekrarlanan yapı taşı (3x3 conv, ReLU, max-pool) tasarımı anlamayı, yeniden uygulamayı ve öğretmeyi kolaylaştırır.
- Derinliği doğruluk anahtarı olarak göstermesi, tüm sonraki CNN araştırmalarına rehberlik eden bir tasarım ilkesi oluşturmuştur.
- ImageNet ile önceden eğitilmiş ağırlıklar evrensel olarak mevcuttur ve çeşitli görsel görevlere iyi aktarılır, bu da VGGNet'i en çok kullanılan hazır özellik çıkarıcılardan biri haline getirir.
- Homojen filtre boyutları, ağ derinlikleri arasında doğrudan karşılaştırmaya olanak tanır, bu da onu CNN derinlik çalışmaları için kanonik bir ablasyon referansı yapar.
- Geniş topluluk benimsemesi: her büyük derin öğrenme çerçevesinde (PyTorch, TensorFlow, Keras) yayınlanmış uygulamaları mevcuttur.
- Çok büyük parametre sayısı: VGG-16 yaklaşık 138 milyon, VGG-19 ise yaklaşık 144 milyon parametreye sahiptir, bu da önemli miktarda GPU belleği ve hesaplama gücü gerektirir.
- Sıfırdan eğitmek hesaplama açısından pahalıdır; çıkarım (inference) da MobileNet veya EfficientNet gibi daha sonraki verimli mimarilere göre daha yavaştır.
- Atlama bağlantıları veya kalıtsal yolların olmaması: VGGNet'teki gradyanların her katmandan sırayla akması gerekir, bu da çok derin varyantların eğitimini ResNet'e göre daha zor hale getirir.
- Kalıtsal ağlar, Inception ve dikkat tabanlı mimariler tarafından doğruluk açısından geride bırakılmıştır.
- Önemli sıkıştırma veya damıtma (distillation) olmadan mobil veya kenar (edge) dağıtımı için uygun değildir.
SSS
VGG-16 ve VGG-19 arasındaki fark nedir?
VGG-16, 16 ağırlık katmanına (13 evrişimli + 3 tam bağlı) ve yaklaşık 138 milyon parametreye sahiptir. VGG-19, 19 ağırlık katmanına (16 evrişimli + 3 tam bağlı) ve yaklaşık 144 milyon parametreye sahiptir. VGG-19, ek hesaplama maliyeti karşılığında ImageNet üzerinde marjinal olarak daha iyi doğruluk elde eder. Her ikisi de aynı mimari ilkelere sahiptir; fark, VGG-19'un dördüncü ve beşinci bloklarındaki üç ek evrişimli katmandır.
VGGNet neden yalnızca 3x3 filtreler kullanıyor?
Ardışık iki 3x3 katman, tek bir 5x5 katmanla aynı etkili alıcı alanına sahiptir ve üç ardışık 3x3 katman 7x7 katmanla eşleşir. 3x3 yığını, bunu daha az parametreyle (5x5 için 2×9C²'ye karşılık 25C², burada C kanal sayısıdır) başarır ve aralarına daha fazla doğrusal olmayan aktivasyon ekleyerek ağın temsil kapasitesini artırır. Bu, Simonyan ve Zisserman (2014) tarafından bildirilen temel tasarım içgörüsüydü.
VGGNet hala son teknoloji mi?
Hayır. VGGNet 2014'te son teknolojiydi. ResNet (2016), Inception, DenseNet, EfficientNet ve görsel transformatörler tarafından doğruluk-parametre verimliliği açısından önemli ölçüde geride bırakılmıştır. VGGNet, öğretici bir örnek, bir transfer öğrenme referansı ve stil aktarımı algoritmalarında bir bileşen olarak değerli kalmaya devam etmektedir, ancak parametre başına doğruluğun önemli olduğu yeni sınıflandırma referansları için ilk tercih olmamalıdır.
Kendi veri kümem için VGGNet'i nasıl ince ayarlamalıyım?
ImageNet ile önceden eğitilmiş ağırlıkları yükleyin, erken evrişimli katmanları (genel düşük seviyeli özellikleri yakalayan) dondurun ve sonraki katmanları ve tam bağlı sınıflandırıcıyı hedef veri kümeniz üzerinde ince ayarlayın. Girdi görüntülerinizi ImageNet ortalaması (RGB: 123.68, 116.78, 103.94) ve standart sapması kullanarak normalleştirin. Önceden eğitilmiş temsilleri bozmaktan kaçınmak için sıfırdan eğitimden daha düşük bir öğrenme oranı (genellikle 1e-4 veya daha az) kullanın.
Kaynaklar
- Simonyan, K., & Zisserman, A. (2014). Very Deep Convolutional Networks for Large-Scale Image Recognition. arXiv:1409.1556 [cs.CV]. Published at ICLR 2015. DOI: 10.48550/arXiv.1409.1556 ↗
- Goodfellow, I., Bengio, Y., & Courville, A. (2016). Deep Learning (Ch. 9: Convolutional Networks). MIT Press. ISBN: 978-0-262-03561-3
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Very Deep Convolutional Networks for Large-Scale Image Recognition (VGGNet). ScholarGate. https://scholargate.app/tr/deep-learning/vggnet
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- YoğunBağlantılı Evrişimsel Ağ (DenseNet)Derin öğrenme↔ karşılaştır
- MobilNet: Mobil Görüş İçin Verimli Evrişimsel Sinir AğlarıDerin öğrenme↔ karşılaştır
- Artık Ağ (ResNet)Derin öğrenme↔ karşılaştır