Görüntü Sınıflandırma
Deep Learning Image Classification · Ayrıca şöyle bilinir: visual classification, image recognition, CNN-based classification, visual categorization
Görüntü sınıflandırma, sabit bir kategori kümesinden tüm bir görüntüye tek bir anlamsal etiket atama görevidir. Modern yaklaşımlar, ImageNet gibi büyük etiketli veri kümeleri üzerinde uçtan uca eğitilmiş derin evrişimli sinir ağlarına (CNN'ler) veya Görsel Transformer'lara (ViT'ler) dayanır, birçok kıyaslamada insanüstü doğruluk elde eder ve tıbbi görüntülemeden otonom araçlara kadar uygulamaları destekler.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
+13 tane daha
Ne zaman kullanılır
Her görüntünün tam olarak bir kategoriye ait olduğu ve amacın ölçekte otomatik etiket ataması olduğu durumlarda görüntü sınıflandırmayı kullanın — örneğin, patoloji slaydı triyajı, uydu arazi örtüsü haritalaması, ürün kusuru tespiti veya sosyal medya içerik denetimi. Yeterli etiketli görüntüye sahip olduğunuzda (en azından güçlü artırma ve transfer öğrenme ile sınıf başına birkaç yüz) doğru seçimdir. Birden fazla eşit nesne içeren ve hepsinin konumlandırılması gereken görüntüler olduğunda (nesne tespiti kullanın) veya piksel düzeyinde sınırlara önem verildiğinde (anlamsal segmentasyon kullanın) ham görüntü sınıflandırmayı kullanmayın. Etiketlerin belirsiz olduğu, ek açıklama bütçelerinin çok düşük olduğu veya yorumlanabilirlik gereksinimlerinin kapalı modelleri engellediği durumlardan kaçının.
Güçlü yönler & sınırlılıklar
- Büyük kıyaslamalarda son teknoloji doğruluk, genellikle insan performansına ulaşır veya onu aşar.
- ImageNet önceden eğitilmiş omurgalardan transfer öğrenme, sınıf başına yalnızca yüzlerce etiketli görüntüyle güçlü performans sağlar.
- Uçtan uca eğitim, el yapımı özellik mühendisliği ihtiyacını ortadan kaldırır.
- Ölçeklenebilir çıkarım: eğitildikten sonra, sınıflandırma, standart donanımda görüntü başına milisaniyeler içinde çalışır.
- PyTorch Hub ve Hugging Face aracılığıyla kullanılabilen zengin önceden eğitilmiş model ekosistemi (ResNet, EfficientNet, ViT, ConvNeXt).
- Sıfırdan eğitmek için büyük miktarda etiketli eğitim verisi gerektirir; ek açıklama pahalı ve zaman alıcıdır.
- Modeller, yüksek güvenle dağıtım dışı görüntülerde sessizce başarısız olabilir (aşırı güven problemi).
- Her görüntü tam olarak bir küresel etiket alır — yaklaşım, ek işlem sonrası olmadan birden fazla belirgin nesne içeren görüntüleri işleyemez.
- Kara kutu doğası, bireysel tahminleri açıklamayı zorlaştırır, bu da sağlık ve hukuk gibi düzenlenmiş alanlarda bir engel olabilir.
SSS
Ne kadar etiketli görüntüye ihtiyacım var?
Önceden eğitilmiş bir omurga ve güçlü artırma ile, ince ayar için sınıf başına birkaç yüz görüntü yeterli olabilir. Sıfırdan eğitmek genellikle sınıf başına on binlerce görüntü gerektirir. Kural olarak: görüntü sayısı ne kadar azsa, transfer öğrenme ve artırma o kadar kritik hale gelir.
Hangi omurgayı seçmeliyim?
ResNet-50 veya EfficientNet-B0, sağlam genel amaçlı varsayılanlardır. Görsel Transformer'lar (ViT, DeiT), veri bol olduğunda üstün performans gösterir. Hesaplama kısıtlıysa, MobileNetV3 veya EfficientNet-Lite iyi doğruluk-gecikme dengeleri sunar. Her zaman kendi özel veri kümeniz üzerinde kıyaslama yapın.
Görüntü sınıflandırma çok etiketli görüntüleri işleyebilir mi?
Doğrudan değil. Standart görüntü sınıflandırma, görüntü başına tek bir etiket varsayar. Birden fazla bağımsız etikete sahip görüntüler için (örneğin, 'kedi VE içeride'), softmax çıktısını sınıf başına sigmoid ile değiştirin ve ikili çapraz entropi kaybını kullanın — bu, çok etiketli sınıflandırma olarak adlandırılır.
Sınıf dengesizliği ile nasıl başa çıkarım?
Sınıf ağırlıklı kayıp fonksiyonları kullanın, azınlık sınıflarını aşırı örnekleyin (veya çoğunluk sınıflarını az örnekleyin) veya nadir sınıflara daha agresif veri artırması uygulayın. Genel doğruluk yerine sınıf başına F1 ve makro ortalamalı metrikleri raporlayın.
Softmax'tan gelen güvenilir güvenilir mi?
Varsayılan olarak değil. Sinir ağları genellikle aşırı güvenlidir. Gerçek belirsizliği yansıtan olasılık tahminlerine ihtiyacınız varsa, özellikle güvenlik açısından kritik uygulamalarda, tutulan bir kalibrasyon kümesi üzerinde sıcaklık ölçeklendirme veya Platt ölçeklendirme uygulayın.
Kaynaklar
- Krizhevsky, A., Sutskever, I., & Hinton, G. E. (2012). ImageNet classification with deep convolutional neural networks. Advances in Neural Information Processing Systems (NeurIPS), 25, 1097–1105. link ↗
- He, K., Zhang, X., Ren, S., & Sun, J. (2016). Deep residual learning for image recognition. Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), 770–778. DOI: 10.1109/CVPR.2016.90 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Deep Learning Image Classification. ScholarGate. https://scholargate.app/tr/deep-learning/image-classification
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Hassas Ayarlı Görüntü SınıflandırmaDerin öğrenme↔ karşılaştır
- Nesne TespitiDerin öğrenme↔ karşılaştır
- Semantik SegmentasyonDerin öğrenme↔ karşılaştır
- Transfer Learning ile Görüntü SınıflandırmaDerin öğrenme↔ karşılaştır
- Vision TransformerDerin öğrenme↔ karşılaştır