DETR (Tespit Transformatörü)
End-to-End Object Detection with Transformers · Ayrıca şöyle bilinir: Detection Transformer, DETR
DETR (Tespit Transformatörü), Carion ve arkadaşları tarafından 2020'de tanıtılan, tespit işlemini transformatörler kullanarak doğrudan bir küme tahmin problemi olarak yeniden formüle eden uçtan uca bir nesne tespiti çerçevesidir. Maksimum olmayan bastırma gibi el yapımı son işleme adımları kullanan geleneksel yaklaşımların aksine, DETR nesne tespitini, transformatörün tüm nesneleri aynı anda tahmin ettiği bir diziden-diziye problem olarak ele alır.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
DETR, özellikle basitlik ve uçtan uca eğitilebilirlik öncelikli olduğunda kullanışlıdır, çünkü çapa kutusu tasarımını ve maksimum olmayan bastırmayı ortadan kaldırır. Net nesne sınırlarına sahip veri kümelerinde iyi performans gösterir ve özellikle işlem hattının yorumlanabilirliğinin değerli olduğu araştırma ve eğitim bağlamları için uygundur. Maksimum hızı gerektiren üretim sistemleri için Hızlı R-CNN gibi geleneksel nesne tespitleyicileri tercih edilebilir, çünkü DETR daha yüksek gecikme süresine sahiptir. DETR, nesne sayısının az ve nispeten sabit olduğu senaryolarda üstündür.
Güçlü yönler & sınırlılıklar
- Çapa kutuları ve maksimum olmayan bastırma gibi el yapımı bileşenleri ortadan kaldırarak tespit işlem hattını basitleştirir
- Uçtan uca farklılaştırılabilir eğitim, tüm bileşenlerin ortak optimizasyonunu sağlar
- Küme tahmini olarak doğal formülasyon, ilgili görevler için esnek değişikliklere olanak tanır
- Transformatör mimarisi, gizlenmiş nesnelerin tespitinde faydalı olan uzun menzilli bağımlılıkları doğal olarak yakalar
- Çıkarım hızı, transformatör karmaşıklığı nedeniyle Hızlı R-CNN gibi optimize edilmiş CNN tabanlı tespitleyicilerden daha yavaştır
- Yakınsama sağlamak için önemli ölçüde daha fazla eğitim yinelemesi ve dikkatli hiperparametre ayarı gerektirir
- Küçük nesneler üzerindeki performans, CNN omurgalarının sınırlı çözünürlüğünü yansıtarak geleneksel tespitleyicilerden daha kötüdür
SSS
DETR neden Hızlı R-CNN gibi çapa kutuları kullanmıyor?
Çapa kutuları, en boy oranlarının ve ölçeklerin dikkatli ayarlanmasını gerektiren manuel bir tasarım seçimidir. DETR, tespiti doğrudan küme tahmini olarak yeniden formüle ederek modelin herhangi bir boyutta ve en boy oranında nesneleri tespit etmeyi öğrenmesini sağlar. Bu, hiperparametre karmaşıklığı kaynağını ortadan kaldırır ve yöntemi daha genelleştirilebilir hale getirir.
İkili eşleştirme nedir ve neden gereklidir?
İkili eşleştirme, Macar algoritmasını kullanarak her gerçek nesneyi tam olarak bir tahmine atar. Bu, aynı nesnenin yinelenen tespitlerini ve yinelenen tahminler üzerinde boşa harcanan eğitimi önler. Eşleştirme maliyeti, sınıflandırma ve yerelleştirme kayıplarını birleştirir.
DETR neden Hızlı R-CNN'den daha yavaştır?
DETR, 100'den fazla nesne sorgusunun her biri için tüm görüntüyü bir transformatör kod çözücü aracılığıyla işler. Her sorgu, tüm kodlayıcı özelliklerine dikkat etmelidir, bu da O(N²) işlem gerektirir. Hızlı R-CNN, daha hesaplama açısından verimli olan Bölge Teklif Ağları kullanır. Deforme Edilebilir DETR gibi son varyantlar, seyrek dikkat ile bu sorunu ele alır.
Kaynaklar
- Carion, N., Massa, F., Synnaeve, G., Usunier, N., Kirillov, A., & Zagoruyko, S. (2020). End-to-end object detection with transformers. In European Conference on Computer Vision (pp. 213-229). Springer, Cham. DOI: 10.1007/978-3-030-58452-8_13 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). End-to-End Object Detection with Transformers. ScholarGate. https://scholargate.app/tr/deep-learning/detr
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Masked Autoencoders (MAE)Derin öğrenme↔ karşılaştır
- Herhangi Bir Şeyi Segment Etme ModeliDerin öğrenme↔ karşılaştır
- Swin TransformerDerin öğrenme↔ karşılaştır
- Vision MambaDerin öğrenme↔ karşılaştır