Bilgi Damıtma
Knowledge Distillation (Teacher–Student Model Compression) · Ayrıca şöyle bilinir: Bilgi Damıtma (Knowledge Distillation), bilgi damıtma, teacher-student distillation, model distillation
Bilgi Damıtma, Geoffrey Hinton ve meslektaşları tarafından 2015 yılında tanıtılan, büyük bir öğretmen modelin yumuşak etiket çıktılarını kullanarak küçük bir öğrenci modeli eğiten bir model sıkıştırma tekniğidir. DistilBERT ve TinyBERT gibi damıtılmış modeller, daha büyük modelin performansının yaklaşık %97'sine ulaşırken çok daha hızlı çalışır.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
+1 tane daha
Ne zaman kullanılır
Güçlü ancak ağır, eğitilmiş bir öğretmen modeliniz olduğunda ve metin veya sürekli özellik görevlerinde dağıtım için daha küçük, daha hızlı bir öğrenci istediğinizde, en az yaklaşık 100 görev özel gözlemle kullanın. Öğretmen modelinin zaten eğitilmiş ve mevcut olduğunu ve görev özel bir veri kümesinin hazır olduğunu varsayar. Yaklaşık 500 gözlemin altında öğrenci öğretmenden yeterince damıtamaz ve aşırı uyum riski oluşur; yaklaşık 100'ün altında, damıtma anlamsızdır ve klasik makine öğrenmesi daha güvenli bir seçenektir.
Güçlü yönler & sınırlılıklar
- Öğretmenin performansının yaklaşık %97'sini kurtarabilen çok daha küçük, daha hızlı bir model sağlar.
- Öğretmenin yumuşak etiketleri, kesin etiketlerden daha zengin bilgi taşır, öğrencinin genellemesini iyileştirir.
- Varsayım-hafif: normal dağılımlı veri gerektirmez.
- Mevcut, eğitilmiş bir öğretmeni yeniden kullanır, bu nedenle hız ve boyutun önemli olduğu dağıtım ve sunum için uygundur.
- Zaten eğitilmiş, mevcut bir öğretmen modeli gerektirir — onsuz damıtma başlayamaz.
- Görev özel bir veri kümesi gerektirir; çok az veriyle öğrenci öğretmenden az şey öğrenir.
- Küçük veri kümelerinde (yaklaşık 500'ün altındaki n) öğrenci aşırı uyum sağlar ve öğretmenin bilgisini absorbe edemez.
- Orijinal modele ek olarak bir eğitim hattı ve ayarlama yükü (sıcaklık, karıştırma ağırlığı) ekler.
SSS
Neden sadece doğru cevap yerine yumuşak etiketler kullanılır?
Öğretmenin tam olasılık dağılımı, sınıfların ona ne kadar benzer göründüğünü ve ne kadar emin olduğunu ortaya çıkarır. Bu ekstra sinyal — bazen karanlık bilgi olarak adlandırılır — öğrencinin yalnızca kesin etiketlerden daha iyi genelleme yapmasına yardımcı olur.
Öğrenci ne kadar küçük olabilir?
DistilBERT ve TinyBERT gibi damıtılmış modeller, öğretmenlerinden önemli ölçüde daha küçük ve daha hızlıdır, ancak öğretmenin performansının yaklaşık %97'sine ulaşır, ancak kesin ödünleşme göreve ve mimariye bağlıdır.
Damıtmadan önce neye ihtiyacım var?
Zaten eğitilmiş ve mevcut bir öğretmen modeline ve görev özel bir veri kümesine ihtiyacınız var. Yaklaşık 500 gözlemden az olduğunda öğrenci öğretmenden yeterince damıtmakta zorlanır ve aşırı uyum sağlayabilir.
Kaybındaki alfa nedir?
Alfa, damıtma kaybının iki bölümünü karıştırır: gerçek etiketler üzerindeki bir çapraz entropi terimi ve öğrencinin çıktılarını öğretmenin çıktılarıyla hizalayan bir Kullback–Leibler ıraksaklık terimi. Ayarlamak, gerçek doğruluktan öğrenme ile öğretmenden öğrenme arasındaki dengeyi ayarlar.
Kaynaklar
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 1). Knowledge Distillation (Teacher–Student Model Compression). ScholarGate. https://scholargate.app/tr/deep-learning/knowledge-distillation
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Longformer / BigBirdDerin öğrenme↔ karşılaştır
- Uzmanlar KarmasıDerin öğrenme↔ karşılaştır
- Rastgele OrmanMakine öğrenmesi↔ karşılaştır
- Görsel Ayırt Edici ÖğrenmeDerin öğrenme↔ karşılaştır