Yarı denetimli Doğrusal Regresyon
Semi-supervised Linear Regression (Linear Model with Labeled and Unlabeled Data) · Ayrıca şöyle bilinir: SSL linear regression, semi-supervised least squares, transductive linear regression, label-efficient linear regression
Yarı denetimli doğrusal regresyon, küçük etiketli bir veri kümesi üzerinde doğrusal bir model uydurur ve ardından katsayı tahminlerini ve genellemeyi iyileştirmek için daha büyük bir etiketlenmemiş gözlem havuzundan yararlanır. Etiketlenmemiş noktalar için sözde etiketler üreterek ve modeli yinelemeli olarak iyileştirerek, yalnızca kıt etiketler üzerinde eğitilmiş tamamen denetimli bir doğrusal modele göre daha iyi tahmin doğruluğu elde eder.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
Etiketli gözlemlerin elde edilmesi kıt ve pahalı olduğu, ancak aynı özellik dağılımını paylaşan büyük bir etiketlenmemiş veri havuzunun mevcut olduğu durumlarda yarı denetimli doğrusal regresyon kullanın — örneğin, biyomedikal çalışmalarda toplanan örneklerin yalnızca bir kısmı için deney sonuçlarının mevcut olduğu durumlarda. En çok, etiketli-etiketlenmemiş oranının düşük olduğu (kayıtların %10-20'sinden azının etiketli olduğu) ve etiketlenmemiş verinin gerçekten etiketli veriyle aynı dağılımdan geldiği durumlarda faydalıdır. Etiketli ve etiketlenmemiş kümelerin farklı popülasyonlardan geldiği (kovaryat kayması), kararlı, işaretli katsayıların yorumlanabilirliğinin birincil hedef olduğu veya etiketli veri kümesinin güvenilir denetimli tahmin için zaten yeterince büyük olduğu durumlarda KULLANMAYIN. Bu durumlarda, standart doğrusal regresyon veya ridge regresyon tercih edilir.
Güçlü yönler & sınırlılıklar
- Etiketli veriler sınırlı ancak etiketlenmemiş veriler bol olduğunda katsayı tahminlerini ve tahmin doğruluğunu iyileştirir.
- Doğrusal regresyonun yorumlanabilirliğini miras alır: katsayılar yönlerini ve yaklaşık büyüklüklerini korur.
- Belirsiz sözde etiketlere aşırı güvenilmesini önlemek için düzenlileştirme (ridge, lasso) ile uyumludur.
- Özel kütüphaneler olmadan standart doğrusal cebir araçları ve yinelemeli iyileştirme ile uygulanabilir.
- Doğal bir üst sınır kontrolü sağlar: varsayımlar geçerliyse performansın yalnızca denetimli temel modelini aşması gerekir.
- Etiketlenmemiş veri dağılımı etiketli kümeden farklıysa (kovaryat kayması), sözde etiketler yanlılık getirir ve model denetimli temel modelin altına düşebilir.
- Hata yayılımı gerçek bir risktir: erken yanlış tahminler sonraki iterasyonlarda eğitim etiketleri haline gelir, potansiyel olarak hataları artırır.
- Düzenlileştirme olmadan yakınsama garanti edilmez; yinelemeli prosedür salınabilir.
- Temsili, yanlı olmayan etiketli bir küme ihtiyacını ortadan kaldırmaz — yanlı bir etiketli örnek, ölçekte yanlı sözde etiketler üretir.
- Etiketli küme zaten orta derecede büyük olduğunda kazançlar kaybolur, bu da ek karmaşıklığı haklı çıkarmaz.
SSS
Yarı denetimli doğrusal regresyon her zaman standart doğrusal regresyondan daha iyi performans gösterir mi?
Hayır. Etiketlenmemiş veriler etiketli kümeden farklı bir dağılımdan geliyorsa, sözde etiketler sistematik yanlılık getirir ve yarı denetimli model daha kötü performans gösterebilir. Her zaman ayrılmış etiketli bir test kümesi üzerinde yalnızca denetimli bir temel modele karşı karşılaştırın.
Yöntemin değerli olması için kaç etiketli örneğe ihtiyaç vardır?
Fayda, etiketli verilerin kıt olduğu durumlarda en büyüktür — tipik olarak toplam veri kümesinin %10-20'sinden azı. Orta derecede büyük bir etiketli küme ile kazançlar azalır ve standart denetimli doğrusal veya ridge regresyon daha basittir ve eşit derecede doğrudur.
Sert veya yumuşak sözde etiketler kullanmalı mıyım?
Yumuşak atama — sözde etiketli noktaları ters tahmin varyansı gibi bir güven ölçüsüyle ağırlıklandırma — genellikle daha sağlamdır. Sert atama (tüm sözde etiketleri eşit kabul etme), yinelemeli sürecin başlarında belirsiz tahminlerin aşırı ağırlıklandırılması riskini taşır.
Ridge veya lasso gibi düzenlileştirilmiş varyantlarla kullanabilir miyim?
Evet, ve tavsiye edilir. Ridge düzenlileştirmesi, erken sözde etiket hatalarının pekiştirilmesini azaltır, yakınsamayı stabilize eder ve etiketli artı sözde etiketli birleştirilmiş veri kümesindeki çoklu doğrusallığı ele alır. Lasso ayrıca özellikleri seçer, bu da özellik alanı etiketli kümeye göre geniş olduğunda yardımcı olur.
Etiketlenmemiş verilerin modele zarar verdiğini nasıl tespit edebilirim?
Yalnızca denetimli temel modelin yanı sıra her iterasyondan sonra ayrılmış etiketli küme MSE'sini (veya R-kare) izleyin. Yarı denetimli performans temel modelin altına düşerse veya iterasyonlar boyunca aralık genişlerse, durun ve standart doğrusal regresyona geri dönün — bu, dağılımsal uyumsuzluk veya hata yayılımının bir işaretidir.
Kaynaklar
- Chapelle, O., Scholkopf, B., & Zien, A. (Eds.). (2006). Semi-Supervised Learning. MIT Press. ISBN: 978-0-262-03358-9
- Zhou, Z.-H., & Li, M. (2005). Semi-supervised regression with co-training. Proceedings of the 19th International Joint Conference on Artificial Intelligence (IJCAI), 908–913. link ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 3). Semi-supervised Linear Regression (Linear Model with Labeled and Unlabeled Data). ScholarGate. https://scholargate.app/tr/machine-learning/semi-supervised-linear-regression
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- Etiket YayılımıMakine öğrenmesi↔ karşılaştır
- Doğrusal Regresyon (ML)Makine öğrenmesi↔ karşılaştır
- Düzenlileştirilmiş Doğrusal RegresyonMakine öğrenmesi↔ karşılaştır
- Yarı denetimli ÖğrenmeMakine öğrenmesi↔ karşılaştır