Otomatik Kompozisyon Değerlendirme (OKD)
Automated Essay Scoring (AES) · Ayrıca şöyle bilinir: AES, automated writing evaluation, AWE, Otomatik Deneme Puanlaması
Otomatik Kompozisyon Değerlendirme (OKD), hesaplamalı bir modelin dilbilgisi doğruluğu, tutarlılık, içerik zenginliği ve organizasyon gibi boyutlarda öğrenci tarafından yazılmış kompozisyonlara puan atadığı bir doğal dil işleme görevidir — ölçekte, bir insan değerlendiricinin yapacağını tekrarlar. Yaklaşım, Shermis ve Burstein (2013) tarafından bir araştırma alanı olarak biçimlendirilmiş ve 2019'dan bu yana, OKD sistemlerinin metnin derinlemesine bağlamsal temsillerinden yararlanmasını sağlayan transformer dil modelleri, özellikle BERT tarafından dönüştürülmüştür.
Tam yöntemi oku
Bu bölümü okumak için ücretsiz hesapla giriş yapın.
Yöntem haritası
İlişkili yöntemlerin komşuluğu — keşfetmek için bir düğüm seçin.
Ne zaman kullanılır
OKD, puanlanmış kompozisyonlardan oluşan etiketli bir derlem mevcut olduğunda, puanlama rubriği açıkça tanımlanmış ve kararlı olduğunda ve yalnızca manuel puanlamadan daha fazla puanlanması gereken kompozisyon hacmi olduğunda uygundur. Yöntem, büyük ölçekli standartlaştırılmış testler, biçimlendirici geri bildirim sağlayan akıllı öğretim sistemleri ve birçok katılımcı arasında tutarlı puanlama gerektiren eğitim araştırmaları için uygundur. Yaklaşık 30 puanlanmış kompozisyondan oluşan bir minimum eşik en düşük sınırdır; pratikte, güvenilir modeller için yüzlerce ila binlerce etiketli kompozisyon gereklidir. Etiketlenmiş puanlanmış veri yoksa veya rubrik belirsiz tanımlanmışsa, OKD uygulanamaz.
Güçlü yönler & sınırlılıklar
- Puanlama rubriğinin tutarlı bir şekilde uygulanmasıyla keyfi olarak büyük hacimlerde kompozisyonlara ölçeklenir.
- Tekrarlanan insan puanlamasını etkileyen değerlendiriciler arası sapmayı ve yorgunluğu ortadan kaldırır.
- Transformer tabanlı sistemler bağlamsal, dilbilgisel ve anlamsal sinyalleri aynı anda yakalar.
- Akıllı öğretim bağlamlarında hızlı biçimlendirici geri bildirim döngülerini etkinleştirir.
- Puanlanmış kompozisyonlardan oluşan etiketli bir derlem gerektirir; sistem, önceden insan tarafından derecelendirilmiş eğitim verileri olmadan puanlama yapamaz.
- Model performansı, etiketli derlemin kalitesi ve boyutu ile sınırlıdır.
- Sistemler, gerçek kalite olmadan kompozisyon uzunluğu veya nadir kelime hazinesi gibi yüzey özellikleri ile manipüle edilebilir.
- Eğitim verilerinde bulunan baskın lehçeler veya yazı stilleri için önyargı, belgelenmiş bir risktir.
SSS
Bir OKD modeli eğitmek için kaç adet puanlanmış kompozisyona ihtiyacım var?
Minimum eşik yaklaşık 30'dur, ancak bu güvenilir tahminler için nadiren yeterlidir. Pratikte, geleneksel özellik tabanlı bir model için birkaç yüz etiketli kompozisyon ve bir transformer'ı ince ayarlamak için birkaç bin kompozisyon gereklidir. Derlem boyutu, model kalitesinin en güçlü tekil tahmincisidir.
OKD insan değerlendiricilerin yerini tamamen alabilir mi?
OKD, tam bir ikame yerine insan değerlendiricilerle birlikte kullanıldığında en iyisidir. Yüksek riskli kararlar — örneğin bir standartlaştırılmış sınavda geçme/kalma — en az bir insan puanını içermeli, OKD ise ikinci bir değerlendirici veya sınır vakalar için bir filtre görevi görmelidir. Düşük riskli biçimlendirici bağlamlarda, OKD tek başına faydalı geri bildirim sağlayabilir.
Bir OKD modelini değerlendirmek için hangi metriği kullanmalıyım?
Karesel ağırlıklı kappa (QWK) standart metriktir çünkü sıralı uyumu hesaba katar ve büyük anlaşmazlıkları küçük olanlardan daha fazla cezalandırır. Pearson korelasyonu ve ortalama karesel hata, QWK ile birlikte raporlanır. Yalnızca doğruluk, sıralı puan ölçekleri için uygun değildir.
BERT her zaman geleneksel özellik tabanlı yöntemlerden daha mı iyi performans gösterir?
Büyük, iyi etiketlenmiş derlemlerde BERT tabanlı modeller genellikle el yapımı özellik işlem hatlarından daha iyi performans gösterir. Küçük derlemlerde (birkaç yüz kompozisyondan az) avantaj azalır ve yorumlanabilir özellikler üzerindeki düzenlileştirilmiş regresyon, puanı hangi boyutların yönlendirdiğine dair daha fazla şeffaflık sunarken rekabetçi olabilir.
Kaynaklar
- Shermis, M.D. & Burstein, J. (2013). Handbook of Automated Essay Evaluation. Routledge. link ↗
- Devlin, J., Chang, M.-W., Lee, K. & Toutanova, K. (2019). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. NAACL-HLT, 4171-4186. DOI: 10.18653/v1/N19-1423 ↗
Bu sayfayı kaynak gösterin
ScholarGate. (2026, June 1). Automated Essay Scoring (AES). ScholarGate. https://scholargate.app/tr/text-mining/automated-essay-scoring
Hangi yöntem?
Bu yöntemi en yakın akrabalarının yanına koyup yan yana okuyun — kütüphane kitapları masaya serer; seçim sizindir.
- BERT Gömme VektörleriMetin madenciliği↔ karşılaştır
- Okunabilirlik AnaliziMetin madenciliği↔ karşılaştır
- Duygu AnaliziMetin madenciliği↔ karşılaştır
- Metin SınıflandırmasıMetin madenciliği↔ karşılaştır