Model performansını karşılaştırma
Grafikler, modelin nerede iyi performans gösterdiğini, nerede zorlandığını sezgisel olarak görmeyi sağlar. Bazen model için tek bir puan veren bir istatistik kullanmak da güzeldir. Böylece bir modelin ne kadar iyi olduğunu sayısallaştırabilir ve çok sayıda modeli karşılaştırabilirsin. Yaygın bir istatistik kök ortalama kare hata (kısaca "RMSE")dır; artıkların (residual) karesini alır, ortalamasını hesaplar ve sonra karekökünü alır. Belirli bir veri kümesi için küçük bir RMSE daha iyi bir tahmine işaret eder. (Varsayılan olarak, farklı veri kümeleri arasında değil, yalnızca aynı veri kümesi üzerindeki farklı modeller arasında karşılaştırma yapabilirsin. Bazen veri kümelerini normalize ederek aralarında karşılaştırma yapmak mümkün olabilir.)
Burada gradient boosted trees ve random forest modellerini karşılaştıracaksın.
Bu egzersiz, kursun bir parçasıdır
R ile sparklyr kullanarak Spark’a Giriş
Egzersiz talimatları
both_responses, her iki modelden parçanın tahmin edilen ve gerçek yılını içeren yerel bir tibble olarak önceden tanımlandı.
- Artıkların kareleri toplamını içeren bir veri kümesi oluştur.
- Tahmin edilen yanıt eksi gerçek yanıta eşit bir
residualsütunu ekle. - Veriyi
modela göre grupla. residualların karesinin ortalamasının kareköküne eşitrmseadlı bir özet istatistik hesapla.
- Tahmin edilen yanıt eksi gerçek yanıta eşit bir
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# both_responses has been pre-defined
both_responses
# Create a residual sum of squares dataset
___