BaşlayınÜcretsiz başlayın

Model performansını karşılaştırma

Grafikler, modelin nerede iyi performans gösterdiğini, nerede zorlandığını sezgisel olarak görmeyi sağlar. Bazen model için tek bir puan veren bir istatistik kullanmak da güzeldir. Böylece bir modelin ne kadar iyi olduğunu sayısallaştırabilir ve çok sayıda modeli karşılaştırabilirsin. Yaygın bir istatistik kök ortalama kare hata (kısaca "RMSE")dır; artıkların (residual) karesini alır, ortalamasını hesaplar ve sonra karekökünü alır. Belirli bir veri kümesi için küçük bir RMSE daha iyi bir tahmine işaret eder. (Varsayılan olarak, farklı veri kümeleri arasında değil, yalnızca aynı veri kümesi üzerindeki farklı modeller arasında karşılaştırma yapabilirsin. Bazen veri kümelerini normalize ederek aralarında karşılaştırma yapmak mümkün olabilir.)

Burada gradient boosted trees ve random forest modellerini karşılaştıracaksın.

Bu egzersiz, kursun bir parçasıdır

R ile sparklyr kullanarak Spark’a Giriş

Kursa Göz Atın

Egzersiz talimatları

both_responses, her iki modelden parçanın tahmin edilen ve gerçek yılını içeren yerel bir tibble olarak önceden tanımlandı.

  • Artıkların kareleri toplamını içeren bir veri kümesi oluştur.
    • Tahmin edilen yanıt eksi gerçek yanıta eşit bir residual sütunu ekle.
    • Veriyi modela göre grupla.
    • residualların karesinin ortalamasının kareköküne eşit rmse adlı bir özet istatistik hesapla.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# both_responses has been pre-defined
both_responses

# Create a residual sum of squares dataset
___
Kodu Düzenle ve Çalıştır