Random Forest: modelleme
Gradient boosted trees gibi, random forests da başka bir tür ensemble model'dir. Yani çok sayıda daha basit modeli (yine karar ağaçları) kullanır ve bunları tek, daha iyi bir model oluşturacak şekilde birleştirir. Aynı modeli yinelemeli olarak çalıştırmak yerine, random forests verinin rastgele seçilmiş alt kümeleri ve özelliklerin rastgele seçilmiş alt kümeleri üzerinde, çok sayıda ayrı modeli paralel olarak çalıştırır. Sonrasında nihai karar ağacı, tek tek modellerden gelen sonuçları bir araya getirerek tahmin üretir.
sparklyr'ın random forest fonksiyonu ml_random_forest() olarak adlandırılır. Kullanımı, ml_gradient_boosted_trees() ile tamamen aynıdır (sözdizimini hatırlamak için bu bölümün ilk egzersizine bakabilirsin).
Bu egzersiz, kursun bir parçasıdır
R ile sparklyr kullanarak Spark’a Giriş
Egzersiz talimatları
Senin için spark_conn olarak bir Spark bağlantısı oluşturuldu. Spark'ta saklanan birleştirilmiş ve filtrelenmiş parça meta verisi/timbre verisine bağlı bir tibble track_data_to_model_tbl olarak önceden tanımlandı.
- Yıl tahmini analizini bu kez bir random forest modeli kullanarak tekrarla.
track_data_to_model_tbliçindekitimbresütunlarını al ve sonucufeature_colnamesdeğişkenine ata.reformulate()kullanarak model için formülü oluştur.- Random forest modelini çalıştır ve sonucu
random_forest_modeldeğişkenine ata.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# track_data_to_model_tbl has been pre-defined
track_data_to_model_tbl
# Get the timbre columns
feature_colnames <- ___
# Create the formula for the model
year_formula <- ___
# Run the random forest model
random_forest_model <- ___