Gradient boosted trees: tahmin
Modelini çalıştırdıktan sonra sıradaki adım onunla tahmin yapmak. Base-R'de tahmin için predict() kullanılırken, sparklyr tahmin için ml_predict() fonksiyonunu kullanır. ml_predict() iki argüman alır: bir model ve bazı test verileri.
ml_predict(a_model, testing_data)
Yaygın bir kullanım, tahmin edilen yanıtları gerçek yanıtlarla karşılaştırmaktır; bunların grafiklerini R'de çizebilirsin. Bu veriyi hazırlamak için kod kalıbı aşağıdaki gibidir. Şu anda tahmin sütunu eklemenin yerelde yapılması gerektiğine dikkat et; bu yüzden önce sonuçları toplamalısın.
predicted_vs_actual <- testing_data %>%
select(actual) %>%
collect() %>%
mutate(predicted)
Bu egzersiz, kursun bir parçasıdır
R ile sparklyr kullanarak Spark’a Giriş
Egzersiz talimatları
spark_conn olarak bir Spark bağlantısı senin için oluşturuldu. Spark'ta depolanan eğitim ve test veri kümelerine bağlı tibbles sırasıyla track_data_to_model_tbl ve track_data_to_predict_tbl olarak önceden tanımlandı. Gradient boosted trees modeli gradient_boosted_trees_model olarak önceden tanımlandı.
- Test verilerimiz için modelin tahminlerini içeren
predictedadlı bir değişken tanımla.- Argüman olarak modeli ve test verisini vererek
ml_predict()çağır. Bu fonksiyon, test veri kümesi için tahminler üretir ve bunlarıpredictionadlı yeni bir sütun olarak ekler. pull()kullanarak bu sütunu çıkarabilir vepredicteddeğişkenine atayabiliriz.
- Argüman olarak modeli ve test verisini vererek
- Tahmin edilen yanıtları gerçek yanıtlarla karşılaştırmaya hazırlamak için
responsesdeğişkenini tanımla:yearyanıt sütununu seç.- Sonuçları topla.
predictediçindeki tahminleri eklemek içinmutate()kullan.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Training, testing sets & model are pre-defined
track_data_to_model_tbl
track_data_to_predict_tbl
gradient_boosted_trees_model
# Predict the responses for the testing data
predicted <- ___(
___,
___) %>% pull(prediction)
# Prepare the data for comparing predicted responses with actual responses
responses <- track_data_to_predict_tbl %>%
# Select the response column
___ %>%
# Collect the results
___ %>%
# Add in the predictions
mutate(___)