BaşlayınÜcretsiz başlayın

Gradient boosted trees: tahmin

Modelini çalıştırdıktan sonra sıradaki adım onunla tahmin yapmak. Base-R'de tahmin için predict() kullanılırken, sparklyr tahmin için ml_predict() fonksiyonunu kullanır. ml_predict() iki argüman alır: bir model ve bazı test verileri.

ml_predict(a_model, testing_data)

Yaygın bir kullanım, tahmin edilen yanıtları gerçek yanıtlarla karşılaştırmaktır; bunların grafiklerini R'de çizebilirsin. Bu veriyi hazırlamak için kod kalıbı aşağıdaki gibidir. Şu anda tahmin sütunu eklemenin yerelde yapılması gerektiğine dikkat et; bu yüzden önce sonuçları toplamalısın.

predicted_vs_actual <- testing_data %>%
  select(actual) %>%
  collect() %>%
  mutate(predicted)

Bu egzersiz, kursun bir parçasıdır

R ile sparklyr kullanarak Spark’a Giriş

Kursa Göz Atın

Egzersiz talimatları

spark_conn olarak bir Spark bağlantısı senin için oluşturuldu. Spark'ta depolanan eğitim ve test veri kümelerine bağlı tibbles sırasıyla track_data_to_model_tbl ve track_data_to_predict_tbl olarak önceden tanımlandı. Gradient boosted trees modeli gradient_boosted_trees_model olarak önceden tanımlandı.

  • Test verilerimiz için modelin tahminlerini içeren predicted adlı bir değişken tanımla.
    • Argüman olarak modeli ve test verisini vererek ml_predict() çağır. Bu fonksiyon, test veri kümesi için tahminler üretir ve bunları prediction adlı yeni bir sütun olarak ekler.
    • pull() kullanarak bu sütunu çıkarabilir ve predicted değişkenine atayabiliriz.
  • Tahmin edilen yanıtları gerçek yanıtlarla karşılaştırmaya hazırlamak için responses değişkenini tanımla:
    • year yanıt sütununu seç.
    • Sonuçları topla.
    • predicted içindeki tahminleri eklemek için mutate() kullan.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Training, testing sets & model are pre-defined
track_data_to_model_tbl
track_data_to_predict_tbl
gradient_boosted_trees_model

# Predict the responses for the testing data
predicted <- ___(
      ___,
      ___) %>% pull(prediction)

# Prepare the data for comparing predicted responses with actual responses
responses <- track_data_to_predict_tbl %>%
  # Select the response column
  ___ %>%
  # Collect the results
  ___ %>%
  # Add in the predictions
  mutate(___)
Kodu Düzenle ve Çalıştır