Gradient boosted trees: प्रेडिक्शन
जब आप अपना मॉडल चला लेते हैं, तो अगला कदम उससे प्रेडिक्शन निकालना होता है. base-R, जो प्रेडिक्शन के लिए predict() फंक्शन का उपयोग करता है, के विपरीत sparklyr में ml_predict() फंक्शन इस्तेमाल होता है. ml_predict() दो आर्ग्युमेंट लेता है: एक मॉडल, और कुछ टेस्टिंग डेटा.
ml_predict(a_model, testing_data)
एक आम उपयोग यह है कि predicted responses को actual responses से तुलना करें, जिनके प्लॉट आप R में बना सकते हैं. इस डेटा को तैयार करने का कोड-पैटर्न नीचे दिया गया है. ध्यान दें कि अभी प्रेडिक्शन कॉलम जोड़ना लोकली करना पड़ता है, इसलिए आपको पहले रिजल्ट्स को collect करना होगा.
predicted_vs_actual <- testing_data %>%
select(actual) %>%
collect() %>%
mutate(predicted)
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में sparklyr के साथ Spark परिचय
अभ्यास निर्देश
आपके लिए spark_conn के रूप में एक Spark कनेक्शन बनाया गया है. Spark में स्टोर किए गए training और testing डेटासेट्स से जुड़े tibbles क्रमशः track_data_to_model_tbl और track_data_to_predict_tbl के रूप में पहले से परिभाषित हैं. Gradient boosted trees मॉडल gradient_boosted_trees_model के रूप में पहले से परिभाषित है.
- एक वैरिएबल
predictedपरिभाषित करें जिसमें हमारे testing डेटा के लिए मॉडल की प्रेडिक्शंस हों.- मॉडल और testing डेटा को आर्ग्युमेंट्स के रूप में देकर
ml_predict()कॉल करें. यह फंक्शन testing डेटासेट के लिए प्रेडिक्शंस जेनरेट करेगा और इन्हेंpredictionनामक नए कॉलम के रूप में जोड़ देगा. pull()का उपयोग करके हम इस कॉलम को निकाल सकते हैं औरpredictedमें असाइन कर सकते हैं.
- मॉडल और testing डेटा को आर्ग्युमेंट्स के रूप में देकर
- predicted responses को actual responses से तुलना करने के लिए डेटा तैयार करने हेतु
responsesवैरिएबल परिभाषित करें:- रिस्पॉन्स कॉलम
yearचुनें. - रिजल्ट्स को collect करें.
mutate()का उपयोग करकेpredictedमें बनी प्रेडिक्शंस को जोड़ें.
- रिस्पॉन्स कॉलम
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Training, testing sets & model are pre-defined
track_data_to_model_tbl
track_data_to_predict_tbl
gradient_boosted_trees_model
# Predict the responses for the testing data
predicted <- ___(
___,
___) %>% pull(prediction)
# Prepare the data for comparing predicted responses with actual responses
responses <- track_data_to_predict_tbl %>%
# Select the response column
___ %>%
# Collect the results
___ %>%
# Add in the predictions
mutate(___)