रैंडम फॉरेस्ट: प्रेडिक्शन
अब आपको अपने रैंडम फॉरेस्ट मॉडल से कुछ प्रेडिक्शंस बनानी हैं. सिंटैक्स gradient boosted trees मॉडल जैसा ही है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में sparklyr के साथ Spark परिचय
अभ्यास निर्देश
आपके लिए spark_conn नाम का एक Spark कनेक्शन बना दिया गया है. Spark में सेव training और testing डेटासेट्स से जुड़े tibbles पहले से track_data_to_model_tbl और track_data_to_predict_tbl के रूप में परिभाषित हैं. रैंडम फॉरेस्ट मॉडल random_forest_model भी पहले से बना हुआ है.
- एक वैरिएबल
predictedपरिभाषित करें जिसमें हमारे testing डेटा के लिए मॉडल की प्रेडिक्शंस हों.ml_predict()को मॉडल और testing डेटा को आर्गुमेंट्स के रूप में देकर कॉल करें. यह फंक्शन testing डेटासेट के लिए प्रेडिक्शंस जेनरेट करेगा और इन्हेंpredictionनाम के नए कॉलम के रूप में जोड़ देगा.
- प्रेडिक्टेड responses को actual responses से तुलना करने के लिए
responsesवैरिएबल परिभाषित करें:- response कॉलम
yearचुनें. - रिज़ल्ट्स को collect करें.
mutate()का उपयोग करकेpredictedमें बनी प्रेडिक्शंस जोड़ें.
- response कॉलम
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Training, testing sets & model are pre-defined
track_data_to_model_tbl
track_data_to_predict_tbl
random_forest_model
# Predict the responses for the testing data
predicted <- ml_predict(
___,
___) %>% pull(prediction)
# Create a response vs. actual dataset
responses <- ___