रैंडम फॉरेस्ट: मॉडलिंग
ग्रेडिएंट बूस्टेड ट्रीज़ की तरह, रैंडम फॉरेस्ट भी एक प्रकार का एनसेंबल मॉडल है। यानी, ये कई सरल मॉडलों (फिर से, डिसीज़न ट्री) का उपयोग करते हैं और उन्हें जोड़कर एक बेहतर समेकित मॉडल बनाते हैं। एक ही मॉडल को बार-बार चलाने के बजाय, रैंडम फॉरेस्ट कई अलग-अलग मॉडल समानांतर में चलाता है, हर बार डेटा के यादृच्छिक रूप से चुने गए सबसेट पर और फीचर्स के यादृच्छिक सबसेट के साथ। फिर अंतिम डिसीज़न ट्री, अलग-अलग मॉडलों के नतीजों को एग्रीगेट करके प्रेडिक्शन करता है.
sparklyr में रैंडम फॉरेस्ट का फंक्शन ml_random_forest() कहलाता है। इसका उपयोग बिल्कुल ml_gradient_boosted_trees() जैसा ही है (सिंटैक्स के लिए इस अध्याय के पहले अभ्यास को देखें).
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में sparklyr के साथ Spark परिचय
अभ्यास निर्देश
आपके लिए spark_conn नाम से एक Spark कनेक्शन बनाया गया है। Spark में स्टोर किए गए संयोजित और फ़िल्टर किए गए ट्रैक मेटाडेटा/टिंबर डेटा से जुड़ी एक tibble पहले से track_data_to_model_tbl के रूप में परिभाषित है।
- इस बार रैंडम फॉरेस्ट मॉडल का उपयोग करके अपनी year प्रेडिक्शन एनालिसिस दोहराइए।
track_data_to_model_tblसेtimbreकॉलम प्राप्त करें और परिणामfeature_colnamesमें असाइन करें।reformulate()का उपयोग करके मॉडल के लिए फ़ॉर्मूला बनाएँ।- रैंडम फॉरेस्ट मॉडल चलाएँ और परिणाम
random_forest_modelमें असाइन करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# track_data_to_model_tbl has been pre-defined
track_data_to_model_tbl
# Get the timbre columns
feature_colnames <- ___
# Create the formula for the model
year_formula <- ___
# Run the random forest model
random_forest_model <- ___