शुरू करेंमुफ़्त में शुरू करें

Gradient boosted trees: प्रेडिक्शन

जब आप अपना मॉडल चला लेते हैं, तो अगला कदम उससे प्रेडिक्शन निकालना होता है. base-R, जो प्रेडिक्शन के लिए predict() फंक्शन का उपयोग करता है, के विपरीत sparklyr में ml_predict() फंक्शन इस्तेमाल होता है. ml_predict() दो आर्ग्युमेंट लेता है: एक मॉडल, और कुछ टेस्टिंग डेटा.

ml_predict(a_model, testing_data)

एक आम उपयोग यह है कि predicted responses को actual responses से तुलना करें, जिनके प्लॉट आप R में बना सकते हैं. इस डेटा को तैयार करने का कोड-पैटर्न नीचे दिया गया है. ध्यान दें कि अभी प्रेडिक्शन कॉलम जोड़ना लोकली करना पड़ता है, इसलिए आपको पहले रिजल्ट्स को collect करना होगा.

predicted_vs_actual <- testing_data %>%
  select(actual) %>%
  collect() %>%
  mutate(predicted)

यह अभ्यास पाठ्यक्रम का हिस्सा है

R में sparklyr के साथ Spark परिचय

पाठ्यक्रम देखें

अभ्यास निर्देश

आपके लिए spark_conn के रूप में एक Spark कनेक्शन बनाया गया है. Spark में स्टोर किए गए training और testing डेटासेट्स से जुड़े tibbles क्रमशः track_data_to_model_tbl और track_data_to_predict_tbl के रूप में पहले से परिभाषित हैं. Gradient boosted trees मॉडल gradient_boosted_trees_model के रूप में पहले से परिभाषित है.

  • एक वैरिएबल predicted परिभाषित करें जिसमें हमारे testing डेटा के लिए मॉडल की प्रेडिक्शंस हों.
    • मॉडल और testing डेटा को आर्ग्युमेंट्स के रूप में देकर ml_predict() कॉल करें. यह फंक्शन testing डेटासेट के लिए प्रेडिक्शंस जेनरेट करेगा और इन्हें prediction नामक नए कॉलम के रूप में जोड़ देगा.
    • pull() का उपयोग करके हम इस कॉलम को निकाल सकते हैं और predicted में असाइन कर सकते हैं.
  • predicted responses को actual responses से तुलना करने के लिए डेटा तैयार करने हेतु responses वैरिएबल परिभाषित करें:
    • रिस्पॉन्स कॉलम year चुनें.
    • रिजल्ट्स को collect करें.
    • mutate() का उपयोग करके predicted में बनी प्रेडिक्शंस को जोड़ें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Training, testing sets & model are pre-defined
track_data_to_model_tbl
track_data_to_predict_tbl
gradient_boosted_trees_model

# Predict the responses for the testing data
predicted <- ___(
      ___,
      ___) %>% pull(prediction)

# Prepare the data for comparing predicted responses with actual responses
responses <- track_data_to_predict_tbl %>%
  # Select the response column
  ___ %>%
  # Collect the results
  ___ %>%
  # Add in the predictions
  mutate(___)
कोड संपादित करें और चलाएँ