शुरू करेंमुफ़्त में शुरू करें

Flight duration मॉडल: Pipeline मॉडल

अब आप उन स्टेज़ को एक पाइपलाइन में जोड़ने के लिए तैयार हैं.

आप पाइपलाइन बनाएँगे और फिर उसे training डेटा पर ट्रेन करेंगे. इससे पाइपलाइन की हर स्टेज training डेटा पर क्रम से लागू होगी. किसी भी स्टेज को testing डेटा तक बिल्कुल पहुँच नहीं होगी: कोई leakage नहीं होगा!

जब पूरी पाइपलाइन ट्रेन हो जाएगी, तो उसे testing डेटा पर प्रेडिक्शन करने के लिए इस्तेमाल किया जाएगा.

डेटा flights के रूप में उपलब्ध है, जिसे रैंडम तरीके से flights_train और flights_test में बाँटा गया है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Machine Learning

पाठ्यक्रम देखें

अभ्यास निर्देश

  • पाइपलाइन बनाने वाले क्लास को इम्पोर्ट करें.
  • एक पाइपलाइन ऑब्जेक्ट बनाएँ और क्रम से indexer, onehot, assembler और regression स्टेज़ स्पेसिफाई करें.
  • पाइपलाइन को training डेटा पर ट्रेन करें.
  • testing डेटा पर प्रेडिक्शन करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Import class for creating a pipeline
from pyspark.____ import ____

# Construct a pipeline
pipeline = ____(____=[____])

# Train the pipeline on the training data
pipeline = pipeline.____(____)

# Make predictions on the testing data
predictions = ____.____(____)
कोड संपादित करें और चलाएँ