शुरू करेंमुफ़्त में शुरू करें

डेटा को स्प्लिट करें

अब जब आपने सभी मैनिपुलेशन कर लिए हैं, तो मॉडलिंग से पहले आखिरी कदम है डेटा को स्प्लिट करना!

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark की नींव

पाठ्यक्रम देखें

अभ्यास निर्देश

  • DataFrame मेथड .randomSplit() का उपयोग करके piped_data को दो भागों में बाँटें: training में 60% डेटा और test में 40% डेटा. इसके लिए .randomSplit() मेथड को सूची [.6, .4] पास करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Split the data into training and test sets
training, test = piped_data.randomSplit(____)
कोड संपादित करें और चलाएँ