शुरू करेंमुफ़्त में शुरू करें

टेक्स्ट फ़िल्टर का उपयोग करके रिकॉर्ड हटाना

क्लाइंट से बहुत-से सवाल पूछना और अपने वैरिएबल्स को समझने के लिए समय देना हमेशा फ़ायदेमंद रहता है। आपको पता चलता है कि Assumable mortgage रियल एस्टेट इंडस्ट्री में असामान्य होता है, और आपका क्लाइंट इन्हें बाहर रखने का सुझाव देता है। इस अभ्यास में हम isin() का उपयोग करेंगे जो like() जैसा है, लेकिन इसमें हम एक वैल्यू के बजाय वैल्यू की लिस्ट फ़िल्टर के रूप में पास कर सकते हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Feature Engineering

पाठ्यक्रम देखें

अभ्यास निर्देश

  • कॉलम 'ASSUMABLEMORTGAGE' में मौजूद अलग-अलग वैल्यू देखने के लिए select() और show() का उपयोग करें, और सभी वैल्यू जिनमें 'Yes' स्ट्रिंग आती है उनके लिए लिस्ट yes_values बनाएँ.
  • ~df['ASSUMABLEMORTGAGE'], isin(), और .isNull() का उपयोग करके एक NOT फ़िल्टर बनाएँ जो लिस्ट yes_values में मौजूद संबंधित वैल्यू वाले रिकॉर्ड्स को हटाए और null वैल्यू वाले रिकॉर्ड्स को रखे। इस फ़िल्टर को वैरिएबल text_filter में स्टोर करें.
  • where() का उपयोग करके text_filter को df पर लागू करें.
  • df में बची हुई रिकॉर्ड्स की संख्या प्रिंट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Inspect unique values in the column 'ASSUMABLEMORTGAGE'
df.____([____]).distinct().____()

# List of possible values containing 'yes'
yes_values = [____, ____]

# Filter the text values out of df but keep null values
text_filter = ~df['ASSUMABLEMORTGAGE'].isin(____) | df['ASSUMABLEMORTGAGE'].isNull()
df = df.____(text_filter)

# Print count of remaining records
print(____.____())
कोड संपादित करें और चलाएँ