टेक्स्ट फ़िल्टर का उपयोग करके रिकॉर्ड हटाना
क्लाइंट से बहुत-से सवाल पूछना और अपने वैरिएबल्स को समझने के लिए समय देना हमेशा फ़ायदेमंद रहता है। आपको पता चलता है कि Assumable mortgage रियल एस्टेट इंडस्ट्री में असामान्य होता है, और आपका क्लाइंट इन्हें बाहर रखने का सुझाव देता है। इस अभ्यास में हम isin() का उपयोग करेंगे जो like() जैसा है, लेकिन इसमें हम एक वैल्यू के बजाय वैल्यू की लिस्ट फ़िल्टर के रूप में पास कर सकते हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Feature Engineering
अभ्यास निर्देश
- कॉलम
'ASSUMABLEMORTGAGE'में मौजूद अलग-अलग वैल्यू देखने के लिएselect()औरshow()का उपयोग करें, और सभी वैल्यू जिनमें'Yes'स्ट्रिंग आती है उनके लिए लिस्टyes_valuesबनाएँ. ~df['ASSUMABLEMORTGAGE'],isin(), और.isNull()का उपयोग करके एक NOT फ़िल्टर बनाएँ जो लिस्टyes_valuesमें मौजूद संबंधित वैल्यू वाले रिकॉर्ड्स को हटाए और null वैल्यू वाले रिकॉर्ड्स को रखे। इस फ़िल्टर को वैरिएबलtext_filterमें स्टोर करें.where()का उपयोग करकेtext_filterकोdfपर लागू करें.dfमें बची हुई रिकॉर्ड्स की संख्या प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Inspect unique values in the column 'ASSUMABLEMORTGAGE'
df.____([____]).distinct().____()
# List of possible values containing 'yes'
yes_values = [____, ____]
# Filter the text values out of df but keep null values
text_filter = ~df['ASSUMABLEMORTGAGE'].isin(____) | df['ASSUMABLEMORTGAGE'].isNull()
df = df.____(text_filter)
# Print count of remaining records
print(____.____())