शर्तों के साथ संख्यात्मक फ़ील्ड फ़िल्टर करना
एक बार फिर, अपने डेटा का संदर्भ समझना बेहद ज़रूरी है। हम यह समझना चाहते हैं कि घर आम तौर पर किस रेंज में बिकते हैं। चलिए यह सुनिश्चित करें कि ऐसे किसी भी outlier घर को बाहर रखें जो औसत से बहुत ज़्यादा या कम कीमत पर बिका हो। यहाँ हम mean और standard deviation निकालेंगे और उनका उपयोग करके लगभग-normal फ़ील्ड log_SalesClosePrice को फ़िल्टर करेंगे।
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Feature Engineering
अभ्यास निर्देश
pyspark.sql.functionsसेmean()औरstddev()इम्पोर्ट करें.- इम्पोर्ट किए गए फंक्शन के साथ
'log_SalesClosePrice'के लिए mean और standard deviation निकालने के लिएagg()का उपयोग करें. mean_valमें से/जोड़करstddev_valके 3 गुना को लेने से upper और lower bounds बनाएँ.'log_SalesClosePrice'के लिएwhere()फ़िल्टर बनाएँ जिसमेंlow_boundऔरhi_boundदोनों का उपयोग हो.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
from ____ import ____, ____
# Calculate values used for outlier filtering
mean_val = df.____({____: ____}).collect()[0][0]
stddev_val = df.____({____: ____}).collect()[0][0]
# Create three standard deviation (μ ± 3σ) lower and upper bounds for data
low_bound = ____ - (3 * ____)
hi_bound = ____ + (3 * ____)
# Filter the data to fit between the lower and upper bounds
df = df.____((df[____] < ____) ____ (df[____] > ____))