शुरू करेंमुफ़्त में शुरू करें

शर्तों के साथ संख्यात्मक फ़ील्ड फ़िल्टर करना

एक बार फिर, अपने डेटा का संदर्भ समझना बेहद ज़रूरी है। हम यह समझना चाहते हैं कि घर आम तौर पर किस रेंज में बिकते हैं। चलिए यह सुनिश्चित करें कि ऐसे किसी भी outlier घर को बाहर रखें जो औसत से बहुत ज़्यादा या कम कीमत पर बिका हो। यहाँ हम mean और standard deviation निकालेंगे और उनका उपयोग करके लगभग-normal फ़ील्ड log_SalesClosePrice को फ़िल्टर करेंगे।

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Feature Engineering

पाठ्यक्रम देखें

अभ्यास निर्देश

  • pyspark.sql.functions से mean() और stddev() इम्पोर्ट करें.
  • इम्पोर्ट किए गए फंक्शन के साथ 'log_SalesClosePrice' के लिए mean और standard deviation निकालने के लिए agg() का उपयोग करें.
  • mean_val में से/जोड़कर stddev_val के 3 गुना को लेने से upper और lower bounds बनाएँ.
  • 'log_SalesClosePrice' के लिए where() फ़िल्टर बनाएँ जिसमें low_bound और hi_bound दोनों का उपयोग हो.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

from ____ import ____, ____

# Calculate values used for outlier filtering
mean_val = df.____({____: ____}).collect()[0][0]
stddev_val = df.____({____: ____}).collect()[0][0]

# Create three standard deviation (μ ± 3σ) lower and upper bounds for data
low_bound = ____ - (3 * ____)
hi_bound = ____ + (3 * ____)

# Filter the data to fit between the lower and upper bounds
df = df.____((df[____] < ____) ____ (df[____] > ____))
कोड संपादित करें और चलाएँ