शुरू करेंमुफ़्त में शुरू करें

Visualizations का उपयोग: distplot

हमारे dependent वैरिएबल का distribution समझना बहुत ज़रूरी है और यह तय कर सकता है कि हम कौन सा मॉडल या preprocessing करेंगे. इसे देखने का बढ़िया तरीका इसे plot करना है. हालाँकि PySpark में plotting built-in नहीं है, इसलिए इसे सही तरह चलाने के लिए कुछ बीच के कदम लेने होंगे. इस अभ्यास में आप 'LISTPRICE' वैरिएबल को visualize करेंगे, और उसकी skewness निकालकर उसके distribution के बारे में और समझ पाएँगे.

matplotlib.pyplot और seaborn पैकेज आपके लिए क्रमशः plt और sns उपनामों के साथ इम्पोर्ट किए गए हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Feature Engineering

पाठ्यक्रम देखें

अभ्यास निर्देश

  • sample() का उपयोग करके dataframe df का 50% sample लें, यह सुनिश्चित करते हुए कि replacement न हो और random seed 42 सेट हो.
  • Spark DataFrame को toPandas() के साथ pandas.DataFrame() में बदलें.
  • seaborn के distplot() मेथड से एक distribution plot बनाएँ.
  • pyspark.sql.functions से skewness() फंक्शन इम्पोर्ट करें और 'LISTPRICE' कॉलम पर agg() मेथड के साथ इसे compute करें. परिणाम evaluate करने के लिए collect() करना न भूलें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Select a single column and sample and convert to pandas
sample_df = df.select(['LISTPRICE']).____(____, ____, 42)
pandas_df = sample_df.____()

# Plot distribution of pandas_df and display plot
sns.____(____)
plt.show()

# Import skewness function
from pyspark.sql.functions import skewness

# Compute and print skewness of LISTPRICE
print(df.____({____: ____}).collect())
कोड संपादित करें और चलाएँ