Visualizations का उपयोग: distplot
हमारे dependent वैरिएबल का distribution समझना बहुत ज़रूरी है और यह तय कर सकता है कि हम कौन सा मॉडल या preprocessing करेंगे. इसे देखने का बढ़िया तरीका इसे plot करना है. हालाँकि PySpark में plotting built-in नहीं है, इसलिए इसे सही तरह चलाने के लिए कुछ बीच के कदम लेने होंगे. इस अभ्यास में आप 'LISTPRICE' वैरिएबल को visualize करेंगे, और उसकी skewness निकालकर उसके distribution के बारे में और समझ पाएँगे.
matplotlib.pyplot और seaborn पैकेज आपके लिए क्रमशः plt और sns उपनामों के साथ इम्पोर्ट किए गए हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Feature Engineering
अभ्यास निर्देश
sample()का उपयोग करके dataframedfका 50% sample लें, यह सुनिश्चित करते हुए कि replacement न हो और random seed 42 सेट हो.- Spark DataFrame को
toPandas()के साथpandas.DataFrame()में बदलें. seabornकेdistplot()मेथड से एक distribution plot बनाएँ.pyspark.sql.functionsसेskewness()फंक्शन इम्पोर्ट करें और'LISTPRICE'कॉलम परagg()मेथड के साथ इसे compute करें. परिणाम evaluate करने के लिएcollect()करना न भूलें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Select a single column and sample and convert to pandas
sample_df = df.select(['LISTPRICE']).____(____, ____, 42)
pandas_df = sample_df.____()
# Plot distribution of pandas_df and display plot
sns.____(____)
plt.show()
# Import skewness function
from pyspark.sql.functions import skewness
# Compute and print skewness of LISTPRICE
print(df.____({____: ____}).collect())