Görselleştirme Kullanımı: distplot
Bağımlı değişkenimizin dağılımını anlamak çok önemlidir ve yapacağımız model türünü veya önişlemeyi etkileyebilir. Bunu yapmanın harika bir yolu onu görselleştirmektir; ancak çizim PySpark'ta yerleşik bir işlev değildir, doğru çalıştığından emin olmak için bazı ara adımlar atmamız gerekir. Bu egzersizde 'LISTPRICE' değişkenini görselleştirecek ve çarpıklığını (skewness) hesaplayarak dağılımı hakkında daha fazla içgörü edineceksin.
matplotlib.pyplot ve seaborn paketleri senin için sırasıyla plt ve sns takma adlarıyla içe aktarıldı.
Bu egzersiz, kursun bir parçasıdır
PySpark ile Özellik Mühendisliği
Egzersiz talimatları
dfveri çerçevesinin %50'sinisample()ile örnekle; yerine koymadan örneklediğinden emin ol ve rassal tohumunu 42 olarak ayarla.- Spark DataFrame'i
toPandas()ile birpandas.DataFrame()'e dönüştür. seaborn'undistplot()metodunu kullanarak bir dağılım grafiği çiz.pyspark.sql.functionsiçindenskewness()fonksiyonunu içe aktar ve'LISTPRICE'sütununun toplamındaagg()metodu ile hesapla. Hesabı değerlendirmek için sonucucollect()etmeyi unutma.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Select a single column and sample and convert to pandas
sample_df = df.select(['LISTPRICE']).____(____, ____, 42)
pandas_df = sample_df.____()
# Plot distribution of pandas_df and display plot
sns.____(____)
plt.show()
# Import skewness function
from pyspark.sql.functions import skewness
# Compute and print skewness of LISTPRICE
print(df.____({____: ____}).collect())