BaşlayınÜcretsiz başlayın

Görselleştirme Kullanımı: distplot

Bağımlı değişkenimizin dağılımını anlamak çok önemlidir ve yapacağımız model türünü veya önişlemeyi etkileyebilir. Bunu yapmanın harika bir yolu onu görselleştirmektir; ancak çizim PySpark'ta yerleşik bir işlev değildir, doğru çalıştığından emin olmak için bazı ara adımlar atmamız gerekir. Bu egzersizde 'LISTPRICE' değişkenini görselleştirecek ve çarpıklığını (skewness) hesaplayarak dağılımı hakkında daha fazla içgörü edineceksin.

matplotlib.pyplot ve seaborn paketleri senin için sırasıyla plt ve sns takma adlarıyla içe aktarıldı.

Bu egzersiz, kursun bir parçasıdır

PySpark ile Özellik Mühendisliği

Kursa Göz Atın

Egzersiz talimatları

  • df veri çerçevesinin %50'sini sample() ile örnekle; yerine koymadan örneklediğinden emin ol ve rassal tohumunu 42 olarak ayarla.
  • Spark DataFrame'i toPandas() ile bir pandas.DataFrame()'e dönüştür.
  • seaborn'un distplot() metodunu kullanarak bir dağılım grafiği çiz.
  • pyspark.sql.functions içinden skewness() fonksiyonunu içe aktar ve 'LISTPRICE' sütununun toplamında agg() metodu ile hesapla. Hesabı değerlendirmek için sonucu collect() etmeyi unutma.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Select a single column and sample and convert to pandas
sample_df = df.select(['LISTPRICE']).____(____, ____, 42)
pandas_df = sample_df.____()

# Plot distribution of pandas_df and display plot
sns.____(____)
plt.show()

# Import skewness function
from pyspark.sql.functions import skewness

# Compute and print skewness of LISTPRICE
print(df.____({____: ____}).collect())
Kodu Düzenle ve Çalıştır