BaşlayınÜcretsiz başlayın

Pivot ve Join

Bileşik bir alanı explode edip pivotlamak harika, ancak geriye sadece pivotlanmış değerlerden oluşan bir dataframe kalır. Gerçekten işe yaraması için bunu orijinal veri kümesiyle yeniden birleştirmen gerekir! Veri kümelerini birleştirdikten sonra yeni oluşturulan sütunlar için çok sayıda NULL değerimiz olacak; nasıl oluşturulduklarını bildiğimiz için bunları güvenle sıfırla doldurabiliriz — ya yeni veride bir özellik vardır ya da yoktur.

Bu egzersiz, kursun bir parçasıdır

PySpark ile Özellik Mühendisliği

Kursa Göz Atın

Egzersiz talimatları

  • ex_garage_list değerlerini, kayıt id'si NO ile groupBy() yaparak pivotla; null'ları yok saymak ve ilk değeri almak için sağlanan kodla constant_val değerini topla.
  • piv_df'i NO birleştirme koşuluyla df ile left join yap.
  • piv_df üzerindeki columns özniteliğini kullanarak sıfırla doldurulacak sütunların listesini, zfill_cols, oluştur.
  • fillna() ve subset kullanarak pivotlanmış dataframe'in sütunlarını, zfill_cols, sıfırla doldur.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

from pyspark.sql.functions import coalesce, first

# Pivot 
piv_df = ex_df.____(____).____(____).agg(coalesce(first(____)))

# Join the dataframes together and fill null
joined_df = ____.join(____, on='NO', how=____)

# Columns to zero fill
zfill_cols = ____.____

# Zero fill the pivoted values
zfilled_df = joined_df.____(0, subset=____)
Kodu Düzenle ve Çalıştır