Kayıtları kaldırmak için metin filtreleri kullanma
Müşterilerine bol bol soru sormak ve değişkenlerini anlamaya zaman ayırmak her zaman işe yarar. Emlak sektöründe devredilebilir mortgage’ların (Assumable mortgage) alışılmadık olduğunu öğreniyorsun ve müşterin bunları hariç tutmanı öneriyor. Bu egzersizde like()’a benzer olan, ancak tek bir değer yerine filtre olarak kullanılacak bir değer listesi geçmemize izin veren isin() fonksiyonunu kullanacağız.
Bu egzersiz, kursun bir parçasıdır
PySpark ile Özellik Mühendisliği
Egzersiz talimatları
'ASSUMABLEMORTGAGE'sütunundaki farklı değerleri incelemek içinselect()veshow()kullan ve'Yes'dizgesini içeren tüm değerler içinyes_valueslistesini oluştur.~df['ASSUMABLEMORTGAGE'],isin()ve.isNull()kullanarak, listedekiyes_valuesile eşleşen değerleri içeren kayıtları kaldıran ve null değerli kayıtları tutan bir NOT filtresi oluştur. Bu filtreyitext_filterdeğişkeninde sakla.where()kullanaraktext_filterfiltresinidf’e uygula.dfiçinde kalan kayıt sayısını yazdır.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Inspect unique values in the column 'ASSUMABLEMORTGAGE'
df.____([____]).distinct().____()
# List of possible values containing 'yes'
yes_values = [____, ____]
# Filter the text values out of df but keep null values
text_filter = ~df['ASSUMABLEMORTGAGE'].isin(____) | df['ASSUMABLEMORTGAGE'].isNull()
df = df.____(text_filter)
# Print count of remaining records
print(____.____())