Kom igångKom igång gratis

Använda textfilter för att ta bort poster

Det lönar sig att ställa många frågor till sina kunder och ta sig tid att förstå variablerna. Du får reda på att assumable mortgage är ovanligt inom fastighetsbranschen och din kund föreslår att du exkluderar sådana poster. I den här övningen använder vi isin(), som liknar like() men låter dig skicka en lista med värden som filter i stället för ett enskilt värde.

Den här övningen är en del av kursen

Feature Engineering med PySpark

Visa kurs

Övningsinstruktioner

  • Använd select() och show() för att undersöka de distinkta värdena i kolumnen 'ASSUMABLEMORTGAGE' och skapa listan yes_values för alla värden som innehåller strängen 'Yes'.
  • Använd ~df['ASSUMABLEMORTGAGE'], isin() och .isNull() för att skapa ett NOT-filter som tar bort poster med motsvarande värden i listan yes_values och behåller poster med null-värden. Lagra filtret i variabeln text_filter.
  • Använd where() för att tillämpa text_filterdf.
  • Skriv ut antalet poster som återstår i df.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Inspect unique values in the column 'ASSUMABLEMORTGAGE'
df.____([____]).distinct().____()

# List of possible values containing 'yes'
yes_values = [____, ____]

# Filter the text values out of df but keep null values
text_filter = ~df['ASSUMABLEMORTGAGE'].isin(____) | df['ASSUMABLEMORTGAGE'].isNull()
df = df.____(text_filter)

# Print count of remaining records
print(____.____())
Redigera och kör kod