Začněte nyníZačněte zdarma

Filtrování textu pro odstranění záznamů

Vyplatí se klientům klást hodně otázek a věnovat čas pochopení jednotlivých proměnných. Zjistíš, že předpokladatelná hypotéka je v realitním odvětví neobvyklá záležitost a klient tě požádá, abys takové záznamy vyloučil/a. V tomto cvičení použiješ isin(), což je funkce podobná like(), ale umožňuje předat seznam hodnot jako filtr místo jedné jediné.

Toto cvičení je součástí kurzu

Feature Engineering with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Pomocí select() a show() prozkoumej různé hodnoty ve sloupci 'ASSUMABLEMORTGAGE' a vytvoř seznam yes_values pro všechny hodnoty obsahující řetězec 'Yes'.
  • Pomocí ~df['ASSUMABLEMORTGAGE'], isin() a .isNull() vytvoř negační filtr, který odstraní záznamy s odpovídajícími hodnotami ze seznamu yes_values a zachová záznamy s hodnotou null. Ulož tento filtr do proměnné text_filter.
  • Pomocí where() aplikuj text_filter na df.
  • Vypiš počet záznamů, které v df zůstaly.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Inspect unique values in the column 'ASSUMABLEMORTGAGE'
df.____([____]).distinct().____()

# List of possible values containing 'yes'
yes_values = [____, ____]

# Filter the text values out of df but keep null values
text_filter = ~df['ASSUMABLEMORTGAGE'].isin(____) | df['ASSUMABLEMORTGAGE'].isNull()
df = df.____(text_filter)

# Print count of remaining records
print(____.____())
Upravit a spustit kód