Filtrování textu pro odstranění záznamů
Vyplatí se klientům klást hodně otázek a věnovat čas pochopení jednotlivých proměnných. Zjistíš, že předpokladatelná hypotéka je v realitním odvětví neobvyklá záležitost a klient tě požádá, abys takové záznamy vyloučil/a. V tomto cvičení použiješ isin(), což je funkce podobná like(), ale umožňuje předat seznam hodnot jako filtr místo jedné jediné.
Toto cvičení je součástí kurzu
Feature Engineering with PySpark
Pokyny k cvičení
- Pomocí
select()ashow()prozkoumej různé hodnoty ve sloupci'ASSUMABLEMORTGAGE'a vytvoř seznamyes_valuespro všechny hodnoty obsahující řetězec'Yes'. - Pomocí
~df['ASSUMABLEMORTGAGE'],isin()a.isNull()vytvoř negační filtr, který odstraní záznamy s odpovídajícími hodnotami ze seznamuyes_valuesa zachová záznamy s hodnotou null. Ulož tento filtr do proměnnétext_filter. - Pomocí
where()aplikujtext_filternadf. - Vypiš počet záznamů, které v
dfzůstaly.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Inspect unique values in the column 'ASSUMABLEMORTGAGE'
df.____([____]).distinct().____()
# List of possible values containing 'yes'
yes_values = [____, ____]
# Filter the text values out of df but keep null values
text_filter = ~df['ASSUMABLEMORTGAGE'].isin(____) | df['ASSUMABLEMORTGAGE'].isNull()
df = df.____(text_filter)
# Print count of remaining records
print(____.____())