Usare filtri di testo per rimuovere i record
Conviene fare molte domande ai clienti e prendersi il tempo per capire bene le variabili. Scopri che l’assumable mortgage è un evento poco comune nel settore immobiliare e il cliente ti suggerisce di escluderlo. In questo esercizio useremo isin(), simile a like() ma che permette di passare un elenco di valori da usare come filtro invece di un singolo valore.
Questo esercizio fa parte del corso
Feature Engineering con PySpark
Istruzioni dell'esercizio
- Usa
select()eshow()per ispezionare i valori distinti nella colonna'ASSUMABLEMORTGAGE'e crea la listayes_valuesper tutti i valori che contengono la stringa'Yes'. - Usa
~df['ASSUMABLEMORTGAGE'],isin()e.isNull()per creare un filtro NOT che rimuova i record contenenti i valori corrispondenti nella listayes_valuese mantenga i record con valori nulli. Salva questo filtro nella variabiletext_filter. - Usa
where()per applicaretext_filteradf. - Stampa il numero di record rimanenti in
df.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Inspect unique values in the column 'ASSUMABLEMORTGAGE'
df.____([____]).distinct().____()
# List of possible values containing 'yes'
yes_values = [____, ____]
# Filter the text values out of df but keep null values
text_filter = ~df['ASSUMABLEMORTGAGE'].isin(____) | df['ASSUMABLEMORTGAGE'].isNull()
df = df.____(text_filter)
# Print count of remaining records
print(____.____())