Inizia subitoInizia gratis

Usare filtri di testo per rimuovere i record

Conviene fare molte domande ai clienti e prendersi il tempo per capire bene le variabili. Scopri che l’assumable mortgage è un evento poco comune nel settore immobiliare e il cliente ti suggerisce di escluderlo. In questo esercizio useremo isin(), simile a like() ma che permette di passare un elenco di valori da usare come filtro invece di un singolo valore.

Questo esercizio fa parte del corso

Feature Engineering con PySpark

Visualizza corso

Istruzioni dell'esercizio

  • Usa select() e show() per ispezionare i valori distinti nella colonna 'ASSUMABLEMORTGAGE' e crea la lista yes_values per tutti i valori che contengono la stringa 'Yes'.
  • Usa ~df['ASSUMABLEMORTGAGE'], isin() e .isNull() per creare un filtro NOT che rimuova i record contenenti i valori corrispondenti nella lista yes_values e mantenga i record con valori nulli. Salva questo filtro nella variabile text_filter.
  • Usa where() per applicare text_filter a df.
  • Stampa il numero di record rimanenti in df.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Inspect unique values in the column 'ASSUMABLEMORTGAGE'
df.____([____]).distinct().____()

# List of possible values containing 'yes'
yes_values = [____, ____]

# Filter the text values out of df but keep null values
text_filter = ~df['ASSUMABLEMORTGAGE'].isin(____) | df['ASSUMABLEMORTGAGE'].isNull()
df = df.____(text_filter)

# Print count of remaining records
print(____.____())
Modifica ed esegui il codice