ÎncepețiÎncepe gratuit

Folosirea filtrelor de text pentru eliminarea înregistrărilor

Merită să adresezi clienților cât mai multe întrebări și să aloci timp pentru a înțelege bine variabilele. Afli că ipoteca preluabilă (assumable mortgage) este o situație rară în industria imobiliară, iar clientul îți sugerează să excluzi aceste cazuri. În acest exercițiu, vei folosi isin(), care este similar cu like(), dar îți permite să transmiți o listă de valori ca filtru, în loc de o singură valoare.

Acest exercițiu face parte din cursul

Feature Engineering cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Folosește select() și show() pentru a inspecta valorile distincte din coloana 'ASSUMABLEMORTGAGE' și creează lista yes_values cu toate valorile care conțin șirul 'Yes'.
  • Folosește ~df['ASSUMABLEMORTGAGE'], isin() și .isNull() pentru a crea un filtru de tip NOT care să elimine înregistrările cu valorile corespunzătoare din lista yes_values și să păstreze înregistrările cu valori nule. Stochează acest filtru în variabila text_filter.
  • Folosește where() pentru a aplica text_filter asupra lui df.
  • Afișează numărul de înregistrări rămase în df.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Inspect unique values in the column 'ASSUMABLEMORTGAGE'
df.____([____]).distinct().____()

# List of possible values containing 'yes'
yes_values = [____, ____]

# Filter the text values out of df but keep null values
text_filter = ~df['ASSUMABLEMORTGAGE'].isin(____) | df['ASSUMABLEMORTGAGE'].isNull()
df = df.____(text_filter)

# Print count of remaining records
print(____.____())
Editează și rulează codul