Eliminarea unei liste de coloane
Setul nostru de date este bogat în caracteristici, dar nu toate sunt valoroase. Multe dintre ele vor fi greu de prelucrat într-un mod util. Deocamdată, hai să eliminăm coloanele care nu sunt imediat relevante.
'STREETNUMBERNUMERIC': Numărul poștal al imobilului'FIREPLACES': Numărul de șeminee din locuință'LOTSIZEDIMENSIONS': Text liber care descrie forma parcelei'LISTTYPE': Listă predefinită de valori ale tipului de vânzare'ACRES': Suprafața numerică a parcelei
Acest exercițiu face parte din cursul
Feature Engineering cu PySpark
Instrucțiuni pentru exercițiu
- Citește lista de descrieri ale coloanelor de mai sus și explorează primele 30 de valori ale fiecăreia folosind
show()— cadrul de date este deja filtrat la coloanele listate sub numeledf. - Creează o listă cu două coloane de eliminat, pe baza lipsei lor de relevanță pentru predicția prețurilor imobiliare, și numește-o
cols_to_drop. Ține minte că algoritmii interpretează explicit doar numerele și nu înțeleg contextul. - Folosește funcția
drop()pentru a elimina din cadrul de datedfcoloanele din listacols_to_drop.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Show top 30 records
df.____(____)
# List of columns to remove from dataset
cols_to_drop = [____, ____]
# Drop columns in list
df = df.____(____)