ÎncepețiÎncepe gratuit

Eliminarea unei liste de coloane

Setul nostru de date este bogat în caracteristici, dar nu toate sunt valoroase. Multe dintre ele vor fi greu de prelucrat într-un mod util. Deocamdată, hai să eliminăm coloanele care nu sunt imediat relevante.

  • 'STREETNUMBERNUMERIC': Numărul poștal al imobilului
  • 'FIREPLACES': Numărul de șeminee din locuință
  • 'LOTSIZEDIMENSIONS': Text liber care descrie forma parcelei
  • 'LISTTYPE': Listă predefinită de valori ale tipului de vânzare
  • 'ACRES': Suprafața numerică a parcelei

Acest exercițiu face parte din cursul

Feature Engineering cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Citește lista de descrieri ale coloanelor de mai sus și explorează primele 30 de valori ale fiecăreia folosind show() — cadrul de date este deja filtrat la coloanele listate sub numele df.
  • Creează o listă cu două coloane de eliminat, pe baza lipsei lor de relevanță pentru predicția prețurilor imobiliare, și numește-o cols_to_drop. Ține minte că algoritmii interpretează explicit doar numerele și nu înțeleg contextul.
  • Folosește funcția drop() pentru a elimina din cadrul de date df coloanele din lista cols_to_drop.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Show top 30 records
df.____(____)

# List of columns to remove from dataset
cols_to_drop = [____, ____]

# Drop columns in list
df = df.____(____)
Editează și rulează codul