Začněte nyníZačněte zdarma

Odstranění seznamu sloupců

Náš dataset je bohatý na příznaky, ale ne všechny jsou užitečné. Některé se budou jen těžko upravovat do použitelné podoby. Pojďme prozatím odstranit sloupce, které pro nás nejsou okamžitě přínosné.

  • 'STREETNUMBERNUMERIC': Číslo popisné domu
  • 'FIREPLACES': Počet krbů v domě
  • 'LOTSIZEDIMENSIONS': Volný text popisující tvar pozemku
  • 'LISTTYPE': Pevný seznam hodnot typu prodeje
  • 'ACRES': Numerická rozloha pozemku

Toto cvičení je součástí kurzu

Feature Engineering with PySpark

Zobrazit kurz

Pokyny k cvičení

  • Přečti si popisy sloupců výše a prozkoumej jejich 30 nejčastějších hodnot pomocí show() – dataframe je již vyfiltrovaný na uvedené sloupce jako df.
  • Vytvoř seznam dvou sloupců, které chceš odstranit kvůli jejich malé relevanci pro předpověď cen nemovitostí – pojmenuj ho cols_to_drop. Nezapomeň, že počítače pracují pouze s čísly a nerozumí kontextu.
  • Pomocí funkce drop() odstraň sloupce ze seznamu cols_to_drop z dataframu df.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Show top 30 records
df.____(____)

# List of columns to remove from dataset
cols_to_drop = [____, ____]

# Drop columns in list
df = df.____(____)
Upravit a spustit kód