Aan de slagBegin gratis

Een lijst met kolommen verwijderen

Onze gegevensset bevat veel features, maar niet allemaal zijn waardevol. Sommige zijn lastig om om te vormen tot iets bruikbaars. Laten we voor nu alle kolommen verwijderen die niet direct nuttig zijn.

  • 'STREETNUMBERNUMERIC': Het huisnummer in het postadres
  • 'FIREPLACES': Aantal open haarden in het huis
  • 'LOTSIZEDIMENSIONS': Vrije tekst die de vorm van het perceel beschrijft
  • 'LISTTYPE': Vastgestelde lijst met waarden voor het verkooptype
  • 'ACRES': Numerieke oppervlakte van de perceelgrootte

Deze oefening maakt deel uit van de cursus

Feature Engineering met PySpark

Bekijk cursus

Oefeninstructies

  • Lees de lijst met kolombeschrijvingen hierboven en bekijk hun top 30 waarden met show(). De dataframe is al gefilterd op de genoemde kolommen als df.
  • Maak een lijst van twee kolommen om te verwijderen op basis van hun beperkte relevantie voor het voorspellen van huizenprijzen, genaamd cols_to_drop. Onthoud dat computers alleen expliciet met getallen werken en geen context begrijpen.
  • Gebruik de functie drop() om de kolommen in de lijst cols_to_drop uit de dataframe df te verwijderen.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Show top 30 records
df.____(____)

# List of columns to remove from dataset
cols_to_drop = [____, ____]

# Drop columns in list
df = df.____(____)
Code bewerken en uitvoeren