Een lijst met kolommen verwijderen
Onze gegevensset bevat veel features, maar niet allemaal zijn waardevol. Sommige zijn lastig om om te vormen tot iets bruikbaars. Laten we voor nu alle kolommen verwijderen die niet direct nuttig zijn.
'STREETNUMBERNUMERIC': Het huisnummer in het postadres'FIREPLACES': Aantal open haarden in het huis'LOTSIZEDIMENSIONS': Vrije tekst die de vorm van het perceel beschrijft'LISTTYPE': Vastgestelde lijst met waarden voor het verkooptype'ACRES': Numerieke oppervlakte van de perceelgrootte
Deze oefening maakt deel uit van de cursus
Feature Engineering met PySpark
Oefeninstructies
- Lees de lijst met kolombeschrijvingen hierboven en bekijk hun top 30 waarden met
show(). De dataframe is al gefilterd op de genoemde kolommen alsdf. - Maak een lijst van twee kolommen om te verwijderen op basis van hun beperkte relevantie voor het voorspellen van huizenprijzen, genaamd
cols_to_drop. Onthoud dat computers alleen expliciet met getallen werken en geen context begrijpen. - Gebruik de functie
drop()om de kolommen in de lijstcols_to_dropuit de dataframedfte verwijderen.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Show top 30 records
df.____(____)
# List of columns to remove from dataset
cols_to_drop = [____, ____]
# Drop columns in list
df = df.____(____)