Laad de data in
Data inlezen is de eerste stap om PySpark te gebruiken voor data science! Laten we het nieuwe industriestandaardformaat, parquet-bestanden, benutten!
Deze oefening maakt deel uit van de cursus
Feature Engineering met PySpark
Oefeninstructies
- Gebruik de
parquet()-lezer om'Real_Estate.parq'in te lezen, zoals uitgelegd in de video-oefening. - Print de lijst met kolommen met
columns.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Read the file into a dataframe
df = spark.read.____(____)
# Print columns in dataframe
____(df.____)