Daten laden
Daten einzulesen ist der erste Schritt, um PySpark für Data Science zu nutzen! Lass uns das neue Branchenformat Parquet-Dateien verwenden!
Diese Übung ist Teil des Kurses
<Kurs>Feature Engineering mit PySpark</Kurs>Übungsanweisungen
- Verwende den
parquet()-Dateileser, um'Real_Estate.parq'wie in der Video-Übung beschrieben einzulesen. - Gib die Liste der Spalten mit
columnsaus.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Read the file into a dataframe
df = spark.read.____(____)
# Print columns in dataframe
____(df.____)