Zeitkomponenten
Mit Zeitkomponenten zu arbeiten ist für das Feature Engineering wichtig, du kannst sie aber auch nutzen, um deine Daten weiter zu erkunden und zu verstehen. In dieser Übung schaust du, ob es ein Muster gibt, an welchem Wochentag ein Haus gelistet wird. Bitte beachte: In PySpark beginnt die Woche am Sonntag mit dem Wert 1 und endet am Samstag mit dem Wert 7.
Diese Übung ist Teil des Kurses
<Kurs>Feature Engineering mit PySpark</Kurs>Übungsanweisungen
- Importiere die Funktionen
to_date()unddayofweek()auspyspark.sql.functions. - Verwende die Funktion
to_date(), umLISTDATEin einen Spark-Datentyp Datum umzuwandeln, und speichere die konvertierte Spalte mitwithColumn()an Ort und Stelle. - Erstelle eine neue Spalte aus
LISTDATEunddayofweek()und speichere sie mitwithColumn()alsList_Day_of_Week. - Sample die Hälfte des DataFrames und wandle es mit
toPandas()in ein pandas-DataFrame um. Plotte anschließend die Häufigkeit der SpalteList_Day_of_Weekdes pandas-DataFrames mit dem seaborn-countplot()mit x =List_Day_of_Week.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Import needed functions
from ____ import ____, ____
# Convert to date type
df = df.____(____, ____(____))
# Get the day of the week
df = df.____(____, ____(____))
# Sample and convert to pandas dataframe
sample_df = df.sample(False, ____, 42).____()
# Plot count plot of of day of week
sns.____(x="List_Day_of_Week", data=____)
plt.show()