LoslegenKostenlos starten

Zeitkomponenten

Mit Zeitkomponenten zu arbeiten ist für das Feature Engineering wichtig, du kannst sie aber auch nutzen, um deine Daten weiter zu erkunden und zu verstehen. In dieser Übung schaust du, ob es ein Muster gibt, an welchem Wochentag ein Haus gelistet wird. Bitte beachte: In PySpark beginnt die Woche am Sonntag mit dem Wert 1 und endet am Samstag mit dem Wert 7.

Diese Übung ist Teil des Kurses

<Kurs>Feature Engineering mit PySpark</Kurs>
Kurs ansehen

Übungsanweisungen

  • Importiere die Funktionen to_date() und dayofweek() aus pyspark.sql.functions.
  • Verwende die Funktion to_date(), um LISTDATE in einen Spark-Datentyp Datum umzuwandeln, und speichere die konvertierte Spalte mit withColumn() an Ort und Stelle.
  • Erstelle eine neue Spalte aus LISTDATE und dayofweek() und speichere sie mit withColumn() als List_Day_of_Week.
  • Sample die Hälfte des DataFrames und wandle es mit toPandas() in ein pandas-DataFrame um. Plotte anschließend die Häufigkeit der Spalte List_Day_of_Week des pandas-DataFrames mit dem seaborn-countplot() mit x = List_Day_of_Week.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Import needed functions
from ____ import ____, ____

# Convert to date type
df = df.____(____, ____(____))

# Get the day of the week
df = df.____(____, ____(____))

# Sample and convert to pandas dataframe
sample_df = df.sample(False, ____, 42).____()

# Plot count plot of of day of week
sns.____(x="List_Day_of_Week", data=____)
plt.show()
Code bearbeiten und ausführen