LoslegenKostenlos starten

Splitten & Explodieren

Ein zusammengesetztes Feld wie GARAGEDESCRIPTION in etwas Nützliches zu verwandeln, ist ein aufwendiger Prozess. Es hilft, früh zu verstehen, welchen Mehrwert du aus einer Aufteilung erzielen kannst. In diesem Beispiel wandeln wir unseren String in ein listenähnliches Array um, explodieren es und schauen uns dann die eindeutigen Werte an.

Diese Übung ist Teil des Kurses

<Kurs>Feature Engineering mit PySpark</Kurs>
Kurs ansehen

Übungsanweisungen

  • Importiere die benötigten Funktionen split() und explode() aus pyspark.sql.functions.
  • Verwende split(), um eine neue Spalte garage_list zu erstellen, indem du df['GARAGEDESCRIPTION'] an ", " trennst — das ist sowohl ein Komma als auch ein Leerzeichen.
  • Erzeuge mit explode() für jeden Wert in df['garage_list'] einen neuen Datensatz und weise ihn einer neuen Spalte ex_garage_list zu.
  • Verwende distinct(), um die einzigartigen Werte von ex_garage_list zu erhalten, und show, um die ersten 100 Zeilen anzuzeigen; kürze die Werte zur Darstellung auf 50 Zeichen.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Import needed functions
____ ____ ____ ____, ____

# Convert string to list-like array
df = df.withColumn(____, ____(____, ____))

# Explode the values into new records
ex_df = df.withColumn(____, ____(____))

# Inspect the values
ex_df[['ex_garage_list']].____().____(100, ____=____)
Code bearbeiten und ausführen