Splitten & Explodieren
Ein zusammengesetztes Feld wie GARAGEDESCRIPTION in etwas Nützliches zu verwandeln, ist ein aufwendiger Prozess. Es hilft, früh zu verstehen, welchen Mehrwert du aus einer Aufteilung erzielen kannst. In diesem Beispiel wandeln wir unseren String in ein listenähnliches Array um, explodieren es und schauen uns dann die eindeutigen Werte an.
Diese Übung ist Teil des Kurses
<Kurs>Feature Engineering mit PySpark</Kurs>Übungsanweisungen
- Importiere die benötigten Funktionen
split()undexplode()auspyspark.sql.functions. - Verwende
split(), um eine neue Spaltegarage_listzu erstellen, indem dudf['GARAGEDESCRIPTION']an ", " trennst — das ist sowohl ein Komma als auch ein Leerzeichen. - Erzeuge mit
explode()für jeden Wert indf['garage_list']einen neuen Datensatz und weise ihn einer neuen Spalteex_garage_listzu. - Verwende
distinct(), um die einzigartigen Werte vonex_garage_listzu erhalten, undshow, um die ersten 100 Zeilen anzuzeigen; kürze die Werte zur Darstellung auf 50 Zeichen.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Import needed functions
____ ____ ____ ____, ____
# Convert string to list-like array
df = df.withColumn(____, ____(____, ____))
# Explode the values into new records
ex_df = df.withColumn(____, ____(____))
# Inspect the values
ex_df[['ex_garage_list']].____().____(100, ____=____)