Dzielenie i rozwijanie danych
Przetworzenie złożonego pola, takiego jak GARAGEDESCRIPTION, w coś naprawdę użytecznego to wieloetapowy proces. Warto jak najwcześniej sprawdzić, jaką wartość można uzyskać z jego rozwinięcia. W tym ćwiczeniu przekształcimy nasz łańcuch znaków w tablicę, rozwiniemy ją i przyjrzymy się unikalnym wartościom.
To ćwiczenie jest częścią kursu
Inżynieria cech z PySpark
Instrukcje do ćwiczenia
- Zaimportuj potrzebne funkcje
split()iexplode()zpyspark.sql.functions. - Użyj
split(), aby utworzyć nową kolumnęgarage_list, dzielącdf['GARAGEDESCRIPTION']po ', ' – czyli po przecinku i spacji. - Użyj
explode(), aby dla każdej wartości wdf['garage_list']utworzyć osobny rekord i przypisz go do nowej kolumnyex_garage_list. - Użyj
distinct(), aby uzyskać unikalne wartości kolumnyex_garage_list, a następnie wywołajshowdla 100 pierwszych wierszy, ograniczając wyświetlanie do 50 znaków.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import needed functions
____ ____ ____ ____, ____
# Convert string to list-like array
df = df.withColumn(____, ____(____, ____))
# Explode the values into new records
ex_df = df.withColumn(____, ____(____))
# Inspect the values
ex_df[['ex_garage_list']].____().____(100, ____=____)