Zacznij terazZacznij za darmo

Dzielenie i rozwijanie danych

Przetworzenie złożonego pola, takiego jak GARAGEDESCRIPTION, w coś naprawdę użytecznego to wieloetapowy proces. Warto jak najwcześniej sprawdzić, jaką wartość można uzyskać z jego rozwinięcia. W tym ćwiczeniu przekształcimy nasz łańcuch znaków w tablicę, rozwiniemy ją i przyjrzymy się unikalnym wartościom.

To ćwiczenie jest częścią kursu

Inżynieria cech z PySpark

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj potrzebne funkcje split() i explode() z pyspark.sql.functions.
  • Użyj split(), aby utworzyć nową kolumnę garage_list, dzieląc df['GARAGEDESCRIPTION'] po ', ' – czyli po przecinku i spacji.
  • Użyj explode(), aby dla każdej wartości w df['garage_list'] utworzyć osobny rekord i przypisz go do nowej kolumny ex_garage_list.
  • Użyj distinct(), aby uzyskać unikalne wartości kolumny ex_garage_list, a następnie wywołaj show dla 100 pierwszych wierszy, ograniczając wyświetlanie do 50 znaków.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import needed functions
____ ____ ____ ____, ____

# Convert string to list-like array
df = df.withColumn(____, ____(____, ____))

# Explode the values into new records
ex_df = df.withColumn(____, ____(____))

# Inspect the values
ex_df[['ex_garage_list']].____().____(100, ____=____)
Edytuj i uruchom kod