ÎncepețiÎncepe gratuit

Splitting & Exploding

Preluarea unui câmp compus precum GARAGEDESCRIPTION și transformarea lui în ceva util este un proces care implică mai mulți pași. Este bine să înțelegi de la început ce valoare poți obține din extinderea acestuia. În acest exemplu, vom converti șirul de caractere într-un array de tip listă, îl vom exploda și apoi vom inspecta valorile unice.

Acest exercițiu face parte din cursul

Feature Engineering cu PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă funcțiile necesare split() și explode() din pyspark.sql.functions
  • Folosește split() pentru a crea o nouă coloană garage_list, împărțind df['GARAGEDESCRIPTION'] după ', ' – adică o virgulă urmată de un spațiu.
  • Creează o înregistrare nouă pentru fiecare valoare din df['garage_list'] folosind explode() și atribuie-o unei noi coloane ex_garage_list
  • Folosește distinct() pentru a obține valorile unice ale coloanei ex_garage_list și afișează primele 100 de rânduri cu show, trunchindu-le la 50 de caractere.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import needed functions
____ ____ ____ ____, ____

# Convert string to list-like array
df = df.withColumn(____, ____(____, ____))

# Explode the values into new records
ex_df = df.withColumn(____, ____(____))

# Inspect the values
ex_df[['ex_garage_list']].____().____(100, ____=____)
Editează și rulează codul