ÎncepețiÎncepe gratuit

Numere întregi în UDF-uri PySpark

Acest exercițiu abordează UDF-urile și te ajută să înțelegi cum se creează funcții în PySpark! Pe măsură ce lucrezi la el, gândește-te cum ar putea înlocui pași dintr-un flux de curățare a datelor.

Reține că în spațiul tău de lucru există deja o SparkSession numită spark!

Acest exercițiu face parte din cursul

Introducere în PySpark

Vezi cursul

Instrucțiuni pentru exercițiu

  • Înregistrează funcția age_category ca UDF cu numele age_category_udf.
  • Adaugă o coloană nouă în DataFrame-ul df, numită "category", care aplică UDF-ul pentru a categoriza persoanele în funcție de vârstă. Argumentul pentru age_category_udf() este deja furnizat.
  • Afișează DataFrame-ul rezultat.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Register the function age_category as a UDF
age_category_udf = ____(age_category, StringType())

# Apply your udf to the DataFrame
age_category_df_2 = age_category_df.withColumn("category", ____(age_category_df["age"]))

# Show df
age_category_df_2.____
Editează și rulează codul