Kom igångKom igång gratis

Heltal i PySpark UDF:er

Den här övningen handlar om UDF:er och ger dig en förståelse för hur man skapar funktioner i PySpark! Tänk på hur detta skulle kunna ersätta steg i ett arbetsflöde för datarensning.

Kom ihåg att det redan finns en SparkSession som heter spark i din arbetsmiljö!

Den här övningen är en del av kursen

Introduktion till PySpark

Visa kurs

Övningsinstruktioner

  • Registrera funktionen age_category som en UDF med namnet age_category_udf.
  • Lägg till en ny kolumn i DataFrame:n df med namnet "category" som tillämpar UDF:en för att kategorisera personer utifrån deras ålder. Argumentet till age_category_udf() är redan angivet.
  • Visa den resulterande DataFrame:n.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Register the function age_category as a UDF
age_category_udf = ____(age_category, StringType())

# Apply your udf to the DataFrame
age_category_df_2 = age_category_df.withColumn("category", ____(age_category_df["age"]))

# Show df
age_category_df_2.____
Redigera och kör kod