CommencezCommencez gratuitement

Fractionner en colonnes

Vous avez nettement nettoyé vos données en retirant les lignes non valides du DataFrame. Vous souhaitez maintenant effectuer d'autres transformations en générant des colonnes précises et parlantes à partir du contenu du DataFrame.

Vous disposez du contexte spark et de la plus récente version du DataFrame annotations_df. pyspark.sql.functions est accessible sous l'alias F.

Cette activité fait partie du cours

Nettoyer des données avec PySpark

Voir le cours

Instructions de l’exercice

  • Fractionnez le contenu de la colonne '_c0' sur le caractère de tabulation et stockez le résultat dans une variable appelée split_cols.
  • Ajoutez les colonnes suivantes en fonction des quatre premières entrées de la variable ci-dessus : folder, filename, width, height sur un DataFrame nommé split_df.
  • Ajoutez la variable split_cols comme colonne.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Split the content of _c0 on the tab character (aka, '\t')
split_cols = ____(annotations_df['____'], '\t')

# Add the columns folder, filename, width, and height
split_df = annotations_df.withColumn('folder', split_cols.getItem(____))
split_df = split_df.withColumn('filename', ____
split_df = split_df.____
____

# Add split_cols as a column
split_df = split_df.____
Modifier et exécuter le code