Fractionner en colonnes
Vous avez nettement nettoyé vos données en retirant les lignes non valides du DataFrame. Vous souhaitez maintenant effectuer d'autres transformations en générant des colonnes précises et parlantes à partir du contenu du DataFrame.
Vous disposez du contexte spark et de la plus récente version du DataFrame annotations_df. pyspark.sql.functions est accessible sous l'alias F.
Cette activité fait partie du cours
Nettoyer des données avec PySpark
Instructions de l’exercice
- Fractionnez le contenu de la colonne
'_c0'sur le caractère de tabulation et stockez le résultat dans une variable appeléesplit_cols. - Ajoutez les colonnes suivantes en fonction des quatre premières entrées de la variable ci-dessus : folder, filename, width, height sur un DataFrame nommé
split_df. - Ajoutez la variable
split_colscomme colonne.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Split the content of _c0 on the tab character (aka, '\t')
split_cols = ____(annotations_df['____'], '\t')
# Add the columns folder, filename, width, and height
split_df = annotations_df.withColumn('folder', split_cols.getItem(____))
split_df = split_df.withColumn('filename', ____
split_df = split_df.____
____
# Add split_cols as a column
split_df = split_df.____