CommencezCommencez gratuitement

Fractionner et exploser une colonne de texte

Un dataframe clauses_df de 100 lignes est fourni. Il contient une colonne clause et un identifiant de ligne. Chaque clause est une chaîne de caractères composée d'un ou de plusieurs mots séparés par des espaces.

Cette activité fait partie du cours

Introduction à Spark SQL en Python

Voir le cours

Instructions de l’exercice

  • Fractionnez la colonne clause en une colonne nommée words, qui contient un tableau de mots individuels.
  • Explosez la colonne words en une colonne nommée word.
  • Comptez le nombre de lignes obtenues.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Split the clause column into a column called words 
split_df = clauses_df.select(____('clause', ' ').____('words'))
split_df.show(5, truncate=False)

# Explode the words column into a column called word 
exploded_df = split_df.____(____('____').____('word'))
exploded_df.show(10)

# Count the resulting number of rows in exploded_df
print("\nNumber of rows: ", ____)
Modifier et exécuter le code