Nombre de mots des conférences TED
ted est un dataframe qui contient les transcriptions de 500 conférences TED. Votre tâche est de calculer une nouvelle caractéristique word_count, qui contient le nombre approximatif de mots pour chaque conférence. Par conséquent, vous devez aussi calculer le nombre moyen de mots des conférences. Les transcriptions sont disponibles dans la caractéristique transcript de ted.
Pour réaliser cette tâche, vous devrez définir une fonction count_words qui reçoit une chaîne de caractères en argument et retourne le nombre de mots dans cette chaîne. Vous appliquerez ensuite cette fonction à la caractéristique transcript de ted pour créer la nouvelle caractéristique word_count et en calculer la moyenne.
Cette activité fait partie du cours
Ingénierie des caractéristiques pour le NLP en Python
Instructions de l’exercice
- Séparez
stringen une liste de mots à l'aide de la méthodesplit(). - Retournez le nombre d'éléments dans
wordsaveclen(). - Appliquez votre fonction à la colonne
transcriptdetedpour créer la nouvelle caractéristiqueword_count. - Calculez le nombre moyen de mots des conférences avec
mean().
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Function that returns number of words in a string
def count_words(string):
# Split the string into words
words = ____.____
# Return the number of words
return ____(____)
# Create a new feature word_count
ted['word_count'] = ted[____].apply(____)
# Print the average word count of the talks
print(ted[____].____)