Wortanzahl von TED-Talks
ted ist ein DataFrame mit den Transkripten von 500 TED-Talks. Deine Aufgabe ist es, ein neues Feature word_count zu berechnen, das die ungefähre Anzahl der Wörter pro Talk enthält. Anschließend sollst du auch die durchschnittliche Wortanzahl der Talks bestimmen. Die Transkripte stehen in ted als Feature transcript zur Verfügung.
Um die Aufgabe zu lösen, definierst du eine Funktion count_words, die einen String als Argument entgegennimmt und die Anzahl der Wörter in diesem String zurückgibt. Diese Funktion wendest du dann auf das Feature transcript von ted an, um das neue Feature word_count zu erstellen und dessen Mittelwert zu berechnen.
Diese Übung ist Teil des Kurses
<Kurs>Feature Engineering für NLP in Python</Kurs>Übungsanweisungen
- Zerlege
stringmit der Methodesplit()in eine Liste von Wörtern. - Gib die Anzahl der Elemente in
wordsmitlen()zurück. - Wende deine Funktion auf die Spalte
transcriptvontedan, um das neue Featureword_countzu erstellen. - Berechne die durchschnittliche Wortanzahl der Talks mit
mean().
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Function that returns number of words in a string
def count_words(string):
# Split the string into words
words = ____.____
# Return the number of words
return ____(____)
# Create a new feature word_count
ted['word_count'] = ted[____].apply(____)
# Print the average word count of the talks
print(ted[____].____)