Ordantal i TED-föreläsningar
ted är en dataram som innehåller transkript från 500 TED-föreläsningar. Din uppgift är att beräkna ett nytt särdrag, word_count, som innehåller det ungefärliga antalet ord för varje föreläsning. Du behöver även beräkna det genomsnittliga ordantalet för föreläsningarna. Transkripten finns tillgängliga som särdragen transcript i ted.
För att slutföra uppgiften behöver du definiera en funktion count_words som tar en sträng som argument och returnerar antalet ord i strängen. Sedan ska du tillämpa den här funktionen på särdragen transcript i ted för att skapa det nya särdragen word_count och beräkna dess medelvärde.
Den här övningen är en del av kursen
Funktionsutveckling för NLP i Python
Övningsinstruktioner
- Dela upp
stringi en lista med ord med hjälp av metodensplit(). - Returnera antalet element i
wordsmed hjälp avlen(). - Tillämpa din funktion på kolumnen
transcriptitedför att skapa det nya särdragenword_count. - Beräkna det genomsnittliga ordantalet för föreläsningarna med hjälp av
mean().
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Function that returns number of words in a string
def count_words(string):
# Split the string into words
words = ____.____
# Return the number of words
return ____(____)
# Create a new feature word_count
ted['word_count'] = ted[____].apply(____)
# Print the average word count of the talks
print(ted[____].____)