Počet slov v TED talcích
ted je dataframe obsahující přepisy 500 TED talků. Tvým úkolem je vytvořit nový příznak word_count, který bude obsahovat přibližný počet slov každého talku. Dále budeš potřebovat vypočítat průměrný počet slov napříč všemi talky. Přepisy jsou dostupné jako příznak transcript v dataframu ted.
K splnění tohoto úkolu budeš muset definovat funkci count_words, která přijme řetězec jako argument a vrátí počet slov v tomto řetězci. Tuto funkci pak aplikuješ na příznak transcript v dataframu ted, čímž vytvoříš nový příznak word_count, a nakonec vypočítáš jeho průměr.
Toto cvičení je součástí kurzu
Feature Engineering for NLP in Python
Pokyny k cvičení
- Rozděl
stringna seznam slov pomocí metodysplit(). - Vrať počet prvků v
wordspomocí funkcelen(). - Aplikuj svoji funkci na sloupec
transcriptv dataframuteda vytvoř nový příznakword_count. - Vypočítej průměrný počet slov v talkách pomocí metody
mean().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Function that returns number of words in a string
def count_words(string):
# Split the string into words
words = ____.____
# Return the number of words
return ____(____)
# Create a new feature word_count
ted['word_count'] = ted[____].apply(____)
# Print the average word count of the talks
print(ted[____].____)