Začněte nyníZačněte zdarma

Počet slov v TED talcích

ted je dataframe obsahující přepisy 500 TED talků. Tvým úkolem je vytvořit nový příznak word_count, který bude obsahovat přibližný počet slov každého talku. Dále budeš potřebovat vypočítat průměrný počet slov napříč všemi talky. Přepisy jsou dostupné jako příznak transcript v dataframu ted.

K splnění tohoto úkolu budeš muset definovat funkci count_words, která přijme řetězec jako argument a vrátí počet slov v tomto řetězci. Tuto funkci pak aplikuješ na příznak transcript v dataframu ted, čímž vytvoříš nový příznak word_count, a nakonec vypočítáš jeho průměr.

Toto cvičení je součástí kurzu

Feature Engineering for NLP in Python

Zobrazit kurz

Pokyny k cvičení

  • Rozděl string na seznam slov pomocí metody split().
  • Vrať počet prvků v words pomocí funkce len().
  • Aplikuj svoji funkci na sloupec transcript v dataframu ted a vytvoř nový příznak word_count.
  • Vypočítej průměrný počet slov v talkách pomocí metody mean().

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Function that returns number of words in a string
def count_words(string):
	# Split the string into words
    words = ____.____
    
    # Return the number of words
    return ____(____)

# Create a new feature word_count
ted['word_count'] = ted[____].apply(____)

# Print the average word count of the talks
print(ted[____].____)
Upravit a spustit kód