Numărul de caractere al tweet-urilor rusești
În acest exercițiu, ți-a fost oferit un DataFrame tweets care conține o serie de tweet-uri asociate cu Agenția de Cercetare pe Internet a Rusiei, compilate de FiveThirtyEight.
Sarcina ta este să creezi o nouă caracteristică, char_count, în tweets, care să calculeze numărul de caractere pentru fiecare tweet. De asemenea, calculează lungimea medie a fiecărui tweet. Tweet-urile sunt disponibile în caracteristica content a lui tweets.
Reține că acestea sunt date reale de pe Twitter și, prin urmare, există întotdeauna riscul ca ele să conțină limbaj vulgar sau alt conținut ofensator (în acest exercițiu și în oricare dintre exercițiile următoare care folosesc tot date reale de pe Twitter).
Acest exercițiu face parte din cursul
Ingineria caracteristicilor pentru NLP în Python
Instrucțiuni pentru exercițiu
- Creează o nouă caracteristică
char_countaplicândlenasupra caracteristiciicontentdintweets. - Afișează numărul mediu de caractere al tweet-urilor calculând media caracteristicii
char_count.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create a feature char_count
tweets['char_count'] = tweets[____].apply(____)
# Print the average character count
print(tweets[____].____)