Počet znaků v ruských tweetech
V tomto cvičení máš k dispozici dataframe tweets, který obsahuje tweety spojené s ruskou Agenturou pro výzkum internetu a sestavené organizací FiveThirtyEight.
Tvým úkolem je vytvořit nový příznak 'char_count' v tweets, který vypočítá počet znaků každého tweetu. Zároveň vypočítej průměrnou délku tweetu. Tweety jsou dostupné v příznaku content dataframu tweets.
Měj na paměti, že se jedná o reálná data z Twitteru, a proto vždy hrozí, že mohou obsahovat vulgární nebo jinak nevhodný obsah (v tomto i v dalších cvičeních, která také využívají reálná data z Twitteru).
Toto cvičení je součástí kurzu
Feature Engineering for NLP in Python
Pokyny k cvičení
- Vytvoř nový příznak
char_counttak, že aplikuješlenna příznak 'content' dataframutweets. - Vypiš průměrný počet znaků tweetů výpočtem průměru příznaku 'char_count'.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a feature char_count
tweets['char_count'] = tweets[____].apply(____)
# Print the average character count
print(tweets[____].____)