Vytvoření korpusu
Vytvořil/a sis tibble s názvem russian_tweets, který obsahuje přibližně 20 000 tweetů automaticky generovaných boty během amerických voleb v roce 2016 – a teď chceš provést textovou analýzu. Při hledání vhodného nástroje sis vybral/a balíček tm jako nejpohodlnější cestu. Než ale analýzu spustíš, musíš nejprve vytvořit korpus a připojit k němu potenciálně užitečná metadata.
Měj na paměti, že jde o reálná data z Twitteru, která mohou obsahovat vulgární nebo jinak nevhodný obsah (platí pro toto i pro všechna navazující cvičení pracující s reálnými tweety).
Toto cvičení je součástí kurzu
Úvod do zpracování přirozeného jazyka v R
Pokyny k cvičení
- Vytvoř korpus ze sloupce
contentvrussian_tweets. - Připoj sloupce
followingafollowersjako metadata ktweet_corpus. - Vypiš první několik řádků tabulky metadat.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a corpus
tweet_corpus <- ___(___(russian_tweets$___))
# Attach following and followers
___(tweet_corpus, 'following') <- russian_tweets$___
___(tweet_corpus, 'followers') <- russian_tweets$___
# Review the meta data
head(meta(___))