Crearea unui corpus
Ai creat un tibble numit russian_tweets care conține aproximativ 20.000 de tweet-uri generate automat de boți în perioada alegerilor din SUA din 2016, pentru a putea efectua analiză de text. După ce ai explorat opțiunile disponibile, ai ales pachetul tm ca cea mai convenabilă soluție. Pentru a putea realiza analiza, trebuie mai întâi să creezi un corpus și să îi atașezi metadate potențial utile.
Reține că acestea sunt date reale de pe Twitter și, prin urmare, există întotdeauna riscul ca ele să conțină limbaj vulgar sau alt conținut ofensator (în acest exercițiu și în orice exerciții ulterioare care folosesc, de asemenea, date reale de pe Twitter).
Acest exercițiu face parte din cursul
Introducere în Prelucrarea Limbajului Natural în R
Instrucțiuni pentru exercițiu
- Creează un corpus folosind coloana
contentdinrussian_tweets. - Atașează coloanele
followingșifollowersca metadate latweet_corpus. - Afișează primele rânduri din tabelul de metadate.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create a corpus
tweet_corpus <- ___(___(russian_tweets$___))
# Attach following and followers
___(tweet_corpus, 'following') <- russian_tweets$___
___(tweet_corpus, 'followers') <- russian_tweets$___
# Review the meta data
head(meta(___))