Skapa ett korpus
Du har skapat en tibble kallad russian_tweets som innehåller ungefär 20 000 tweets automatiskt genererade av bottar under det amerikanska valet 2016, så att du kan utföra textanalys. När du undersökt de tillgängliga alternativen för analysen har du kommit fram till att paketet tm erbjuder den enklaste vägen framåt. För att kunna genomföra analysen måste du först skapa ett korpus och koppla eventuellt användbar metadata till det.
Observera att detta är verklig data från Twitter, vilket innebär att det alltid finns en risk att innehållet kan innehålla svordomar eller annat stötande material (i den här övningen och eventuella följande övningar som också använder verklig Twitter-data).
Den här övningen är en del av kursen
Introduktion till naturlig språkbehandling i R
Övningsinstruktioner
- Skapa ett korpus med hjälp av kolumnen
contentirussian_tweets. - Koppla kolumnerna
followingochfollowerssom metadata tilltweet_corpus. - Skriv ut de första raderna i metadatatabellen.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create a corpus
tweet_corpus <- ___(___(russian_tweets$___))
# Attach following and followers
___(tweet_corpus, 'following') <- russian_tweets$___
___(tweet_corpus, 'followers') <- russian_tweets$___
# Review the meta data
head(meta(___))