Repetition av TM (II)
Nu ska vi skapa en Document Term Matrix (DTM). I en DTM:
- Varje rad i matrisen representerar ett dokument.
- Varje kolumn är ett unikt ordtoken.
- Matrisens värden motsvarar ett enskilt dokuments ordanvändning.
DTM:en är grunden för många bag of words-analyser. Senare i kursen kommer du även att använda den relaterade Term Document Matrix (TDM). Den är transponerad, det vill säga att kolumnerna representerar dokument och raderna representerar unika ordtoken.
Du bör konstruera en DTM efter att ha rensat korpusen (med clean_corpus()). Gör det genom att anropa DocumentTermMatrix() på korpusobjektet.
tm_dtm <- DocumentTermMatrix(tm_clean)
Om du behöver en mer grundlig repetition kan du ta kursen Text Mining with Bag-of-Words in R. Förhoppningsvis har dessa två övningar gett dig en tillräckligt bra grund för att ge dig i kast med sentimentanalys!
Tänk på att det här är verkliga data från Twitter, vilket innebär att det alltid finns en risk att de innehåller svordomar eller annat stötande innehåll – i den här övningen och i följande övningar som också använder verkliga Twitter-data.
Den här övningen är en del av kursen
Sentimentanalys i R
Övningsinstruktioner
Vi har skapat ett VCorpus()-objekt kallat clean_text som innehåller 1 000 tweets med omnämnanden av kaffe. Tweetsen har rensats med de förbehandlingssteg som nämnts tidigare, och målet är att skapa en DTM från dem.
- Tillämpa
DocumentTermMatrix()på korpusenclean_textför att skapa en termfrekvens-viktad DTM kalladtf_dtm. - Konvertera
DocumentTermMatrix()-objektet till en enkel matris medas.matrix(). Kalla det nya objektettf_dtm_m. - Kontrollera matrisens dimensioner med
dim(). - Använd hakparentesindexering för att se en delmängd av matrisen.
- Välj raderna 16 till 20 och kolumnerna 2975 till 2985
- Notera frekvensen för ordet "working."
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# clean_text is pre-defined
clean_text
# Create tf_dtm
tf_dtm <- ___
# Create tf_dtm_m
tf_dtm_m <- ___
# Dimensions of DTM matrix
___
# Subset part of tf_dtm_m for comparison
___[___, ___]