Kom igångKom igång gratis

Repetition av TM (II)

Nu ska vi skapa en Document Term Matrix (DTM). I en DTM:

  • Varje rad i matrisen representerar ett dokument.
  • Varje kolumn är ett unikt ordtoken.
  • Matrisens värden motsvarar ett enskilt dokuments ordanvändning.

DTM:en är grunden för många bag of words-analyser. Senare i kursen kommer du även att använda den relaterade Term Document Matrix (TDM). Den är transponerad, det vill säga att kolumnerna representerar dokument och raderna representerar unika ordtoken.

Du bör konstruera en DTM efter att ha rensat korpusen (med clean_corpus()). Gör det genom att anropa DocumentTermMatrix() på korpusobjektet.

tm_dtm <- DocumentTermMatrix(tm_clean)

Om du behöver en mer grundlig repetition kan du ta kursen Text Mining with Bag-of-Words in R. Förhoppningsvis har dessa två övningar gett dig en tillräckligt bra grund för att ge dig i kast med sentimentanalys!

Tänk på att det här är verkliga data från Twitter, vilket innebär att det alltid finns en risk att de innehåller svordomar eller annat stötande innehåll – i den här övningen och i följande övningar som också använder verkliga Twitter-data.

Den här övningen är en del av kursen

Sentimentanalys i R

Visa kurs

Övningsinstruktioner

Vi har skapat ett VCorpus()-objekt kallat clean_text som innehåller 1 000 tweets med omnämnanden av kaffe. Tweetsen har rensats med de förbehandlingssteg som nämnts tidigare, och målet är att skapa en DTM från dem.

  • Tillämpa DocumentTermMatrix() på korpusen clean_text för att skapa en termfrekvens-viktad DTM kallad tf_dtm.
  • Konvertera DocumentTermMatrix()-objektet till en enkel matris med as.matrix(). Kalla det nya objektet tf_dtm_m.
  • Kontrollera matrisens dimensioner med dim().
  • Använd hakparentesindexering för att se en delmängd av matrisen.
  • Välj raderna 16 till 20 och kolumnerna 2975 till 2985
  • Notera frekvensen för ordet "working."

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# clean_text is pre-defined
clean_text

# Create tf_dtm
tf_dtm <- ___

# Create tf_dtm_m
tf_dtm_m <- ___

# Dimensions of DTM matrix
___

# Subset part of tf_dtm_m for comparison
___[___, ___]
Redigera och kör kod