Trädkartor för dokumentgrupper
Ofta arbetar du med dokument i grupper, till exempel efter författare, produkt eller företag. I den här övningen får du utforska texten samtidigt som du behåller gruppstrukturen i en kompakt visualisering. Om du till exempel har kundrecensioner grupperade efter produkt kanske du vill undersöka flera dimensioner samtidigt. Du kan börja med att beräkna polarity() för recensionerna. En annan dimension är längd. Dokumentlängd kan spegla emotionell intensitet – en kort recension som "toppen skor!" signalerar troligen mindre entusiasm än en längre positiv text. Du kanske också vill gruppera recensioner efter produkttyp, till exempel dam-, herr- och barnskor. En trädkarta låter dig undersöka alla dessa dimensioner på en gång.
I textanalys representerar varje enskild ruta i en trädkarta ett dokument, till exempel ett inlägg. Dokumenten grupperas på något sätt, exempelvis efter författare. Storleken på varje ruta bestäms av ett numeriskt värde, som antal ord eller tecken. Färgerna bestäms av ett sentimentvärde.
När du har organiserat tibble:n använder du biblioteket treemap och funktionen treemap() för att skapa visualiseringen. Kodexemplet nedan visar hur du anger data, grupperingsvariabler, storlek, färg och övriga estetiska inställningar.
treemap(
data_frame,
index = c("group", "individual_document"),
vSize = "doc_length",
vColor = "avg_score",
type = "value",
title = "Sentiment Scores by Doc",
palette = c("red", "white", "green")
)
Det förinstallerade objektet all_books innehåller ett kombinerat corpus i tidy-format med 4 böcker av Shakespeare, 3 av Melville och 4 av Twain. Utifrån trädkartan bör du kunna avgöra vem som skriver längst böcker samt polariteten för varje författare som helhet och för enskilda böcker.
Den här övningen är en del av kursen
Sentimentanalys i R
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
book_length <- all_books %>%
# Count number of words per book
___(___)
# Examine the results
book_length