ÎncepețiÎncepe gratuit

Treemap-uri pentru grupuri de documente

De multe ori vei lucra cu documente organizate în grupuri, cum ar fi după autor, produs sau companie. Acest exercițiu îți permite să explorezi textul păstrând totodată grupurile într-o reprezentare vizuală compactă. De exemplu, dacă ai recenzii ale clienților grupate pe produs, poate vrei să analizezi mai multe dimensiuni simultan. Mai întâi poți calcula polarity() recenziilor. O altă dimensiune poate fi lungimea. Lungimea unui document poate indica intensitatea emoțională. Dacă un client lasă un scurt „pantofi grozavi!", poți deduce că este mai puțin entuziasmat față de o recenzie pozitivă mai elaborată. Poate vrei și să grupezi recenziile pe tipul de produs – pantofi pentru femei, bărbați sau copii. Un treemap îți permite să examinezi toate aceste dimensiuni simultan.

În analiza de text, fiecare casetă dintr-un treemap reprezintă un document, de exemplu un tweet. Documentele sunt grupate după un criteriu, cum ar fi autorul. Dimensiunea fiecărei casete este determinată de o valoare numerică, precum numărul de cuvinte sau litere. Culorile individuale sunt determinate de un scor de sentiment.

După ce organizezi tibble-ul, folosești biblioteca treemap, care conține funcția treemap(), pentru a crea vizualizarea. Exemplul de cod de mai jos definește datele, variabilele de grupare, dimensiunea, culoarea și alți parametri estetici.

treemap(
  data_frame,
  index = c("group", "individual_document"),
  vSize = "doc_length",
  vColor = "avg_score",
  type = "value",
  title = "Sentiment Scores by Doc",
  palette = c("red", "white", "green")
)

Obiectul pre-încărcat all_books conține un corpus combinat în format tidy, cu 4 cărți de Shakespeare, 3 de Melville și 4 de Twain. Pe baza treemap-ului, ar trebui să poți determina cine scrie cărți mai lungi și să evaluezi polaritatea fiecărui autor în ansamblu, dar și pentru fiecare carte în parte.

Acest exercițiu face parte din cursul

Analiza sentimentelor în R

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

book_length <- all_books %>%
  # Count number of words per book
  ___(___)
  
# Examine the results
book_length
Editează și rulează codul