ÎncepețiÎncepe gratuit

Recapitulare TM (II)

Acum să creăm o Matrice Document-Termen (DTM). Într-o DTM:

  • Fiecare rând al matricei reprezintă un document.
  • Fiecare coloană este un token de cuvânt unic.
  • Valorile matricei corespund utilizării cuvintelor în fiecare document în parte.

DTM-ul stă la baza multor analize de tip bag of words. Mai târziu în curs, vei folosi și Matricea Termen-Document (TDM), care îi este înrudită. Aceasta este transpusa DTM-ului: coloanele reprezintă documentele, iar rândurile reprezintă tokenii de cuvinte unici.

Ar trebui să construiești un DTM după ce ai curățat corpusul (folosind clean_corpus()). Pentru aceasta, apelează DocumentTermMatrix() pe obiectul corpus.

tm_dtm <- DocumentTermMatrix(tm_clean)

Dacă ai nevoie de o recapitulare mai detaliată, consultă cursul Text Mining with Bag-of-Words in R. Sperăm că aceste două exerciții te-au pregătit suficient de bine pentru a porni în analiza sentimentelor!

Reține că acestea sunt date reale de pe Twitter, prin urmare există întotdeauna riscul să conțină limbaj vulgar sau alt conținut ofensator (în acest exercițiu și în orice exercițiu următor care folosește tot date reale de pe Twitter).

Acest exercițiu face parte din cursul

Analiza sentimentelor în R

Vezi cursul

Instrucțiuni pentru exercițiu

Am creat un obiect VCorpus() numit clean_text, care conține 1.000 de tweet-uri ce menționează cafeaua. Tweet-urile au fost curățate prin pașii de preprocesare menționați anterior, iar obiectivul tău este să creezi un DTM din acesta.

  • Aplică DocumentTermMatrix() pe corpusul clean_text pentru a crea un DTM ponderat prin frecvența termenilor, numit tf_dtm.
  • Convertește obiectul DocumentTermMatrix() într-o matrice simplă folosind as.matrix(). Numește noul obiect tf_dtm_m.
  • Verifică dimensiunile matricei folosind dim().
  • Folosește indexarea cu paranteze pătrate pentru a vizualiza un subset al matricei.
  • Selectează rândurile de la 16 la 20 și coloanele de la 2975 la 2985
  • Observă valoarea frecvenței pentru cuvântul „working."

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# clean_text is pre-defined
clean_text

# Create tf_dtm
tf_dtm <- ___

# Create tf_dtm_m
tf_dtm_m <- ___

# Dimensions of DTM matrix
___

# Subset part of tf_dtm_m for comparison
___[___, ___]
Editează și rulează codul