Recapitulare TM (II)
Acum să creăm o Matrice Document-Termen (DTM). Într-o DTM:
- Fiecare rând al matricei reprezintă un document.
- Fiecare coloană este un token de cuvânt unic.
- Valorile matricei corespund utilizării cuvintelor în fiecare document în parte.
DTM-ul stă la baza multor analize de tip bag of words. Mai târziu în curs, vei folosi și Matricea Termen-Document (TDM), care îi este înrudită. Aceasta este transpusa DTM-ului: coloanele reprezintă documentele, iar rândurile reprezintă tokenii de cuvinte unici.
Ar trebui să construiești un DTM după ce ai curățat corpusul (folosind clean_corpus()). Pentru aceasta, apelează DocumentTermMatrix() pe obiectul corpus.
tm_dtm <- DocumentTermMatrix(tm_clean)
Dacă ai nevoie de o recapitulare mai detaliată, consultă cursul Text Mining with Bag-of-Words in R. Sperăm că aceste două exerciții te-au pregătit suficient de bine pentru a porni în analiza sentimentelor!
Reține că acestea sunt date reale de pe Twitter, prin urmare există întotdeauna riscul să conțină limbaj vulgar sau alt conținut ofensator (în acest exercițiu și în orice exercițiu următor care folosește tot date reale de pe Twitter).
Acest exercițiu face parte din cursul
Analiza sentimentelor în R
Instrucțiuni pentru exercițiu
Am creat un obiect VCorpus() numit clean_text, care conține 1.000 de tweet-uri ce menționează cafeaua. Tweet-urile au fost curățate prin pașii de preprocesare menționați anterior, iar obiectivul tău este să creezi un DTM din acesta.
- Aplică
DocumentTermMatrix()pe corpusulclean_textpentru a crea un DTM ponderat prin frecvența termenilor, numittf_dtm. - Convertește obiectul
DocumentTermMatrix()într-o matrice simplă folosindas.matrix(). Numește noul obiecttf_dtm_m. - Verifică dimensiunile matricei folosind
dim(). - Folosește indexarea cu paranteze pătrate pentru a vizualiza un subset al matricei.
- Selectează rândurile de la 16 la 20 și coloanele de la 2975 la 2985
- Observă valoarea frecvenței pentru cuvântul „working."
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# clean_text is pre-defined
clean_text
# Create tf_dtm
tf_dtm <- ___
# Create tf_dtm_m
tf_dtm_m <- ___
# Dimensions of DTM matrix
___
# Subset part of tf_dtm_m for comparison
___[___, ___]