Creează o matrice termen-document
Ești aproape gata cu partea de fundamente – nu cea mai captivantă, dar esențială – înainte să trecem la vizualizări și analize interesante bazate pe conceptele învățate până acum!
În acest exercițiu, vei efectua un proces similar, dar vei calcula transpusa matricei document-termen. În acest caz, matricea termen-document are termenii în prima coloană, iar documentele sunt dispuse pe orizontală, ca nume individuale de coloane.
TDM este adesea matricea folosită pentru analiza limbajului. Motivul este simplu: de obicei ai mai mulți termeni decât autori sau documente, iar lucrul cu mai multe rânduri decât coloane este, în general, mai convenabil. O modalitate ușoară de a începe analiza datelor este să transformi matricea într-una simplă folosind as.matrix() aplicat pe TDM.
Acest exercițiu face parte din cursul
Text Mining cu Bag-of-Words în R
Instrucțiuni pentru exercițiu
- Creează
coffee_tdmaplicândTermDocumentMatrix()peclean_corp. - Creează
coffee_mconvertindcoffee_tdmîntr-o matrice cuas.matrix(). - Afișează dimensiunile lui
coffee_mîn consolă. Observă numărul de rânduri și coloane. - Afișează subsetul din
coffee_mcare conține termenii (rândurile)"star"și"starbucks"și documentele (coloanele) 25 până la 35.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create a term-document matrix from the corpus
coffee_tdm <- ___
# Print coffee_tdm data
coffee_tdm
# Convert coffee_tdm to a matrix
coffee_m <- ___
# Print the dimensions of the matrix
___
# Review a portion of the matrix
___[___, ___]