ÎncepețiÎncepe gratuit

Creează o matrice termen-document

Ești aproape gata cu partea de fundamente – nu cea mai captivantă, dar esențială – înainte să trecem la vizualizări și analize interesante bazate pe conceptele învățate până acum!

În acest exercițiu, vei efectua un proces similar, dar vei calcula transpusa matricei document-termen. În acest caz, matricea termen-document are termenii în prima coloană, iar documentele sunt dispuse pe orizontală, ca nume individuale de coloane.

TDM este adesea matricea folosită pentru analiza limbajului. Motivul este simplu: de obicei ai mai mulți termeni decât autori sau documente, iar lucrul cu mai multe rânduri decât coloane este, în general, mai convenabil. O modalitate ușoară de a începe analiza datelor este să transformi matricea într-una simplă folosind as.matrix() aplicat pe TDM.

Acest exercițiu face parte din cursul

Text Mining cu Bag-of-Words în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează coffee_tdm aplicând TermDocumentMatrix() pe clean_corp.
  • Creează coffee_m convertind coffee_tdm într-o matrice cu as.matrix().
  • Afișează dimensiunile lui coffee_m în consolă. Observă numărul de rânduri și coloane.
  • Afișează subsetul din coffee_m care conține termenii (rândurile) "star" și "starbucks" și documentele (coloanele) 25 până la 35.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create a term-document matrix from the corpus
coffee_tdm <- ___

# Print coffee_tdm data
coffee_tdm

# Convert coffee_tdm to a matrix
coffee_m <- ___

# Print the dimensions of the matrix
___

# Review a portion of the matrix
___[___, ___]
Editează și rulează codul