ÎncepețiÎncepe gratuit

Creează o matrice document-termen

Sperăm că nu ești prea obosit după toate aceste exerciții de bază în text mining! Ca să ne revigăm, ne întoarcem la subiectul cafelei și ne oprim la un Starbucks imaginar, în timp ce construim o matrice document-termen din tweet-uri despre cafea.

Pornind de la fișierul coffee.csv, am aplicat transformările uzuale pentru a obține un corpus curățat numit clean_corp.

Matricea document-termen este utilă atunci când dorești ca fiecare document să fie reprezentat ca un rând. Aceasta poate fi practică, de exemplu, când compari autori pe rânduri sau când datele sunt organizate cronologic și vrei să păstrezi seria de timp. Pachetul tm folosește o clasă de tip „simple triplet matrix". De cele mai multe ori însă, este mai ușor să manipulezi și să inspectezi obiectul după ce îl reclasifici cu as.matrix().

Acest exercițiu face parte din cursul

Text Mining cu Bag-of-Words în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează coffee_dtm aplicând DocumentTermMatrix() pe clean_corp.
  • Creează coffee_m, o versiune matriceală a lui coffee_dtm, folosind as.matrix().
  • Afișează dimensiunile lui coffee_m în consolă cu funcția dim(). Notează numărul de rânduri și coloane.
  • Afișează subsetul din coffee_m care conține documentele (rândurile) 25 până la 35 și termenii (coloanele) "star" și "starbucks".

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create the document-term matrix from the corpus
coffee_dtm <- ___

# Print out coffee_dtm data
coffee_dtm

# Convert coffee_dtm to a matrix
coffee_m <- ___

# Print the dimensions of coffee_m
___

# Review a portion of the matrix to get some Starbucks
___[___:___, c("star", "___")]
Editează și rulează codul