Zacznij terazZacznij za darmo

Tworzenie macierzy dokumentów-terminów

Mamy nadzieję, że po tym wszystkim nadal masz energię do pracy! Na wszelki wypadek wróćmy do tematu kawy i zajrzyjmy do Starbucksa – tym razem budując macierz dokumentów-terminów na podstawie tweetów o kawie.

Punktorem wyjścia jest plik coffee.csv. Dzięki typowym przekształceniom otrzymaliśmy czysty korpus o nazwie clean_corp.

Macierz dokumentów-terminów (DTM) przydaje się wtedy, gdy chcesz, aby każdy dokument był reprezentowany jako osobny wiersz. To rozwiązanie sprawdza się na przykład przy porównywaniu autorów w wierszach albo gdy dane są ułożone chronologicznie i zależy ci na zachowaniu struktury szeregu czasowego. Pakiet tm używa klasy „simple triplet matrix". W praktyce jednak łatwiej jest manipulować obiektem i go analizować po przekształceniu DTM za pomocą as.matrix().

To ćwiczenie jest częścią kursu

Eksploracja tekstu metodą Bag-of-Words w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz coffee_dtm, stosując funkcję DocumentTermMatrix() do clean_corp.
  • Utwórz coffee_m – wersję macierzową coffee_dtm – używając as.matrix().
  • Wyświetl wymiary coffee_m w konsoli za pomocą funkcji dim(). Zwróć uwagę na liczbę wierszy i kolumn.
  • Wyświetl podzbiór coffee_m zawierający dokumenty (wiersze) od 25 do 35 oraz terminy (kolumny) "star" i "starbucks".

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Create the document-term matrix from the corpus
coffee_dtm <- ___

# Print out coffee_dtm data
coffee_dtm

# Convert coffee_dtm to a matrix
coffee_m <- ___

# Print the dimensions of coffee_m
___

# Review a portion of the matrix to get some Starbucks
___[___:___, c("star", "___")]
Edytuj i uruchom kod