Tworzenie macierzy dokumentów-terminów
Mamy nadzieję, że po tym wszystkim nadal masz energię do pracy! Na wszelki wypadek wróćmy do tematu kawy i zajrzyjmy do Starbucksa – tym razem budując macierz dokumentów-terminów na podstawie tweetów o kawie.
Punktorem wyjścia jest plik coffee.csv. Dzięki typowym przekształceniom otrzymaliśmy czysty korpus o nazwie clean_corp.
Macierz dokumentów-terminów (DTM) przydaje się wtedy, gdy chcesz, aby każdy dokument był reprezentowany jako osobny wiersz. To rozwiązanie sprawdza się na przykład przy porównywaniu autorów w wierszach albo gdy dane są ułożone chronologicznie i zależy ci na zachowaniu struktury szeregu czasowego. Pakiet tm używa klasy „simple triplet matrix". W praktyce jednak łatwiej jest manipulować obiektem i go analizować po przekształceniu DTM za pomocą as.matrix().
To ćwiczenie jest częścią kursu
Eksploracja tekstu metodą Bag-of-Words w R
Instrukcje do ćwiczenia
- Utwórz
coffee_dtm, stosując funkcjęDocumentTermMatrix()doclean_corp. - Utwórz
coffee_m– wersję macierzowącoffee_dtm– używającas.matrix(). - Wyświetl wymiary
coffee_mw konsoli za pomocą funkcjidim(). Zwróć uwagę na liczbę wierszy i kolumn. - Wyświetl podzbiór
coffee_mzawierający dokumenty (wiersze) od 25 do 35 oraz terminy (kolumny)"star"i"starbucks".
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Create the document-term matrix from the corpus
coffee_dtm <- ___
# Print out coffee_dtm data
coffee_dtm
# Convert coffee_dtm to a matrix
coffee_m <- ___
# Print the dimensions of coffee_m
___
# Review a portion of the matrix to get some Starbucks
___[___:___, c("star", "___")]