Opakování TM (II)
Teď vytvoříme Document Term Matrix (DTM). V DTM platí:
- Každý řádek matice představuje jeden dokument.
- Každý sloupec odpovídá jedinečnému slovnímu tokenu.
- Hodnoty v matici zachycují, jak často daný dokument používá konkrétní slovo.
DTM je základem mnoha analýz typu bag of words. Později v kurzu se setkáš i s příbuznou Term Document Matrix (TDM), což je její transpozice — sloupce tam reprezentují dokumenty a řádky jedinečné slovní tokeny.
DTM bys měl/a sestavovat až po vyčištění korpusu (pomocí clean_corpus()). Stačí zavolat DocumentTermMatrix() na objekt korpusu:
tm_dtm <- DocumentTermMatrix(tm_clean)
Pokud potřebuješ podrobnější zopakování látky, podívej se na kurz Text Mining with Bag-of-Words in R. Doufáme, že tato dvě cvičení tě dostatečně připravila na cestu světem analýzy sentimentu!
Měj na paměti, že jde o reálná data z Twitteru, a proto existuje riziko, že mohou obsahovat vulgární nebo jinak nevhodný obsah (v tomto cvičení i v dalších, která také pracují s reálnými twitterovými daty).
Toto cvičení je součástí kurzu
Sentiment Analysis in R
Pokyny k cvičení
Připravili jsme pro tebe objekt VCorpus() s názvem clean_text, který obsahuje 1 000 tweetů zmiňujících kávu. Tweety prošly čištěním pomocí dříve popsaných kroků předzpracování. Tvým úkolem je z tohoto korpusu vytvořit DTM.
- Aplikuj
DocumentTermMatrix()na korpusclean_texta vytvoř DTM váženou četností termínů — ulož ji jakotf_dtm. - Převeď objekt
DocumentTermMatrix()na jednoduchou matici pomocías.matrix()a výsledek ulož jakotf_dtm_m. - Zkontroluj rozměry matice pomocí
dim(). - Pomocí indexování hranatými závorkami zobraz část matice:
- Vyber řádky 16 až 20 a sloupce 2975 až 2985.
- Všimni si hodnoty četnosti slova „working."
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# clean_text is pre-defined
clean_text
# Create tf_dtm
tf_dtm <- ___
# Create tf_dtm_m
tf_dtm_m <- ___
# Dimensions of DTM matrix
___
# Subset part of tf_dtm_m for comparison
___[___, ___]