Vytvoř term-document matrix
Základy máš skoro za sebou – a pak se konečně vrhneme na zajímavé vizualizace a analýzy postavené na tom, co ses doposud naučil/a!
V tomto cvičení provedeš podobný postup jako předtím, ale tentokrát vytvoříš transpozici document-term matrix. Výsledná term-document matrix má termíny v prvním sloupci a dokumenty jako názvy jednotlivých sloupců napříč tabulkou.
TDM se při analýze jazyka používá velmi často. Důvod je prostý: termínů bývá zpravidla víc než autorů nebo dokumentů, a práce je obecně jednodušší, když má matice více řádků než sloupců. Dobrý způsob, jak začít s analýzou dat, je převést matici na jednoduchou matici pomocí funkce as.matrix() aplikované na TDM.
Toto cvičení je součástí kurzu
Dolování textu metodou Bag-of-Words v R
Pokyny k cvičení
- Vytvoř
coffee_tdmtak, že aplikuješ funkciTermDocumentMatrix()naclean_corp. - Vytvoř
coffee_mpřevodemcoffee_tdmna matici pomocías.matrix(). - Vypiš do konzole rozměry
coffee_m. Všimni si počtu řádků a sloupců. - Vypiš podmnožinu
coffee_mobsahující termíny (řádky)"star"a"starbucks"a dokumenty (sloupce) 25 až 35.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create a term-document matrix from the corpus
coffee_tdm <- ___
# Print coffee_tdm data
coffee_tdm
# Convert coffee_tdm to a matrix
coffee_m <- ___
# Print the dimensions of the matrix
___
# Review a portion of the matrix
___[___, ___]