Použití asociací slov
Dalším způsobem, jak zkoumat vztahy mezi slovy, je funkce findAssocs() z balíčku tm. Pro libovolné slovo spočítá findAssocs() jeho korelaci se všemi ostatními slovy v TDM nebo DTM. Skóre se pohybuje od 0 do 1. Hodnota 1 znamená, že se dvě slova v dokumentech vyskytují vždy společně, zatímco hodnota blížící se 0 říká, že se daná slova ve stejném dokumentu objevují jen zřídka.
Měj na paměti, že výpočet findAssocs() probíhá na úrovni dokumentů. Pro každý dokument, který obsahuje hledané slovo, se zjistí asociace s ostatními výrazy z těchto konkrétních dokumentů. Dokumenty bez hledaného výrazu se ignorují.
Při použití findAssocs() předej TDM nebo DTM, hledaný výraz a minimální korelaci. Funkce vrátí seznam všech ostatních výrazů, které dosahují minimálního prahu nebo ho překračují.
findAssocs(tdm, "word", 0.25)
Minimální hodnoty korelace bývají poměrně nízké kvůli různorodosti slovní zásoby. Nepřekvapuj se tedy, pokud hodnota 0.10 odhalí silnou párovou asociaci výrazů.
Tweety o kávě jsou vyčištěny a uspořádány do tweets_tdm. Vyhledáš asociaci výrazu, výsledky upravíš pomocí list_vect2df() z balíčku qdap a nakonec vytvoříš graf s kódem ggplot2 z ukázkového skriptu.
Toto cvičení je součástí kurzu
Dolování textu metodou Bag-of-Words v R
Pokyny k cvičení
- Vytvoř proměnnou
associationspomocífindAssocs()natweets_tdm— hledej výrazy asociované se slovem "venti" s minimálním prahem0.2. - Vypiš
associationsdo konzole a prohlédni si nalezené výrazy. - Vytvoř
associations_dfvolánímlist_vect2df(), předej muassociationsa nastavcol2na"word"acol3na"score". - Spusť kód
ggplot2a vykresli bodový graf hodnot asociací.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create associations
___ <- ___(___, ___, ___)
# View the venti associations
___
# Create associations_df
___ <- ___(___, ___, ___)
# Plot the associations_df values
ggplot(associations_df, aes(score, word)) +
geom_point(size = 3) +
theme_gdocs()