Termeni frecvenți cu qdap
Dacă ești dispus să renunți la un control strict asupra pașilor de preprocesare, o metodă rapidă de a obține termenii frecvenți este funcția freq_terms() din qdap.
Funcția acceptă o variabilă text – în cazul nostru, vectorul tweets$text. Poți specifica numărul maxim de termeni afișați cu argumentul top, un vector de cuvinte de ignorat cu argumentul stopwords, respectiv lungimea minimă a unui cuvânt inclus în rezultate cu argumentul at.least. qdap are propria listă de cuvinte de ignorat, diferită de cea din tm. Exercițiul de față îți va arăta cum să le folosești pe ambele și să le compari rezultatele.
Reprezentarea grafică a rezultatelor este simplă. Apelează plot() pe obiectul returnat de freq_terms().
Acest exercițiu face parte din cursul
Text Mining cu Bag-of-Words în R
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create frequency
frequency <- ___(
___,
top = ___,
at.least = ___,
stopwords = ___
)
# Make a frequency bar chart