Termes fréquents avec qdap
Si cela vous convient de céder un peu de contrôle sur les étapes exactes de prétraitement, une façon rapide d'obtenir les termes fréquents est d'utiliser freq_terms() de qdap.
La fonction accepte une variable de texte, qui, dans notre cas, est le vecteur tweets$text. Vous pouvez préciser le nombre de termes à afficher avec l'argument top, un vecteur de mots vides à retirer avec l'argument stopwords, et la longueur minimale d'un mot à inclure avec l'argument at.least. qdap possède sa propre liste de mots vides, qui diffèrent de ceux de tm. Notre exercice vous montrera comment utiliser l'une ou l'autre et comparer les résultats.
Tracer un graphique de base des résultats est facile. Il suffit d'appeler plot() sur l'objet retourné par freq_terms().
Cette activité fait partie du cours
Extraction de texte avec sac de mots en R
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create frequency
frequency <- ___(
___,
top = ___,
at.least = ___,
stopwords = ___
)
# Make a frequency bar chart