Elimina las stop words y los espacios adicionales
Un corpus de texto suele contener muchas palabras comunes como "a", "an", "the", "of" y "but". En el procesamiento de lenguaje natural, estas se llaman stop words.
Normalmente se eliminan las stop words durante el preprocesamiento para centrarse en las palabras más importantes del corpus y extraer información útil.
Además, los espacios adicionales que se crean al eliminar caracteres especiales, signos de puntuación, números y stop words también deben eliminarse del corpus.
El corpus que creaste en el ejercicio anterior se ha precargado como twt_corpus_lwr.
La librería tm se ha precargado para este ejercicio.
Este ejercicio forma parte del curso
Análisis de datos de redes sociales en R
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Remove English stop words from the corpus and view the corpus
twt_corpus_stpwd <- ___(twt_corpus_lwr, ___, stopwords("___"))
head(twt_corpus_stpwd$content)