EmpezarEmpieza gratis

Elimina las stop words y los espacios adicionales

Un corpus de texto suele contener muchas palabras comunes como "a", "an", "the", "of" y "but". En el procesamiento de lenguaje natural, estas se llaman stop words.

Normalmente se eliminan las stop words durante el preprocesamiento para centrarse en las palabras más importantes del corpus y extraer información útil.

Además, los espacios adicionales que se crean al eliminar caracteres especiales, signos de puntuación, números y stop words también deben eliminarse del corpus.

El corpus que creaste en el ejercicio anterior se ha precargado como twt_corpus_lwr.

La librería tm se ha precargado para este ejercicio.

Este ejercicio forma parte del curso

Análisis de datos de redes sociales en R

Ver curso

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Remove English stop words from the corpus and view the corpus 
twt_corpus_stpwd <- ___(twt_corpus_lwr, ___, stopwords("___"))
head(twt_corpus_stpwd$content)
Editar y ejecutar código