Repaso de TM (I)
En el curso Text Mining: Bag of Words aprendiste que un corpus es un conjunto de textos y viste algunas funciones para preprocesar el texto. A modo de repaso, una forma de crear y limpiar un corpus es con las funciones de abajo. Aunque este es otro curso, el análisis de sentimiento forma parte del text mining, así que un repaso viene bien.
- Convierte un vector de caracteres en una fuente de texto usando
VectorSource(). - Convierte una fuente de texto en un corpus usando
VCorpus(). - Elimina caracteres no deseados del corpus con funciones de limpieza como
removePunctuation()ystripWhitespace()detm, yreplace_abbreviation()deqdap.
En este ejercicio se ha creado una función personalizada clean_corpus() usando funciones estándar de preprocesamiento para facilitar su aplicación.
clean_corpus() acepta la salida de VCorpus() y aplica funciones de limpieza. Por ejemplo:
processed_corpus <- clean_corpus(my_corpus)
Este ejercicio forma parte del curso
Análisis de sentimiento en R
Instrucciones del ejercicio
Tu sesión de R tiene un vector de texto, tm_define, con dos documentos pequeños y la función clean_corpus().
- Crea un objeto llamado
tm_vectoraplicandoVectorSource()atm_define. - Crea
tm_corpususandoVCorpus()sobretm_vector. - Usa
content()para examinar el contenido del primer documento entm_corpus.- Los documentos del corpus se acceden con sintaxis de lista, así que usa dobles corchetes, p. ej.,
[[1]].
- Los documentos del corpus se acceden con sintaxis de lista, así que usa dobles corchetes, p. ej.,
- Limpia el texto del corpus usando la función personalizada
clean_corpus()sobretm_corpus. Llama a este nuevo objetotm_clean. - Examina de nuevo el primer documento del nuevo objeto
tm_cleanpara ver cómo cambió el texto tras aplicarclean_corpus().
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# clean_corpus(), tm_define are pre-defined
clean_corpus
tm_define
# Create a VectorSource
tm_vector <- ___
# Apply VCorpus
tm_corpus <- ___
# Examine the first document's contents
___(___[[___]])
# Clean the text
tm_clean <- ___
# Reexamine the contents of the first doc
___