EmpezarEmpieza gratis

Repaso de TM (I)

En el curso Text Mining: Bag of Words aprendiste que un corpus es un conjunto de textos y viste algunas funciones para preprocesar el texto. A modo de repaso, una forma de crear y limpiar un corpus es con las funciones de abajo. Aunque este es otro curso, el análisis de sentimiento forma parte del text mining, así que un repaso viene bien.

En este ejercicio se ha creado una función personalizada clean_corpus() usando funciones estándar de preprocesamiento para facilitar su aplicación.

clean_corpus() acepta la salida de VCorpus() y aplica funciones de limpieza. Por ejemplo:

processed_corpus <- clean_corpus(my_corpus)

Este ejercicio forma parte del curso

Análisis de sentimiento en R

Ver curso

Instrucciones del ejercicio

Tu sesión de R tiene un vector de texto, tm_define, con dos documentos pequeños y la función clean_corpus().

  • Crea un objeto llamado tm_vector aplicando VectorSource() a tm_define.
  • Crea tm_corpus usando VCorpus() sobre tm_vector.
  • Usa content() para examinar el contenido del primer documento en tm_corpus.
    • Los documentos del corpus se acceden con sintaxis de lista, así que usa dobles corchetes, p. ej., [[1]].
  • Limpia el texto del corpus usando la función personalizada clean_corpus() sobre tm_corpus. Llama a este nuevo objeto tm_clean.
  • Examina de nuevo el primer documento del nuevo objeto tm_clean para ver cómo cambió el texto tras aplicar clean_corpus().

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# clean_corpus(), tm_define are pre-defined
clean_corpus
tm_define

# Create a VectorSource
tm_vector <- ___

# Apply VCorpus
tm_corpus <- ___

# Examine the first document's contents
___(___[[___]])

# Clean the text
tm_clean <- ___

# Reexamine the contents of the first doc
___
Editar y ejecutar código