EmpezarEmpieza gratis

Crear corpus basados en polaridad

En este ejercicio vas a realizar el Paso 3 del flujo de trabajo de minería de texto. Aunque qdap no es un paquete tidy, vas a mutate() una nueva columna basada en la lista polarity devuelta que representa las puntuaciones de toda la polaridad (eso es una pista). En el capítulo 3 usamos una función personalizada pol_subsections que solo utiliza declaraciones base de R. Sin embargo, siguiendo los principios tidy, en este ejercicio usarás filter() y se introduce pull(). La función pull() funciona como [[ para extraer una única variable.

Una vez segregados, vas a colapsar todos los comentarios positivos y negativos en dos documentos más grandes que representen todas las palabras de las reseñas positivas y negativas de alquiler.

Por último, crearás una matriz término-documento (TDM) ponderada por TFIDF (Term Frequency Inverse Document Frequency). Dado que el código de este ejercicio parte de una estructura tidy, se usan algunas funciones tomadas de tm junto con el operador %>% para mantener un estilo consistente. Si no te suenan los fundamentos del paquete tm, echa un vistazo al curso Text Mining with Bag-of-Words in R. En lugar de contar el número de veces que se usa una palabra (frecuencia), los valores en la TDM se penalizan por términos sobreutilizados, lo que ayuda a reducir palabras poco informativas.

Este ejercicio forma parte del curso

Análisis de sentimiento en R

Ver curso

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

pos_terms <- bos_reviews %>%
  # Add polarity column
  ___(polarity = ___) %>%
  # Filter for positive polarity
  ___(___) %>%
  # Extract comments column
  ___(___) %>% 
  # Paste and collapse
  ___(collapse = "___")
Editar y ejecutar código