Crear corpus basados en polaridad
En este ejercicio vas a realizar el Paso 3 del flujo de trabajo de minería de texto. Aunque qdap no es un paquete tidy, vas a mutate() una nueva columna basada en la lista polarity devuelta que representa las puntuaciones de toda la polaridad (eso es una pista). En el capítulo 3 usamos una función personalizada pol_subsections que solo utiliza declaraciones base de R. Sin embargo, siguiendo los principios tidy, en este ejercicio usarás filter() y se introduce pull(). La función pull() funciona como [[ para extraer una única variable.
Una vez segregados, vas a colapsar todos los comentarios positivos y negativos en dos documentos más grandes que representen todas las palabras de las reseñas positivas y negativas de alquiler.
Por último, crearás una matriz término-documento (TDM) ponderada por TFIDF (Term Frequency Inverse Document Frequency). Dado que el código de este ejercicio parte de una estructura tidy, se usan algunas funciones tomadas de tm junto con el operador %>% para mantener un estilo consistente. Si no te suenan los fundamentos del paquete tm, echa un vistazo al curso Text Mining with Bag-of-Words in R. En lugar de contar el número de veces que se usa una palabra (frecuencia), los valores en la TDM se penalizan por términos sobreutilizados, lo que ayuda a reducir palabras poco informativas.
Este ejercicio forma parte del curso
Análisis de sentimiento en R
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
pos_terms <- bos_reviews %>%
# Add polarity column
___(polarity = ___) %>%
# Filter for positive polarity
___(___) %>%
# Extract comments column
___(___) %>%
# Paste and collapse
___(collapse = "___")