Repaso de TM (II)
Ahora vamos a crear una Document Term Matrix (DTM). En una DTM:
- Cada fila de la matriz representa un documento.
- Cada columna es un token de palabra único.
- Los valores de la matriz corresponden al uso de palabras de cada documento.
La DTM es la base de muchos análisis de bag of words. Más adelante en el curso, también usarás la relacionada Term Document Matrix (TDM). Esta es la traspuesta; es decir, las columnas representan documentos y las filas representan tokens de palabra únicos.
Debes construir una DTM después de limpiar el corpus (usando clean_corpus()). Para ello, llama a DocumentTermMatrix() sobre el objeto del corpus.
tm_dtm <- DocumentTermMatrix(tm_clean)
Si necesitas un repaso más a fondo, echa un vistazo al curso Text Mining with Bag-of-Words in R. ¡Esperamos que estos dos ejercicios te hayan preparado lo suficiente para empezar tu viaje de análisis de sentimiento!
Ten en cuenta que estos son datos reales de Twitter y, como tales, siempre existe el riesgo de que contengan lenguaje soez u otro contenido ofensivo (en este ejercicio y en cualquiera posterior que también use datos reales de Twitter).
Este ejercicio forma parte del curso
Análisis de sentimiento en R
Instrucciones del ejercicio
Hemos creado un objeto VCorpus() llamado clean_text que contiene 1000 tuits que mencionan el café. Los tuits se han limpiado con los pasos de preprocesado mencionados y tu objetivo es crear a partir de ellos una DTM.
- Aplica
DocumentTermMatrix()al corpusclean_textpara crear una DTM ponderada por frecuencia de términos llamadatf_dtm. - Convierte el objeto
DocumentTermMatrix()en una matriz simple conas.matrix(). Llama al nuevo objetotf_dtm_m. - Comprueba las dimensiones de la matriz usando
dim(). - Usa indexación con corchetes para ver un subconjunto de la matriz.
- Selecciona las filas 16 a 20 y las columnas 2975 a 2985
- Anota el valor de frecuencia de la palabra "working."
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# clean_text is pre-defined
clean_text
# Create tf_dtm
tf_dtm <- ___
# Create tf_dtm_m
tf_dtm_m <- ___
# Dimensions of DTM matrix
___
# Subset part of tf_dtm_m for comparison
___[___, ___]