Revisão de TM (II)
Agora vamos criar uma Document Term Matrix (DTM). Em uma DTM:
- Cada linha da matriz representa um documento.
- Cada coluna é um token de palavra único.
- Os valores da matriz correspondem ao uso de palavras de um documento individual.
A DTM é a base para muitas análises de bag of words. Mais adiante no curso, você também usará a Term Document Matrix (TDM) relacionada. Ela é a transposta; isto é, as colunas representam documentos e as linhas representam tokens de palavras únicas.
Você deve construir uma DTM depois de limpar o corpus (usando clean_corpus()). Para isso, chame DocumentTermMatrix() no objeto de corpus.
tm_dtm <- DocumentTermMatrix(tm_clean)
Se você precisar de uma revisão mais aprofundada, confira o curso Text Mining with Bag-of-Words in R. Espero que estes dois exercícios tenham preparado você bem o suficiente para começar sua jornada em análise de sentimento!
Atenção: estes são dados reais do Twitter e, como tal, sempre há o risco de conterem palavrões ou outro conteúdo ofensivo (neste exercício e em quaisquer exercícios seguintes que também usem dados reais do Twitter).
Este exercicio faz parte do curso
Análise de Sentimentos em R
Instruções do exercicio
Criamos um objeto VCorpus() chamado clean_text contendo 1000 tweets mencionando coffee. Os tweets foram limpos com as etapas de pré-processamento mencionadas anteriormente, e seu objetivo é criar uma DTM a partir dele.
- Aplique
DocumentTermMatrix()ao corpusclean_textpara criar uma DTM ponderada por frequência de termos chamadatf_dtm. - Converta o objeto
DocumentTermMatrix()em uma matriz simples comas.matrix(). Chame o novo objeto detf_dtm_m. - Verifique as dimensões da matriz usando
dim(). - Use indexação com colchetes para ver um subconjunto da matriz.
- Selecione as linhas de 16 a 20 e as colunas de 2975 a 2985
- Observe o valor de frequência da palavra "working."
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
# clean_text is pre-defined
clean_text
# Create tf_dtm
tf_dtm <- ___
# Create tf_dtm_m
tf_dtm_m <- ___
# Dimensions of DTM matrix
___
# Subset part of tf_dtm_m for comparison
___[___, ___]