Comece agoraComece grátis

Revisão de TM (II)

Agora vamos criar uma Document Term Matrix (DTM). Em uma DTM:

  • Cada linha da matriz representa um documento.
  • Cada coluna é um token de palavra único.
  • Os valores da matriz correspondem ao uso de palavras de um documento individual.

A DTM é a base para muitas análises de bag of words. Mais adiante no curso, você também usará a Term Document Matrix (TDM) relacionada. Ela é a transposta; isto é, as colunas representam documentos e as linhas representam tokens de palavras únicas.

Você deve construir uma DTM depois de limpar o corpus (usando clean_corpus()). Para isso, chame DocumentTermMatrix() no objeto de corpus.

tm_dtm <- DocumentTermMatrix(tm_clean)

Se você precisar de uma revisão mais aprofundada, confira o curso Text Mining with Bag-of-Words in R. Espero que estes dois exercícios tenham preparado você bem o suficiente para começar sua jornada em análise de sentimento!

Atenção: estes são dados reais do Twitter e, como tal, sempre há o risco de conterem palavrões ou outro conteúdo ofensivo (neste exercício e em quaisquer exercícios seguintes que também usem dados reais do Twitter).

Este exercicio faz parte do curso

Análise de Sentimentos em R

Ver curso

Instruções do exercicio

Criamos um objeto VCorpus() chamado clean_text contendo 1000 tweets mencionando coffee. Os tweets foram limpos com as etapas de pré-processamento mencionadas anteriormente, e seu objetivo é criar uma DTM a partir dele.

  • Aplique DocumentTermMatrix() ao corpus clean_text para criar uma DTM ponderada por frequência de termos chamada tf_dtm.
  • Converta o objeto DocumentTermMatrix() em uma matriz simples com as.matrix(). Chame o novo objeto de tf_dtm_m.
  • Verifique as dimensões da matriz usando dim().
  • Use indexação com colchetes para ver um subconjunto da matriz.
  • Selecione as linhas de 16 a 20 e as colunas de 2975 a 2985
  • Observe o valor de frequência da palavra "working."

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

# clean_text is pre-defined
clean_text

# Create tf_dtm
tf_dtm <- ___

# Create tf_dtm_m
tf_dtm_m <- ___

# Dimensions of DTM matrix
___

# Subset part of tf_dtm_m for comparison
___[___, ___]
Editar e Executar Código