Comece agoraComece grátis

Criar corpora baseados em polaridade

Neste exercício, você vai executar a Etapa 3 do fluxo de trabalho de mineração de texto. Embora o qdap não seja um pacote tidy, você vai mutate() uma nova coluna com base na lista polarity retornada, que representa as pontuações de toda a polaridade (isso é uma dica, aliás). No capítulo 3 usamos a função personalizada pol_subsections, que utiliza apenas declarações de base R. Porém, seguindo os princípios tidy, este exercício usa filter() e apresenta pull(). A função pull() funciona como [[ para extrair uma única variável.

Depois de separar, você vai juntar todos os comentários positivos e negativos em dois documentos maiores, representando todas as palavras entre as avaliações positivas e negativas das locações.

Por fim, você criará uma Term Document Matrix (TDM) ponderada por Term Frequency Inverse Document Frequency (TFIDF). Como o código deste exercício parte de uma estrutura tidy, algumas funções emprestadas do tm são usadas junto com o operador %>% para manter o estilo consistente. Se você não estiver familiarizado com o básico do pacote tm, confira o curso Text Mining with Bag-of-Words in R. Em vez de contar o número de vezes que uma palavra é usada (frequência), os valores na TDM são penalizados por termos usados em excesso, o que ajuda a reduzir palavras pouco informativas.

Este exercicio faz parte do curso

Análise de Sentimentos em R

Ver curso

exercicio interativo prático

Tente este exercicio completando este código de exemplo.

pos_terms <- bos_reviews %>%
  # Add polarity column
  ___(polarity = ___) %>%
  # Filter for positive polarity
  ___(___) %>%
  # Extract comments column
  ___(___) %>% 
  # Paste and collapse
  ___(collapse = "___")
Editar e Executar Código