Criar corpora baseados em polaridade
Neste exercício, você vai executar a Etapa 3 do fluxo de trabalho de mineração de texto. Embora o qdap não seja um pacote tidy, você vai mutate() uma nova coluna com base na lista polarity retornada, que representa as pontuações de toda a polaridade (isso é uma dica, aliás). No capítulo 3 usamos a função personalizada pol_subsections, que utiliza apenas declarações de base R. Porém, seguindo os princípios tidy, este exercício usa filter() e apresenta pull(). A função pull() funciona como [[ para extrair uma única variável.
Depois de separar, você vai juntar todos os comentários positivos e negativos em dois documentos maiores, representando todas as palavras entre as avaliações positivas e negativas das locações.
Por fim, você criará uma Term Document Matrix (TDM) ponderada por Term Frequency Inverse Document Frequency (TFIDF). Como o código deste exercício parte de uma estrutura tidy, algumas funções emprestadas do tm são usadas junto com o operador %>% para manter o estilo consistente. Se você não estiver familiarizado com o básico do pacote tm, confira o curso Text Mining with Bag-of-Words in R. Em vez de contar o número de vezes que uma palavra é usada (frequência), os valores na TDM são penalizados por termos usados em excesso, o que ajuda a reduzir palavras pouco informativas.
Este exercicio faz parte do curso
Análise de Sentimentos em R
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
pos_terms <- bos_reviews %>%
# Add polarity column
___(polarity = ___) %>%
# Filter for positive polarity
___(___) %>%
# Extract comments column
___(___) %>%
# Paste and collapse
___(collapse = "___")