Creează corpusuri bazate pe polaritate
În acest exercițiu vei realiza Pasul 3 din fluxul de lucru al analizei de text. Deși qdap nu este un pachet tidy, vei folosi mutate() pentru a adăuga o coloană nouă bazată pe lista polarity returnată, care reprezintă toate scorurile de polaritate (acesta este, de altfel, un indiciu). În capitolul 3 am folosit funcția personalizată pol_subsections, care utilizează doar declarații din R de bază. Totuși, urmând principiile tidy, acest exercițiu folosește filter() și introduce pull(). Funcția pull() funcționează similar cu [[ și extrage o singură variabilă.
Odată ce comentariile sunt separate, le vei concatena pe cele pozitive și negative în două documente mai mari, reprezentând toate cuvintele din recenziile pozitive, respectiv negative.
În final, vei crea o Matrice Termen-Document (TDM) ponderată cu Term Frequency Inverse Document Frequency (TFIDF). Deoarece codul acestui exercițiu pornește dintr-o structură tidy, unele funcții din pachetul tm sunt combinate cu operatorul %>% pentru a menține un stil consistent. Dacă noțiunile de bază ale pachetului tm nu îți sunt familiare, consultă cursul Text Mining with Bag-of-Words in R. În loc să numere de câte ori apare un cuvânt (frecvență), valorile din TDM sunt penalizate pentru termenii folosiți excesiv, ceea ce ajută la reducerea cuvintelor neinformative.
Acest exercițiu face parte din cursul
Analiza sentimentelor în R
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
pos_terms <- bos_reviews %>%
# Add polarity column
___(polarity = ___) %>%
# Filter for positive polarity
___(___) %>%
# Extract comments column
___(___) %>%
# Paste and collapse
___(collapse = "___")