ÎncepețiÎncepe gratuit

Confruntare! Recenzii pro Amazon vs. Google

Recenziile pozitive ale Amazon menționează bigrame precum „good benefits", în timp ce recenziile negative se concentrează pe bigrame precum „workload" și probleme legate de „work-life balance".

Prin contrast, recenziile pozitive ale Google menționează „great food", „perks", „smart people" și „fun culture", printre altele. Recenziile negative ale Google discută despre „politics", „getting big", „bureaucracy" și „middle management".

Decizi să creezi un pyramid plot care aliniază recenziile pozitive ale celor două companii, pentru a putea compara diferențele dintre bigramele comune. Am preîncărcat un data frame, all_tdm_df, care conține coloana terms și frecvențele bigramelor corespunzătoare pentru AmazonPro și GooglePro. Pe baza acestui data frame, vei identifica primele 5 bigrame comune celor două corpusuri.

Acest exercițiu face parte din cursul

Text Mining cu Bag-of-Words în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează common_words din all_tdm_df folosind funcții dplyr.
    • Aplică filter() pe coloana AmazonPro pentru valori nenule.
    • Aplică același filtru pe coloana GooglePro pentru valori nenule.
    • Folosește mutate() pentru a adăuga o nouă coloană, diff, care reprezintă diferența absolută (abs) dintre frecvențele celor două coloane.
  • Trimite common_words prin pipe către slice_max pentru a crea top5_df, referențiind coloana diff și primele 5 valori. Rezultatul va fi afișat în consolă pentru verificare.
  • Creează un pyramid.plot pasând top5_df$AmazonPro, apoi top5_df$GooglePro, și adaugă etichetele cu top5_df$terms.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Filter to words in common and create an absolute diff column
common_words <- all_tdm_df %>% 
  filter(
    ___ != 0,
    ___ != 0
  ) %>%
  ___(diff = ___(___ - ___))

# Extract top 5 common bigrams
(top5_df <- common_words %>% ___(___, n = ___))

# Create the pyramid plot
pyramid.plot(top5_df$___, top5_df$___, 
             labels = top5_df$___, gap = 12, 
             top.labels = c("Amzn", "Pro Words", "Goog"), 
             main = "Words in Common", unit = NULL)
Editează și rulează codul