Začněte nyníZačněte zdarma

Přiřazení témat k dokumentům

Vytváření LDA modelů nemá smysl, pokud nedokážeš interpretovat a využít jejich výsledky. Máš k dispozici výsledky LDA modelu sentence_lda spuštěného na sadě vět pig_sentences. Abys výsledky LDA analýzy plně pochopil/a, potřebuješ prozkoumat obě matice – beta (nejčastější slova podle tématu) i gamma (nejdůležitější témata pro každý dokument).

Využij znalosti těchto dvou matic, extrahuj výsledky pro konkrétní téma a ověř, zda výstup odpovídá očekávání.

Toto cvičení je součástí kurzu

Úvod do zpracování přirozeného jazyka v R

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř tibble pro matice beta i gamma.
  • Prozkoumej téma 5 tak, že zobrazíš nejčastější slova pro téma 5 a seřadíš výsledky podle klesajících hodnot beta.
  • Prozkoumej téma 5 tak, že zjistíš, které věty nejlépe odpovídají tématu 5, a seřadíš výsledky podle klesajících hodnot gamma.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Extract the beta and gamma matrices
sentence_betas <- tidy(sentence_lda, ___ = "___")
sentence_gammas <- tidy(sentence_lda, ___ = "___")

# Explore Topic 5 Betas
___ %>%
  ___(topic == ___) %>%
  arrange(-___)

# Explore Topic 5 Gammas
___ %>%
  ___(topic == ___) %>%
  arrange(-___)
Upravit a spustit kód