Přiřazení témat k dokumentům
Vytváření LDA modelů nemá smysl, pokud nedokážeš interpretovat a využít jejich výsledky. Máš k dispozici výsledky LDA modelu sentence_lda spuštěného na sadě vět pig_sentences. Abys výsledky LDA analýzy plně pochopil/a, potřebuješ prozkoumat obě matice – beta (nejčastější slova podle tématu) i gamma (nejdůležitější témata pro každý dokument).
Využij znalosti těchto dvou matic, extrahuj výsledky pro konkrétní téma a ověř, zda výstup odpovídá očekávání.
Toto cvičení je součástí kurzu
Úvod do zpracování přirozeného jazyka v R
Pokyny k cvičení
- Vytvoř tibble pro matice
betaigamma. - Prozkoumej téma 5 tak, že zobrazíš nejčastější slova pro téma 5 a seřadíš výsledky podle klesajících hodnot
beta. - Prozkoumej téma 5 tak, že zjistíš, které věty nejlépe odpovídají tématu 5, a seřadíš výsledky podle klesajících hodnot
gamma.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Extract the beta and gamma matrices
sentence_betas <- tidy(sentence_lda, ___ = "___")
sentence_gammas <- tidy(sentence_lda, ___ = "___")
# Explore Topic 5 Betas
___ %>%
___(topic == ___) %>%
arrange(-___)
# Explore Topic 5 Gammas
___ %>%
___(topic == ___) %>%
arrange(-___)