LDA model
Teď je čas sestavit LDA model. S pomocí dictionary a corpus jsi připraveni zjistit, která témata se v e-mailech Enron vyskytují. Rychlým výpisem slov přiřazených k jednotlivým tématům můžeš provést první průzkum a zjistit, jestli nějaká témata okamžitě vynikají. Měj na paměti, že výpočet modelu témata je náročný, takže běh chvíli potrvá. Pojďme to vyzkoušet!
Toto cvičení je součástí kurzu
Detekce podvodů v Pythonu
Pokyny k cvičení
- Sestav LDA model z gensim models tak, že vložíš
corpusadictionary. - Ulož 5 témat spuštěním
printtopics na výsledcích modelu a vyber 5 nejčastějších slov.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Define the LDA model
ldamodel = gensim.models.____.____(____, num_topics=5, id2word=____, passes=5)
# Save the topics and top 5 words
topics = ____.____(num_words=____)
# Print the results
for topic in topics:
print(topic)