Model LDA
Czas zbudować model LDA. Korzystając z dictionary i corpus, możesz odkryć, jakie tematy pojawiają się w e-mailach Enron. Szybki podgląd słów przypisanych do poszczególnych tematów pozwoli ci wstępnie ocenić, czy wyraźnie rysują się jakieś wzorce. Pamiętaj, że model tematyczny jest obliczeniowo kosztowny, więc jego działanie może chwilę potrwać. Spróbujmy!
To ćwiczenie jest częścią kursu
Wykrywanie oszustw w Pythonie
Instrukcje do ćwiczenia
- Zbuduj model LDA z modułu gensim models, przekazując
corpusidictionary. - Zapisz 5 tematów, wywołując
printtopics na wynikach modelu, i wybierz 5 najważniejszych słów.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Define the LDA model
ldamodel = gensim.models.____.____(____, num_topics=5, id2word=____, passes=5)
# Save the topics and top 5 words
topics = ____.____(num_words=____)
# Print the results
for topic in topics:
print(topic)