Modèle LDA
Il est maintenant temps de construire le modèle LDA. À partir de dictionary et corpus, vous êtes prêt à découvrir quels sujets sont présents dans les courriels d'Enron. En affichant rapidement les mots associés aux sujets, vous pouvez faire une première exploration pour voir si certains thèmes évidents se démarquent. Gardez en tête que le modèle thématique est lourd à calculer, donc l'exécution prendra un certain temps. Allons-y!
Cette activité fait partie du cours
Détection de fraude en Python
Instructions de l’exercice
- Construisez le modèle LDA à partir des modèles gensim, en y insérant
corpusetdictionary. - Enregistrez les 5 sujets en exécutant
printtopics sur les résultats du modèle, et sélectionnez les 5 mots les plus fréquents.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Define the LDA model
ldamodel = gensim.models.____.____(____, num_topics=5, id2word=____, passes=5)
# Save the topics and top 5 words
topics = ____.____(num_words=____)
# Print the results
for topic in topics:
print(topic)