CommencezCommencez gratuitement

Modèle LDA

Il est maintenant temps de construire le modèle LDA. À partir de dictionary et corpus, vous êtes prêt à découvrir quels sujets sont présents dans les courriels d'Enron. En affichant rapidement les mots associés aux sujets, vous pouvez faire une première exploration pour voir si certains thèmes évidents se démarquent. Gardez en tête que le modèle thématique est lourd à calculer, donc l'exécution prendra un certain temps. Allons-y!

Cette activité fait partie du cours

Détection de fraude en Python

Voir le cours

Instructions de l’exercice

  • Construisez le modèle LDA à partir des modèles gensim, en y insérant corpus et dictionary.
  • Enregistrez les 5 sujets en exécutant print topics sur les résultats du modèle, et sélectionnez les 5 mots les plus fréquents.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Define the LDA model
ldamodel = gensim.models.____.____(____, num_topics=5, id2word=____, passes=5)

# Save the topics and top 5 words
topics = ____.____(num_words=____)

# Print the results
for topic in topics:
    print(topic)
Modifier et exécuter le code