Skapa ordlista och korpus
För att köra en LDA-ämnesmodell behöver du först definiera din ordlista och korpus, eftersom dessa måste skickas in i modellen. Du fortsätter att arbeta med den rensade textdata som du bearbetat i tidigare övningar. Det innebär att text_clean redan finns tillgänglig, och den använder du för att skapa din ordlista och korpus.
Den här övningen tar lite längre tid att köra än vanligt.
Den här övningen är en del av kursen
Bedrägeridetektering i Python
Övningsinstruktioner
- Importera paketet gensim och corpora från gensim separat.
- Definiera din ordlista genom att köra rätt funktion på din rensade data
text_clean. - Definiera korpusen genom att köra
doc2bowpå varje textstycke itext_clean. - Skriv ut resultaten så att du kan se hur
dictionaryochcorpusser ut.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import the packages
import ____
from ____ import ____
# Define the dictionary
dictionary = ____.____(____)
# Define the corpus
corpus = [dictionary.____(text) for ___ in ____]
# Print corpus and dictionary
print(____)
print(____)