Kom igångKom igång gratis

Skapa ordlista och korpus

För att köra en LDA-ämnesmodell behöver du först definiera din ordlista och korpus, eftersom dessa måste skickas in i modellen. Du fortsätter att arbeta med den rensade textdata som du bearbetat i tidigare övningar. Det innebär att text_clean redan finns tillgänglig, och den använder du för att skapa din ordlista och korpus.

Den här övningen tar lite längre tid att köra än vanligt.

Den här övningen är en del av kursen

Bedrägeridetektering i Python

Visa kurs

Övningsinstruktioner

  • Importera paketet gensim och corpora från gensim separat.
  • Definiera din ordlista genom att köra rätt funktion på din rensade data text_clean.
  • Definiera korpusen genom att köra doc2bow på varje textstycke i text_clean.
  • Skriv ut resultaten så att du kan se hur dictionary och corpus ser ut.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import the packages
import ____
from ____ import ____

# Define the dictionary
dictionary = ____.____(____)

# Define the corpus 
corpus = [dictionary.____(text) for ___ in ____]

# Print corpus and dictionary
print(____)
print(____)
Redigera och kör kod