Zacznij terazZacznij za darmo

Tworzenie słownika i korpusu

Aby uruchomić model tematyczny LDA, musisz najpierw zdefiniować słownik i korpus – to właśnie one trafiają do modelu. Będziesz kontynuować pracę na oczyszczonych danych tekstowych z poprzednich ćwiczeń. Oznacza to, że text_clean jest już dostępny i gotowy do użycia – posłuży ci do utworzenia słownika oraz korpusu.

To ćwiczenie może działać nieco dłużej niż zwykle.

To ćwiczenie jest częścią kursu

Wykrywanie oszustw w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj pakiet gensim oraz corpora z gensim jako oddzielne importy.
  • Zdefiniuj słownik, wywołując odpowiednią funkcję na oczyszczonych danych text_clean.
  • Zdefiniuj korpus, wywołując doc2bow na każdym fragmencie tekstu z text_clean.
  • Wydrukuj wyniki, aby sprawdzić, jak wyglądają dictionary i corpus.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import the packages
import ____
from ____ import ____

# Define the dictionary
dictionary = ____.____(____)

# Define the corpus 
corpus = [dictionary.____(text) for ___ in ____]

# Print corpus and dictionary
print(____)
print(____)
Edytuj i uruchom kod