Tworzenie słownika i korpusu
Aby uruchomić model tematyczny LDA, musisz najpierw zdefiniować słownik i korpus – to właśnie one trafiają do modelu. Będziesz kontynuować pracę na oczyszczonych danych tekstowych z poprzednich ćwiczeń. Oznacza to, że text_clean jest już dostępny i gotowy do użycia – posłuży ci do utworzenia słownika oraz korpusu.
To ćwiczenie może działać nieco dłużej niż zwykle.
To ćwiczenie jest częścią kursu
Wykrywanie oszustw w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj pakiet gensim oraz
corporaz gensim jako oddzielne importy. - Zdefiniuj słownik, wywołując odpowiednią funkcję na oczyszczonych danych
text_clean. - Zdefiniuj korpus, wywołując
doc2bowna każdym fragmencie tekstu ztext_clean. - Wydrukuj wyniki, aby sprawdzić, jak wyglądają
dictionaryicorpus.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import the packages
import ____
from ____ import ____
# Define the dictionary
dictionary = ____.____(____)
# Define the corpus
corpus = [dictionary.____(text) for ___ in ____]
# Print corpus and dictionary
print(____)
print(____)