Vytvoření slovníku a korpusu
Než spustíš LDA model pro modelování témat, musíš nejdřív definovat slovník a korpus – obojí do modelu vstupuje jako vstupní data. Budeme pokračovat s vyčištěnými textovými daty z předchozích cvičení. Proměnná text_clean je tedy už k dispozici a použiješ ji k vytvoření slovníku i korpusu.
Toto cvičení může trvat o něco déle než obvykle.
Toto cvičení je součástí kurzu
Detekce podvodů v Pythonu
Pokyny k cvičení
- Importuj balíček gensim a zvlášť také
corporaz gensim. - Definuj slovník spuštěním správné funkce na vyčištěných datech
text_clean. - Definuj korpus spuštěním
doc2bowpro každý text vtext_clean. - Vypiš výsledky, abys viděl/a, jak
dictionaryacorpusvypadají.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import the packages
import ____
from ____ import ____
# Define the dictionary
dictionary = ____.____(____)
# Define the corpus
corpus = [dictionary.____(text) for ___ in ____]
# Print corpus and dictionary
print(____)
print(____)