Začněte nyníZačněte zdarma

Vytvoření slovníku a korpusu

Než spustíš LDA model pro modelování témat, musíš nejdřív definovat slovník a korpus – obojí do modelu vstupuje jako vstupní data. Budeme pokračovat s vyčištěnými textovými daty z předchozích cvičení. Proměnná text_clean je tedy už k dispozici a použiješ ji k vytvoření slovníku i korpusu.

Toto cvičení může trvat o něco déle než obvykle.

Toto cvičení je součástí kurzu

Detekce podvodů v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Importuj balíček gensim a zvlášť také corpora z gensim.
  • Definuj slovník spuštěním správné funkce na vyčištěných datech text_clean.
  • Definuj korpus spuštěním doc2bow pro každý text v text_clean.
  • Vypiš výsledky, abys viděl/a, jak dictionary a corpus vypadají.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import the packages
import ____
from ____ import ____

# Define the dictionary
dictionary = ____.____(____)

# Define the corpus 
corpus = [dictionary.____(text) for ___ in ____]

# Print corpus and dictionary
print(____)
print(____)
Upravit a spustit kód