Začněte nyníZačněte zdarma

Analýza frekvence slov

Gratulujeme! Právě ses přidal/a do PyBooks. PyBooks vyvíjí systém doporučování knih a chce v textech nacházet vzory a trendy, které pomohou zlepšit doporučení.

Na začátek budeš chtít zjistit, jak často se jednotlivá slova v daném textu vyskytují, a odstranit ta vzácná.

Měj na paměti, že skutečné datasety bývají obvykle větší než tento příklad.

Toto cvičení je součástí kurzu

Deep Learning for Text with PyTorch

Zobrazit kurz

Pokyny k cvičení

  • Importuj get_tokenizer z torchtext a FreqDist z knihovny nltk.
  • Inicializuj tokenizér pro angličtinu a tokenizuj zadaný text.
  • Vypočítej frekvenční distribuci tokens a pomocí list comprehension odstraň vzácná slova.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import the necessary functions
from torchtext.data.utils import ____
from nltk.probability import ____

text = "In the city of Dataville, a data analyst named Alex explores hidden insights within vast data. With determination, Alex uncovers patterns, cleanses the data, and unlocks innovation. Join this adventure to unleash the power of data-driven decisions."

# Initialize the tokenizer and tokenize the text
tokenizer = ____("basic_english")
tokens = tokenizer(____)

threshold = 1
# Remove rare words and print common tokens
freq_dist = ____(____)
common_tokens = [token for token in tokens if ____[token] > ____]
print(common_tokens)
Upravit a spustit kód