ÎncepețiÎncepe gratuit

Analiza frecvenței cuvintelor

Felicitări! Tocmai ai intrat în echipa PyBooks. PyBooks dezvoltă un sistem de recomandare a cărților și dorește să identifice tipare și tendințe în text pentru a îmbunătăți recomandările.

Pentru început, vei analiza frecvența cuvintelor dintr-un text dat și vei elimina cuvintele rare.

Reține că seturile de date reale vor fi, de obicei, mai mari decât acest exemplu.

Acest exercițiu face parte din cursul

Deep Learning pentru text cu PyTorch

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă get_tokenizer din torchtext și FreqDist din biblioteca nltk.
  • Inițializează tokenizatorul pentru limba engleză și tokenizează textul dat (text).
  • Calculează distribuția frecvenței pentru tokens și elimină cuvintele rare folosind list comprehension.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import the necessary functions
from torchtext.data.utils import ____
from nltk.probability import ____

text = "In the city of Dataville, a data analyst named Alex explores hidden insights within vast data. With determination, Alex uncovers patterns, cleanses the data, and unlocks innovation. Join this adventure to unleash the power of data-driven decisions."

# Initialize the tokenizer and tokenize the text
tokenizer = ____("basic_english")
tokens = tokenizer(____)

threshold = 1
# Remove rare words and print common tokens
freq_dist = ____(____)
common_tokens = [token for token in tokens if ____[token] > ____]
print(common_tokens)
Editează și rulează codul