Kom igångKom igång gratis

Ordfrekvensanalys

Grattis! Du har precis börjat på PyBooks. PyBooks håller på att utveckla ett bokrekommendationssystem och vill hitta mönster och trender i text för att förbättra sina rekommendationer.

Först behöver du förstå hur ofta olika ord förekommer i en given text och ta bort sällsynta ord.

Observera att verkliga datamängder vanligtvis är större än det här exemplet.

Den här övningen är en del av kursen

Djupinlärning för text med PyTorch

Visa kurs

Övningsinstruktioner

  • Importera get_tokenizer från torchtext och FreqDist från biblioteket nltk.
  • Initiera tokeniseraren för engelska och tokenisera den givna variabeln text.
  • Beräkna frekvensfördelningen för tokens och ta bort sällsynta ord med hjälp av listomfattning.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import the necessary functions
from torchtext.data.utils import ____
from nltk.probability import ____

text = "In the city of Dataville, a data analyst named Alex explores hidden insights within vast data. With determination, Alex uncovers patterns, cleanses the data, and unlocks innovation. Join this adventure to unleash the power of data-driven decisions."

# Initialize the tokenizer and tokenize the text
tokenizer = ____("basic_english")
tokens = tokenizer(____)

threshold = 1
# Remove rare words and print common tokens
freq_dist = ____(____)
common_tokens = [token for token in tokens if ____[token] > ____]
print(common_tokens)
Redigera och kör kod