Analyse de la fréquence des mots
Félicitations ! Vous venez de vous joindre à PyBooks. PyBooks développe un système de recommandation de livres et souhaite repérer des tendances et des motifs dans le texte pour améliorer ses recommandations.
Pour commencer, vous devez comprendre la fréquence des mots dans un texte donné et retirer les mots rares.
Notez que les jeux de données réels typiques seront plus grands que cet exemple.
Cette activité fait partie du cours
Apprentissage profond pour le texte avec PyTorch
Instructions de l’exercice
- Importez
get_tokenizerdepuistorchtextetFreqDistdepuis la bibliothèquenltk. - Initialisez le segmentateur pour l'anglais et segmentez le
textfourni. - Calculez la distribution de fréquence des
tokenset retirez les mots rares à l'aide d'une compréhension de liste.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import the necessary functions
from torchtext.data.utils import ____
from nltk.probability import ____
text = "In the city of Dataville, a data analyst named Alex explores hidden insights within vast data. With determination, Alex uncovers patterns, cleanses the data, and unlocks innovation. Join this adventure to unleash the power of data-driven decisions."
# Initialize the tokenizer and tokenize the text
tokenizer = ____("basic_english")
tokens = tokenizer(____)
threshold = 1
# Remove rare words and print common tokens
freq_dist = ____(____)
common_tokens = [token for token in tokens if ____[token] > ____]
print(common_tokens)