Анализ частоты слов
Поздравляем! Вы только что присоединились к команде PyBooks. Компания PyBooks разрабатывает систему рекомендации книг и хочет выявлять закономерности и тенденции в текстах, чтобы улучшить качество рекомендаций.
Для начала нужно разобраться, как часто встречаются слова в заданном тексте, и удалить редкие из них.
Обратите внимание: реальные наборы данных обычно значительно больше этого примера.
Это упражнение является частью курса
Глубокое обучение для работы с текстом на PyTorch
Инструкции к упражнению
- Импортируйте
get_tokenizerизtorchtextиFreqDistиз библиотекиnltk. - Инициализируйте токенизатор для английского языка и токенизируйте заданный текст
text. - Вычислите частотное распределение токенов
tokensи удалите редкие слова с помощью списочного включения.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import the necessary functions
from torchtext.data.utils import ____
from nltk.probability import ____
text = "In the city of Dataville, a data analyst named Alex explores hidden insights within vast data. With determination, Alex uncovers patterns, cleanses the data, and unlocks innovation. Join this adventure to unleash the power of data-driven decisions."
# Initialize the tokenizer and tokenize the text
tokenizer = ____("basic_english")
tokens = tokenizer(____)
threshold = 1
# Remove rare words and print common tokens
freq_dist = ____(____)
common_tokens = [token for token in tokens if ____[token] > ____]
print(common_tokens)