ПочатиПочніть безкоштовно

Аналіз частоти слів

Вітаємо! Ви щойно приєдналися до PyBooks. PyBooks розробляє систему рекомендацій книжок і хоче знаходити закономірності та тренди в текстах, щоб покращити рекомендації.

Спочатку варто з'ясувати частоту слів у заданому тексті та прибрати рідкісні слова.

Зверніть увагу, що типові реальні набори даних будуть більшими за цей приклад.

Ця вправа є частиною курсу

Глибоке навчання для тексту з PyTorch

Переглянути курс

Інструкції до вправи

  • Імпортуйте get_tokenizer з torchtext і FreqDist з бібліотеки nltk.
  • Ініціалізуйте токенайзер для англійської та розбийте на токени наданий text.
  • Обчисліть розподіл частот для tokens і приберіть рідкісні слова за допомогою спискового включення.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import the necessary functions
from torchtext.data.utils import ____
from nltk.probability import ____

text = "In the city of Dataville, a data analyst named Alex explores hidden insights within vast data. With determination, Alex uncovers patterns, cleanses the data, and unlocks innovation. Join this adventure to unleash the power of data-driven decisions."

# Initialize the tokenizer and tokenize the text
tokenizer = ____("basic_english")
tokens = tokenizer(____)

threshold = 1
# Remove rare words and print common tokens
freq_dist = ____(____)
common_tokens = [token for token in tokens if ____[token] > ____]
print(common_tokens)
Редагувати та запускати код