НачатьНачать бесплатно

Используем функциональность класса

Вы добавили дополнительную функциональность в метод __init__ класса Document, который теперь автоматически обрабатывает текст для пользователей. В этом упражнении вы сами выступите в роли такого пользователя и оцените результаты своей работы.

Класс Document (приведён ниже) уже загружен в вашу среду со всеми внесёнными обновлениями.

class Document:
  def __init__(self, text):
    self.text = text
    # pre tokenize the document with non-public tokenize method
    self.tokens = self._tokenize()
    # pre tokenize the document with non-public count_words
    self.word_counts = self._count_words()

  def _tokenize(self):
    return tokenize(self.text)

  # non-public method to tally document's word counts with Counter
  def _count_words(self):
    return Counter(self.tokens)

Это упражнение является частью курса

Принципы разработки программного обеспечения на Python

Посмотреть курс

Инструкции к упражнению

  • Создайте новый экземпляр класса Document на основе набора данных datacamp_tweets, загруженного в вашу среду. Объект datacamp_tweets — это одна строка, содержащая сотни твитов, написанных DataCamp и пользователями DataCamp.
  • Выведите первые 5 токенов из datacamp_doc.
  • Выведите 5 наиболее часто встречающихся слов, которые были автоматически подсчитаны непубличным методом _count_words() в методе Document.__init__.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# create a new document instance from datacamp_tweets
datacamp_doc = ____(____)

# print the first 5 tokens from datacamp_doc
print(____.____[:5])

# print the top 5 most used words in datacamp_doc
print(____.____.most_common(5))
Редактировать и запускать код