ПочатиПочніть безкоштовно

Звикаємо до текстових даних

У цій вправі ви попрацюєте з текстовими даними, аналізуючи цитати Шелдона Купера з серіалу The Big Bang Theory. Це дасть змогу розібрати речення та відчути, що означає працювати з реальними текстовими даними.

Ви використаєте словникові включення, щоб створити словники, які відображають слова в індекси й навпаки. Ми використовуємо саме словники, а не, наприклад, pandas.DataFrame, тому що вони інтуїтивніші й не додають зайвої складності.

Дані доступні в sheldon_quotes, перші два речення вже виведено для вас.

Ця вправа є частиною курсу

Recurrent Neural Networks (RNNs) для моделювання мови з Keras

Переглянути курс

Інструкції до вправи

  • join об'єднайте речення в одну змінну, потім видобудьте всі слова та збережіть цей список у all_words.
  • Приберіть повторювані слова, застосувавши list(set()) до списку слів, і збережіть їх у unique_words.
  • Створіть словник з індексами як ключами та словами як значеннями за допомогою словникових включень.
  • Створіть словник зі словами як ключами та індексами як значеннями за допомогою словникових включень.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Transform the list of sentences into a list of words
all_words = ' '.____(sheldon_quotes).split(' ')

# Get number of unique words
unique_words = list(set(all_words))

# Dictionary of indexes as keys and words as values
index_to_word = {____ for i, wd in enumerate(sorted(unique_words))}

print(index_to_word)

# Dictionary of words as keys and indexes as values
word_to_index = {wd:i for ____ in enumerate(sorted(unique_words))}

print(word_to_index)
Редагувати та запускати код