ПочатиПочніть безкоштовно

Створіть вектори речень і наступних символів

У цій вправі наголосимо на важливості підготовки даних. Ви використаєте тексти з фразами персонажа Шелдона з серіалу «Теорія великого вибуху» як вхідні дані та створите вектори індексів речень і наступних символів, які потрібні перед створенням моделі генерування тексту.

Текст доступний у змінній sheldon, а словник (набір символів) — у змінній vocabulary, а також задані гіперпараметри chars_window і step зі значеннями 20 і 3. Це означає, що послідовність із 20 символів використовуватиметься для передбачення наступного, а вікно зсуватиметься на 3 символи в кожній ітерації.

Крім того, пакунок pandas під ім'ям pd уже завантажено в середовище.

Ця вправа є частиною курсу

Recurrent Neural Networks (RNNs) для моделювання мови з Keras

Переглянути курс

Інструкції до вправи

  • Розбийте текст за символом переносу рядка, щоб ітеруватися по реченнях.
  • Ітеруйтеся до кінця речення мінус chars_window.
  • Додайте фрагмент речення довжиною chars_window символів до змінної sentences, а наступний символ — до змінної next_chars.
  • Використайте отримані вектори, щоб створити pd.DataFrame() і вивести його перші рядки.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Instantiate the vectors
sentences = []
next_chars = []
# Loop for every sentence
for sentence in sheldon.____:
    # Get 20 previous chars and next char; then shift by step
    for i in range(0, len(sentence) - ____, step):
        sentences.append(sentence[i:i + ____])
        next_chars.append(sentence[____ + chars_window])

# Define a Data Frame with the vectors
df = pd.DataFrame({'sentence': ____, 'next_char': ____})

# Print the initial rows
print(df.head())
Редагувати та запускати код