ПочатиПочніть безкоштовно

Очищення виступів TED у датафреймі

У цій вправі ми повертаємося до виступів TED з першого розділу. Вам надано датафрейм ted, що містить 5 виступів TED. Ваше завдання — очистити ці виступи, застосувавши техніки, розглянуті раніше: напишіть функцію preprocess і застосуйте її до ознаки transcript у датафреймі.

Список стопслів доступний як stopwords.

Ця вправа є частиною курсу

Інженерія ознак для NLP у Python

Переглянути курс

Інструкції до вправи

  • Створіть об'єкт Doc для text. Аргумент disable поки що проігноруйте.
  • Згенеруйте леми за допомогою list comprehension, використовуючи атрибут lemma_.
  • Видаліть неалфавітні символи, використовуючи isalpha() в умові if.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Function to preprocess text
def preprocess(text):
  	# Create Doc object
    doc = nlp(____, disable=['ner', 'parser'])
    # Generate lemmas
    lemmas = [token.____ for token in doc]
    # Remove stopwords and non-alphabetic characters
    a_lemmas = [lemma for lemma in lemmas 
            if lemma.____ and lemma not in stopwords]
    
    return ' '.join(a_lemmas)
  
# Apply preprocess to ted['transcript']
ted['transcript'] = ted['transcript'].apply(____)
print(ted['transcript'])
Редагувати та запускати код