Czyszczenie przemówień TED w ramce danych
W tym ćwiczeniu wrócimy do przemówień TED z pierwszego rozdziału. Masz do dyspozycji ramkę danych ted zawierającą 5 przemówień TED. Twoim zadaniem jest wyczyszczenie tych tekstów przy użyciu omówionych wcześniej technik – napisz funkcję preprocess i zastosuj ją do cechy transcript w tej ramce danych.
Lista stopwords jest dostępna jako stopwords.
To ćwiczenie jest częścią kursu
Inżynieria cech dla NLP w Pythonie
Instrukcje do ćwiczenia
- Wygeneruj obiekt Doc dla zmiennej
text. Na razie pomiń argumentdisable. - Wygeneruj lematy za pomocą wyrażenia listowego, korzystając z atrybutu
lemma_. - Usuń znaki niealfabetyczne, używając
isalpha()w warunku if.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Function to preprocess text
def preprocess(text):
# Create Doc object
doc = nlp(____, disable=['ner', 'parser'])
# Generate lemmas
lemmas = [token.____ for token in doc]
# Remove stopwords and non-alphabetic characters
a_lemmas = [lemma for lemma in lemmas
if lemma.____ and lemma not in stopwords]
return ' '.join(a_lemmas)
# Apply preprocess to ted['transcript']
ted['transcript'] = ted['transcript'].apply(____)
print(ted['transcript'])