Làm sạch các bài TED Talk trong một dataframe
Trong bài này, chúng ta sẽ quay lại các bài TED Talk từ chương đầu tiên. Bạn được cung cấp một dataframe ted gồm 5 bài TED Talk. Nhiệm vụ của bạn là làm sạch các bài nói này bằng các kỹ thuật đã thảo luận trước đó bằng cách viết hàm preprocess và áp dụng nó cho thuộc tính transcript của dataframe.
Danh sách stopwords có sẵn dưới tên stopwords.
Bài tập này là một phần của khóa học
Khai thác đặc trưng cho NLP bằng Python
Hướng dẫn bài tập
- Tạo đối tượng Doc cho
text. Bỏ qua đối sốdisablelúc này. - Tạo các lemma bằng list comprehension sử dụng thuộc tính
lemma_. - Loại bỏ các ký tự không phải chữ cái bằng
isalpha()trong điều kiện if.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Function to preprocess text
def preprocess(text):
# Create Doc object
doc = nlp(____, disable=['ner', 'parser'])
# Generate lemmas
lemmas = [token.____ for token in doc]
# Remove stopwords and non-alphabetic characters
a_lemmas = [lemma for lemma in lemmas
if lemma.____ and lemma not in stopwords]
return ' '.join(a_lemmas)
# Apply preprocess to ted['transcript']
ted['transcript'] = ted['transcript'].apply(____)
print(ted['transcript'])