Bắt đầu ngayBắt đầu miễn phí

Làm sạch các bài TED Talk trong một dataframe

Trong bài này, chúng ta sẽ quay lại các bài TED Talk từ chương đầu tiên. Bạn được cung cấp một dataframe ted gồm 5 bài TED Talk. Nhiệm vụ của bạn là làm sạch các bài nói này bằng các kỹ thuật đã thảo luận trước đó bằng cách viết hàm preprocess và áp dụng nó cho thuộc tính transcript của dataframe.

Danh sách stopwords có sẵn dưới tên stopwords.

Bài tập này là một phần của khóa học

Khai thác đặc trưng cho NLP bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Tạo đối tượng Doc cho text. Bỏ qua đối số disable lúc này.
  • Tạo các lemma bằng list comprehension sử dụng thuộc tính lemma_.
  • Loại bỏ các ký tự không phải chữ cái bằng isalpha() trong điều kiện if.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Function to preprocess text
def preprocess(text):
  	# Create Doc object
    doc = nlp(____, disable=['ner', 'parser'])
    # Generate lemmas
    lemmas = [token.____ for token in doc]
    # Remove stopwords and non-alphabetic characters
    a_lemmas = [lemma for lemma in lemmas 
            if lemma.____ and lemma not in stopwords]
    
    return ' '.join(a_lemmas)
  
# Apply preprocess to ted['transcript']
ted['transcript'] = ted['transcript'].apply(____)
print(ted['transcript'])
Chỉnh sửa và Chạy Mã