Zacznij terazZacznij za darmo

Czyszczenie przemówień TED w ramce danych

W tym ćwiczeniu wrócimy do przemówień TED z pierwszego rozdziału. Masz do dyspozycji ramkę danych ted zawierającą 5 przemówień TED. Twoim zadaniem jest wyczyszczenie tych tekstów przy użyciu omówionych wcześniej technik – napisz funkcję preprocess i zastosuj ją do cechy transcript w tej ramce danych.

Lista stopwords jest dostępna jako stopwords.

To ćwiczenie jest częścią kursu

Inżynieria cech dla NLP w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Wygeneruj obiekt Doc dla zmiennej text. Na razie pomiń argument disable.
  • Wygeneruj lematy za pomocą wyrażenia listowego, korzystając z atrybutu lemma_.
  • Usuń znaki niealfabetyczne, używając isalpha() w warunku if.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Function to preprocess text
def preprocess(text):
  	# Create Doc object
    doc = nlp(____, disable=['ner', 'parser'])
    # Generate lemmas
    lemmas = [token.____ for token in doc]
    # Remove stopwords and non-alphabetic characters
    a_lemmas = [lemma for lemma in lemmas 
            if lemma.____ and lemma not in stopwords]
    
    return ' '.join(a_lemmas)
  
# Apply preprocess to ted['transcript']
ted['transcript'] = ted['transcript'].apply(____)
print(ted['transcript'])
Edytuj i uruchom kod