Začněte nyníZačněte zdarma

Čištění TED talks v dataframu

V tomto cvičení se vrátíme k TED Talks z první kapitoly. Máš k dispozici dataframe ted s 5 TED Talks. Tvým úkolem je tyto přednášky vyčistit pomocí technik, které jsme probírali dříve – napíšeš funkci preprocess a aplikuješ ji na sloupec transcript v dataframu.

Seznam stopwords je dostupný jako stopwords.

Toto cvičení je součástí kurzu

Feature Engineering for NLP in Python

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř objekt Doc pro text. Argument disable teď ignoruj.
  • Vytvoř lemmata pomocí list comprehension s využitím atributu lemma_.
  • Odstraň nealfabetické znaky pomocí isalpha() v podmínce if.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Function to preprocess text
def preprocess(text):
  	# Create Doc object
    doc = nlp(____, disable=['ner', 'parser'])
    # Generate lemmas
    lemmas = [token.____ for token in doc]
    # Remove stopwords and non-alphabetic characters
    a_lemmas = [lemma for lemma in lemmas 
            if lemma.____ and lemma not in stopwords]
    
    return ' '.join(a_lemmas)
  
# Apply preprocess to ted['transcript']
ted['transcript'] = ted['transcript'].apply(____)
print(ted['transcript'])
Upravit a spustit kód