Začněte nyníZačněte zdarma

Odstranění stop slov

Pracuješ na projektu, jehož cílem je rozřadit zpětnou vazbu od uživatelů do různých kategorií, například „problémy s produktem", „problémy se službami" a „návrhy na zlepšení". Stop slova většinou nepomáhají rozlišovat mezi kategoriemi, a proto je chceme odstranit. Tvým úkolem je zbavit se jich a ponechat jen ta slova, která modelu později pomůžou správně zařadit zpětnou vazbu do příslušných témat.

Funkce word_tokenize z nltk.tokenize a stopwords.words z nltk.corpus jsou již naimportovány. Zdroje NLTK punkt_tab a stopwords jsou také předem staženy.

Toto cvičení je součástí kurzu

Zpracování přirozeného jazyka (NLP) v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Tokenizuj zadanou zpětnou vazbu na jednotlivá slova.
  • Získej seznam anglických stop slov.
  • Odstraň anglická stop slova a výsledek ulož do filtered_tokens.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

feedback = "I reached out to support and got a helpful response within minutes!!! Very #impressed"

# Tokenize the text
tokens = word_tokenize(____)

# Get the list of English stop words
stop_words = stopwords.____('____')

# Remove stop words 
filtered_tokens = [____ for word in tokens if ____.lower() not in ____]

print(filtered_tokens)
Upravit a spustit kód