Odstranění stop slov
Pracuješ na projektu, jehož cílem je rozřadit zpětnou vazbu od uživatelů do různých kategorií, například „problémy s produktem", „problémy se službami" a „návrhy na zlepšení". Stop slova většinou nepomáhají rozlišovat mezi kategoriemi, a proto je chceme odstranit. Tvým úkolem je zbavit se jich a ponechat jen ta slova, která modelu později pomůžou správně zařadit zpětnou vazbu do příslušných témat.
Funkce word_tokenize z nltk.tokenize a stopwords.words z nltk.corpus jsou již naimportovány. Zdroje NLTK punkt_tab a stopwords jsou také předem staženy.
Toto cvičení je součástí kurzu
Zpracování přirozeného jazyka (NLP) v Pythonu
Pokyny k cvičení
- Tokenizuj zadanou zpětnou vazbu na jednotlivá slova.
- Získej seznam anglických stop slov.
- Odstraň anglická stop slova a výsledek ulož do
filtered_tokens.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
feedback = "I reached out to support and got a helpful response within minutes!!! Very #impressed"
# Tokenize the text
tokens = word_tokenize(____)
# Get the list of English stop words
stop_words = stopwords.____('____')
# Remove stop words
filtered_tokens = [____ for word in tokens if ____.lower() not in ____]
print(filtered_tokens)