ブログ記事のクリーニング
この演習では、ブログ記事の抜粋が与えられています。これを機械が扱いやすい形式にクリーニングしてください。小文字化、レマタイゼーション、ストップワード・句読点・英字以外の文字の除去を行います。
抜粋は文字列 blog として用意され、コンソールに出力されています。ストップワードのリストは stopwords として利用できます。
この演習はコースの一部です
Pythonで学ぶNLPの特徴量エンジニアリング
演習の手順
- リスト内包表記を使って、
docをループし、各トークンのlemma_を抽出してください。 stopwordsとisalpha()を使って、ストップワードと英字以外のトークンを取り除いてください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Load model and create Doc object
nlp = spacy.load('en_core_web_sm')
doc = nlp(blog)
# Generate lemmatized tokens
lemmas = [token.____ for token in ____]
# Remove stopwords and non-alphabetic tokens
a_lemmas = [lemma for lemma in lemmas
if lemma.____ and lemma not in ____]
# Print string after text cleaning
print(' '.join(a_lemmas))