始める無料で始める

ブログ記事のクリーニング

この演習では、ブログ記事の抜粋が与えられています。これを機械が扱いやすい形式にクリーニングしてください。小文字化、レマタイゼーション、ストップワード・句読点・英字以外の文字の除去を行います。

抜粋は文字列 blog として用意され、コンソールに出力されています。ストップワードのリストは stopwords として利用できます。

この演習はコースの一部です

Pythonで学ぶNLPの特徴量エンジニアリング

コースを見る

演習の手順

  • リスト内包表記を使って、doc をループし、各トークンの lemma_ を抽出してください。
  • stopwordsisalpha() を使って、ストップワードと英字以外のトークンを取り除いてください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Load model and create Doc object
nlp = spacy.load('en_core_web_sm')
doc = nlp(blog)

# Generate lemmatized tokens
lemmas = [token.____ for token in ____]

# Remove stopwords and non-alphabetic tokens
a_lemmas = [lemma for lemma in lemmas 
            if lemma.____ and lemma not in ____]

# Print string after text cleaning
print(' '.join(a_lemmas))
コードを編集して実行