始める無料で始める

違いを理解する

ツイートのデータセットを引き続き整形・クリーニングします。HTMLタグが含まれていることに気づきました。中身のテキストは分析に役立つので残しつつ、HTMLタグだけを取り除く必要があります。

HTMLタグを含む次の文を見てみましょう。

I want to see that <strong>amazing show</strong> again!

HTMLタグを取得するには、山かっこ < > の間にあるものにマッチさせればよいと分かっています。ただし、閉じタグも同じ構造をしているのが最大の問題です。マッチしすぎると、重要な情報まで削除してしまいます。そこで、貪欲(greedy)か遅延(lazy)どちらの量指定子を使うかを判断する必要があります。

文字列はすでに string としてセッションに読み込まれています。

この演習はコースの一部です

Pythonで学ぶ正規表現

コースを見る

演習の手順

  • re モジュールをインポートします。
  • HTMLタグ を空文字に置換するための regex を書きます。
  • 結果を出力します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import re
____

# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)

# Print out the result
____
コードを編集して実行