違いを理解する
ツイートのデータセットを引き続き整形・クリーニングします。HTMLタグが含まれていることに気づきました。中身のテキストは分析に役立つので残しつつ、HTMLタグだけを取り除く必要があります。
HTMLタグを含む次の文を見てみましょう。
I want to see that <strong>amazing show</strong> again!
HTMLタグを取得するには、山かっこ < > の間にあるものにマッチさせればよいと分かっています。ただし、閉じタグも同じ構造をしているのが最大の問題です。マッチしすぎると、重要な情報まで削除してしまいます。そこで、貪欲(greedy)か遅延(lazy)どちらの量指定子を使うかを判断する必要があります。
文字列はすでに string としてセッションに読み込まれています。
この演習はコースの一部です
Pythonで学ぶ正規表現
演習の手順
reモジュールをインポートします。- HTMLタグ を空文字に置換するための
regexを書きます。 - 結果を出力します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import re
____
# Write a regex to eliminate tags
string_notags = re.____(r"____", "____", ____)
# Print out the result
____