始める無料で始める

データフレームで単語検索

この演習では、Enron 社の社員メールを含むテキストデータを扱います。Enron スキャンダルは有名な不正事件です。Enron の社員は会社の悪い財務状況を隠し、株価を人為的に高く保っていました。社員は自社のストックオプションを売却し、真実が明らかになったとき、投資家は無一文になってしまいました。ここでの目的は、「sell enron stock」のような特定の語句に言及しているすべてのメールを見つけることです。

データフレーム上で文字列操作を使うと、雑多なメールデータを手早くふるい分け、単語ヒットに基づくフラグを作成できます。Enron のメールデータは df というデータフレームに入っているので、不審な用語を検索してみましょう。始める前に、コンソールで df を自由に確認してかまいません。

この演習はコースの一部です

Pythonで学ぶ不正検知

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Find all cleaned emails that contain 'sell enron stock'
mask = df['clean_content'].____.____('____', na=False)
コードを編集して実行