始める無料で始める

重複の検出

ride_sharing に取り込まれるデータパイプラインに新しい更新があり、各乗車を一意に識別する ride_id 列が追加されました。

しかし、この更新と同時に、平均乗車時間が極端に短くなり、未来の日付になっている不規則なユーザー生年が見つかりました。さらに重要なことに、乗車回数が一晩で 20% 増加しており、ride_sharing DataFrame に完全な重複と不完全な重複の両方が存在するのではないかと疑われます。

この演習では、実際にそれらの重複を見つけて、この疑いを確認します。ride_sharing のサンプルと、これまで使用してきたすべてのパッケージは環境に用意されています。

この演習はコースの一部です

Pythonで学ぶデータクリーニング

コースを見る

演習の手順

  • keepFalse に設定して、ride_sharing DataFrame の ride_id に重複がある行を見つけてください。
  • duplicatesride_sharing をサブセットし、ride_id で並べ替えて、結果を duplicated_rides に代入します。
  • duplicated_rides から ride_iddurationuser_birth_year の各列をこの順で表示してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Find duplicates
duplicates = ____.____(____, ____)

# Sort your duplicated rides
duplicated_rides = ride_sharing[____].____('____')

# Print relevant columns of duplicated_rides
print(duplicated_rides[['____','____','____']])
コードを編集して実行