重複の検出
ride_sharing に取り込まれるデータパイプラインに新しい更新があり、各乗車を一意に識別する ride_id 列が追加されました。
しかし、この更新と同時に、平均乗車時間が極端に短くなり、未来の日付になっている不規則なユーザー生年が見つかりました。さらに重要なことに、乗車回数が一晩で 20% 増加しており、ride_sharing DataFrame に完全な重複と不完全な重複の両方が存在するのではないかと疑われます。
この演習では、実際にそれらの重複を見つけて、この疑いを確認します。ride_sharing のサンプルと、これまで使用してきたすべてのパッケージは環境に用意されています。
この演習はコースの一部です
Pythonで学ぶデータクリーニング
演習の手順
keepをFalseに設定して、ride_sharingDataFrame のride_idに重複がある行を見つけてください。duplicatesでride_sharingをサブセットし、ride_idで並べ替えて、結果をduplicated_ridesに代入します。duplicated_ridesからride_id、duration、user_birth_yearの各列をこの順で表示してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Find duplicates
duplicates = ____.____(____, ____)
# Sort your duplicated rides
duplicated_rides = ride_sharing[____].____('____')
# Print relevant columns of duplicated_rides
print(duplicated_rides[['____','____','____']])