レストランのペア
前のレッスンでは、レストラン推薦エンジンを構築できるように restaurants データセットをクリーンアップしました。新しいデータソースからスクレイピングした新規レストランを含む restaurants_new という新しい DataFrame も用意されており、モデルの学習に使います。
これまでのコースで学んだ手法を使って、cuisine_type と city 列はすでにクリーンアップ済みです。しかし、レストラン名にタイプミスなどの重複が見つかったため、restaurants との単純な結合ではなくレコードリンケージが必要です。
この演習では、レコードリンケージの最初のステップとして、restaurants と restaurants_new 間で取り得る行のペアを生成します。両方の DataFrame、pandas、そして recordlinkage は環境に読み込まれています。
この演習はコースの一部です
Pythonで学ぶデータクリーニング
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create an indexer and object and find possible pairs
indexer = ____
# Block pairing on cuisine_type
indexer.____(____)
# Generate pairs
pairs = indexer.____(____, ____)