始める無料で始める

両方のデータフレームでの抜け(ギャップ)を見つける

データ品質を確認するため、両方のデータフレームのすべての行を確認したいとします。つまり、ベンチマークがない listings と、listings がない benchmarks を両方見たいということです。これにより、分析前に抜けを特定できます。

polarspl として読み込まれており、データフレーム hotelstype_benchmarks を利用できます。

この演習はコースの一部です

Data Transformation with Polars

コースを見る

演習の手順

  • typebeach をキーにして、hotelstype_benchmarks を結合し、両方のデータフレームのすべての行を保持しましょう。
  • 重複した結合列を避けるために、coalesce=True を使いましょう。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Keep all rows from both DataFrames
full_view = hotels.____(
    type_benchmarks,
    on=["type", "beach"],
    how="____",
    # Avoid duplicate columns
    coalesce=____
)

print(full_view.head())
コードを編集して実行