両方のデータフレームでの抜け(ギャップ)を見つける
データ品質を確認するため、両方のデータフレームのすべての行を確認したいとします。つまり、ベンチマークがない listings と、listings がない benchmarks を両方見たいということです。これにより、分析前に抜けを特定できます。
polars は pl として読み込まれており、データフレーム hotels と type_benchmarks を利用できます。
この演習はコースの一部です
Data Transformation with Polars
演習の手順
typeとbeachをキーにして、hotelsとtype_benchmarksを結合し、両方のデータフレームのすべての行を保持しましょう。- 重複した結合列を避けるために、
coalesce=Trueを使いましょう。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Keep all rows from both DataFrames
full_view = hotels.____(
type_benchmarks,
on=["type", "beach"],
how="____",
# Avoid duplicate columns
coalesce=____
)
print(full_view.head())