過濾損毀資料
在轉換階段,一個常見步驟是清理不完整的資料。這個練習要查看課程資料,格式如下:
| course_id | title | description | programming_language |
|---|---|---|---|
| 1 | Some Course | … | r |
你會檢視這個 DataFrame,並用 pandas DataFrame 的 .isnull().sum() 方法確認是否有遺漏值。你會發現 programming_language 欄位有一些遺漏值。
因此,請完成 transform_fill_programming_language() 函式,使用 .fillna() 方法填補遺漏值。
本練習屬於課程
Data Engineering 入門
練習說明
- 列印
course_data中遺漏值的數量。 programming_language的遺漏值應填為語言「R」。- 再次列印每個欄位的遺漏值數量,這次針對
transformed。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
course_data = extract_course_data(db_engines)
# Print out the number of missing values per column
print(____.____().____())
# The transformation should fill in the missing values
def transform_fill_programming_language(course_data):
imputed = course_data.____({"programming_language": "____"})
return imputed
transformed = transform_fill_programming_language(course_data)
# Print out the number of missing values per column of transformed
print(____)