開始使用免費開始

過濾損毀資料

在轉換階段,一個常見步驟是清理不完整的資料。這個練習要查看課程資料,格式如下:

course_id title description programming_language
1 Some Course r

你會檢視這個 DataFrame,並用 pandas DataFrame 的 .isnull().sum() 方法確認是否有遺漏值。你會發現 programming_language 欄位有一些遺漏值。

因此,請完成 transform_fill_programming_language() 函式,使用 .fillna() 方法填補遺漏值。

本練習屬於課程

Data Engineering 入門

檢視課程

練習說明

  • 列印 course_data 中遺漏值的數量。
  • programming_language 的遺漏值應填為語言「R」。
  • 再次列印每個欄位的遺漏值數量,這次針對 transformed

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

course_data = extract_course_data(db_engines)

# Print out the number of missing values per column
print(____.____().____())

# The transformation should fill in the missing values
def transform_fill_programming_language(course_data):
    imputed = course_data.____({"programming_language": "____"})
    return imputed

transformed = transform_fill_programming_language(course_data)

# Print out the number of missing values per column of transformed
print(____)
編輯並執行程式碼