筛除损坏数据
在转换阶段,您经常需要的一步是清理不完整的数据。本练习将查看课程数据,格式如下:
| course_id | title | description | programming_language |
|---|---|---|---|
| 1 | Some Course | … | r |
您将检查这个 DataFrame,并使用 pandas DataFrame 的 .isnull().sum() 方法确保没有缺失值。您会发现 programming_language 列存在一些缺失值。
因此,请完成 transform_fill_programming_language() 函数,使用 .fillna() 方法填充缺失值。
本练习是课程的一部分
Data Engineering 入门
练习说明
- 打印
course_data中的缺失值数量。 programming_language的缺失值应填为语言 "R"。- 再次按列打印缺失值数量,这次针对
transformed。
交互式实操练习
通过完成这段示例代码来试试这个练习。
course_data = extract_course_data(db_engines)
# Print out the number of missing values per column
print(____.____().____())
# The transformation should fill in the missing values
def transform_fill_programming_language(course_data):
imputed = course_data.____({"programming_language": "____"})
return imputed
transformed = transform_fill_programming_language(course_data)
# Print out the number of missing values per column of transformed
print(____)