加载航班数据
在本练习中,您将从一个 CSV 文件中加载部分航空航班数据。为确保运行速度,这些数据已裁剪至仅 50,000 条记录。您可以在相同格式下于此处获取更大的数据集。
CSV 格式说明:
- 字段以逗号分隔(这是默认分隔符),并且
- 缺失数据用字符串 'NA' 表示。
数据字典:
mon—— 月份(整数,1 到 12)dom—— 月中的日期(整数,1 到 31)dow—— 星期几(整数;1 = 周一,7 = 周日)carrier—— 航空公司(IATA 代码)flight—— 航班号org—— 始发机场(IATA 代码)mile—— 距离(英里)depart—— 起飞时间(十进制小时)duration—— 预计耗时(分钟)delay—— 延误时长(分钟)
pyspark 已为您导入,且会话已初始化。
注意:数据经过了大幅下采样。
本练习是课程的一部分
使用 PySpark 进行机器学习
练习说明
- 从名为
flights.csv的 CSV 文件读取数据。自动推断列的数据类型,并处理缺失数据。 - 数据中共有多少条记录?
- 查看前 5 条记录。
- 各列被分配了哪些数据类型?看起来是否合理?
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Read data from CSV file
flights = spark.____.____(____,
sep=____,
header=____,
inferSchema=____,
nullValue=____)
# Get number of records
print("The data contain %d records." % flights.____())
# View the first five records
flights.____(5)
# Check column data types
print(flights.____)