开始使用免费开始使用

加载航班数据

在本练习中,您将从一个 CSV 文件中加载部分航空航班数据。为确保运行速度,这些数据已裁剪至仅 50,000 条记录。您可以在相同格式下于此处获取更大的数据集。

CSV 格式说明:

  • 字段以逗号分隔(这是默认分隔符),并且
  • 缺失数据用字符串 'NA' 表示。

数据字典:

  • mon —— 月份(整数,1 到 12)
  • dom —— 月中的日期(整数,1 到 31)
  • dow —— 星期几(整数;1 = 周一,7 = 周日)
  • carrier —— 航空公司(IATA 代码
  • flight —— 航班号
  • org —— 始发机场(IATA 代码
  • mile —— 距离(英里)
  • depart —— 起飞时间(十进制小时)
  • duration —— 预计耗时(分钟)
  • delay —— 延误时长(分钟)

pyspark 已为您导入,且会话已初始化。

注意:数据经过了大幅下采样。

本练习是课程的一部分

使用 PySpark 进行机器学习

查看课程

练习说明

  • 从名为 flights.csv 的 CSV 文件读取数据。自动推断列的数据类型,并处理缺失数据。
  • 数据中共有多少条记录?
  • 查看前 5 条记录。
  • 各列被分配了哪些数据类型?看起来是否合理?

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Read data from CSV file
flights = spark.____.____(____,
                         sep=____,
                         header=____,
                         inferSchema=____,
                         nullValue=____)

# Get number of records
print("The data contain %d records." % flights.____())

# View the first five records
flights.____(5)

# Check column data types
print(flights.____)
编辑并运行代码