开始使用免费开始使用

文件大小优化

设想在一个包含 10 个节点的集群上,您拿到 2 个大型数据文件。每个文件包含约 10M 行,行大小大致相同。在处理数据时,交互响应还可以,但从文件的初始读取耗时较长。请注意,只有您会使用这些数据,并且数据在每次运行时都会变化。

以下哪种做法最有利于提升性能?

本练习是课程的一部分

使用 PySpark 进行数据清洗

查看课程

动手互动练习

通过我们的互动练习之一,将理论转化为实践

开始练习