小心"巨龙"
在您过于兴奋之前,先提醒一句:目前在 R 中使用 Spark,确实有一些事情还做不了。Spark 的 Scala 和 Python 接口要更成熟一些。
这也意味着,学习本课程时,您会驶入一片相对"未知"的水域。旅程可能略有颠簸,偶尔会走出舒适区,请做好准备。
另一个需要注意的点是:本课程中,您会在 DataCamp 云端的个人 Spark 迷你集群上运行代码。这非常适合学习如何使用 Spark 的概念,但性能提升无法与高性能服务器上的远程集群相比。也就是说,这里的示例不一定会比只用 R 跑得更快。不过,您在这里学到的技能,可以帮助您在自己的大型数据集上开展分析。
如果您想在本地系统安装 Spark,只需安装 sparklyr 包并调用 spark_install() 即可。
您确定要继续吗?
本练习是课程的一部分
