天作之合
R 让您能快速编写数据分析代码。只要稍加注意,您的代码也能更易读,从而更易维护。在很多情况下,R 的运行速度也足够快。
但遗憾的是,R 需要在单台机器的内存(RAM)中分析所有数据。这会限制您能用 R 分析的数据规模。解决方案有几个,其中之一就是使用 Spark。
Spark 是一个开源的集群计算平台。也就是说,您可以把数据和计算分布到多台机器上,从而实际处理几乎无限量的数据。这两项技术彼此强有力地互补。将 R 和 Spark 结合使用,您既能写得快,又能跑得快!
sparklyr 是一个 R 包,能让您用 R 代码处理 Spark 集群中的数据。它提供了 dplyr 接口,这意味着无论您是在本机处理数据还是在 Spark 集群上处理数据,基本都可以编写相同风格的 dplyr 代码。
如果想更快,就大声喊出来!
本练习是课程的一部分
