最高の組み合わせ
R を使うと、データ分析のコードを素早く書くことができます。少し工夫するだけで、読みやすく保守しやすいコードも書けます。多くの場合、R はコードの実行速度も十分です。
ただし、R はすべてのデータを1台のマシンのメモリ(RAM)上で処理する必要があります。そのため、R だけで分析できるデータ量には限界があります。この問題を解決する方法はいくつかありますが、その一つが Spark の活用です。
Spark はオープンソースのクラスター・コンピューティング・プラットフォームです。データと処理を複数のマシンに分散させることができるため、事実上、無制限のデータを分析できます。R と Spark はとても相性が良く、両者を組み合わせることで、コードを速く書きながら、速く実行することが可能になります。
sparklyr は、Spark クラスター上のデータを R コードで操作できるようにする R パッケージです。dplyr インターフェースを備えているため、ローカルマシンで作業していても Spark クラスターで作業していても、ほぼ同じ dplyr スタイルの R コードを書くことができます。
もっと速くしたいなら、叫んでみましょう!
この演習はコースの一部です
