始める無料で始める

Wget と curl でデータをダウンロードする

データ分析プロジェクトを始めるときは、まずデータを1か所に集約するのが良い習慣です。多くの場合、これは HTTP サーバーやデータベースなど、さまざまな場所からデータをダウンロードして取得することを意味します。

curl は単一ファイルのダウンロードには便利ですが、複数ファイルの扱いにはやや不向きです。本チャプターの総仕上げとして、この演習では curlWget の両方を使って、月次の Spotify ファイルを一連でダウンロードし、簡単な処理を行い、すべてのダウンロード済みファイルをローカルディレクトリにまとめます。

この演習はコースの一部です

シェルでのデータ処理

コースを見る

演習の手順

  • 短縮(リダイレクト)URLに保存された 201812SpotifyData のZIPを curl でダウンロードし、同時にファイル名を Spotify201812.zip に変更します。
  • Spotify201812.zip を解凍し、元のZIPを削除したうえで、解凍後のファイル名を Spotify201812.csv にリネームして一貫性を保ちます。
  • url_list.txtWget を使い、Spotify201809.csvSpotify201810.csvSpotify201811.csv の3ファイルを一度にダウンロードします。ダウンロード速度の上限は 2500KB/s に設定してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip

# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv

# View url_list.txt to verify content
cat url_list.txt

# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt

# Take a look at all files downloaded
ls
コードを編集して実行