开始使用免费开始使用

使用 Wget 和 curl 下载数据

启动数据分析项目时,首先把所有数据集中到一个位置是很好的做法。通常这意味着需要从不同来源(如 HTTP 服务器和数据库)下载并拉取数据。

curl 适合下载单个文件,但在处理多文件下载时就不太顺手。在这个综合练习中,您将同时使用 curlWget 下载一系列每月的 Spotify 文件,进行一些简单处理,并将所有下载的文件统一整合到本地目录中。

本练习是课程的一部分

Shell 中的数据处理

查看课程

练习说明

  • 使用 curl 从被缩短(重定向)的 URL 下载压缩包 201812SpotifyData,并在同一步将文件重命名为 Spotify201812.zip
  • 解压 Spotify201812.zip,删除原始压缩包,并将解压后的文件重命名为 Spotify201812.csv 以保持一致性。
  • 使用 url_list.txtWget 一步下载全部 3 个文件:Spotify201809.csvSpotify201810.csvSpotify201811.csv,并将下载速度上限设置为 2500KB/s。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Use curl, download and rename a single file from URL
___ ___ Spotify201812.zip ___ https://assets.datacamp.com/production/repositories/4180/datasets/eb1d6a36fa3039e4e00064797e1a1600d267b135/201812SpotifyData.zip

# Unzip, delete, then re-name to Spotify201812.csv
unzip Spotify201812.zip && rm Spotify201812.zip
mv 201812SpotifyData.csv ___.csv

# View url_list.txt to verify content
cat url_list.txt

# Use Wget, limit the download rate to 2500 KB/s, download all files in url_list.txt
wget ___=2500k -i url_list.txt

# Take a look at all files downloaded
ls
编辑并运行代码