Итератор для загрузки данных по частям (2)
В предыдущем упражнении вы использовали read_csv() для чтения фрагментов DataFrame из большого набора данных. В этом упражнении вы загрузите файл с большим размером фрагмента и обработаете данные из первого фрагмента.
Для обработки данных вы создадите новый DataFrame, состоящий только из строк, относящихся к конкретной стране. Затем вы объедините с помощью zip два столбца нового DataFrame — 'Total Population' и 'Urban population (% of total)'. Наконец, вы создадите список кортежей из полученного zip-объекта, где каждый кортеж будет содержать по одному значению из каждого из двух упомянутых столбцов.
Вы будете работать с данными из файла 'ind_pop_data.csv', который находится в вашем текущем рабочем каталоге. Библиотека pandas уже импортирована как pd.
Это упражнение является частью курса
Инструментарий Python
Инструкции к упражнению
- Используйте
pd.read_csv(), чтобы прочитать файл'ind_pop_data.csv'фрагментами по1000строк. Сохраните результат в переменнуюurb_pop_reader. - Получите первый фрагмент DataFrame из итерируемого объекта
urb_pop_readerи присвойте его переменнойdf_urb_pop. - Выберите только те строки
df_urb_pop, в которых значение'CountryCode'равно'CEB'. Для этого сравнитеdf_urb_pop['CountryCode']на равенство с'CEB'внутри квадратных скобок вdf_urb_pop[____]. - С помощью
zip()объедините столбцы'Total Population'и'Urban population (% of total)'изdf_pop_ceb. Сохраните полученный zip-объект в переменнуюpops.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Initialize reader object: urb_pop_reader
urb_pop_reader = pd.read_csv(____, ____)
# Get the first DataFrame chunk: df_urb_pop
df_urb_pop = next(____)
# Check out the head of the DataFrame
print(df_urb_pop.head())
# Check out specific country: df_pop_ceb
df_pop_ceb = df_urb_pop[____]
# Zip DataFrame columns of interest: pops
pops = zip(____, ____)
# Turn zip object into list: pops_list
pops_list = list(pops)
# Print pops_list
print(pops_list)