Налаштування імпорту в pandas
Пакет pandas чудово справляється з багатьма проблемами, з якими ви стикаєтеся під час імпорту даних як дата-сайентитст, зокрема з коментарями у плоских файлах, порожніми рядками та пропущеними значеннями (NA або NaN). На завершення цього розділу ви імпортуєте пошкоджену копію набору даних Titanic — titanic_corrupt.txt, у якій є коментарі після символу '#', і файл є tab-delimited (розділення табуляцією).
Ключові аргументи для pd.read_csv():
sepзадає очікуваний роздільник.- Можна використовувати
','для розділення комами. - Можна використовувати
'\t'для розділення табуляцією.
- Можна використовувати
commentприймає символ(и), після яких у файлі починаються коментарі. Будь-який текст, що починається з цих символів, ігнорується.na_valuesприймає список рядків, які слід вважатиNA/NaN. Типово деякі значення вже розпізнаються якNA/NaN. Цей аргумент додає додаткові значення.
Ця вправа є частиною курсу
Вступ до імпорту даних у Python
Інструкції до вправи
- Заповніть аргументи
pd.read_csv(), щоб коректно імпортуватиtitanic_corrupt.txtза допомогою pandas:sepзадає роздільник і працює так само, як аргументdelimiterуnp.loadtxt(). Зверніть увагу: файл розділено табуляцією.commentприймає символ(и), після яких у файлі починаються коментарі; у цьому випадку це'#'.na_valuesприймає список рядків, які слід трактувати якNA/NaN; у цьому випадку це рядок'Nothing'.
- Запустіть решту коду, щоб вивести перші рядки отриманого датафрейму та побудувати гістограму
'Age'пасажирів на борту «Титаніка».
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import matplotlib.pyplot as plt
import matplotlib.pyplot as plt
# Assign filename: file
file = 'titanic_corrupt.txt'
# Import file: data
data = pd.read_csv(file, sep='____', comment='____', na_values=[____])
# Print the head of the DataFrame
print(data.head())
# Plot 'Age' variable in a histogram
pd.DataFrame.hist(data[['Age']])
plt.xlabel('Age (years)')
plt.ylabel('count')
plt.show()