or
Ця вправа є частиною курсу
У цьому розділі ви дослідите, що таке інженерія ознак і як почати застосовувати її до даних з реального світу. Ви завантажите, дослідите та візуалізуєте набір відповідей опитування і завдяки цьому дізнаєтеся про базові типи даних і чому вони впливають на те, як слід створювати ознаки. Використовуючи бібліотеку pandas, ви створите нові ознаки як з категоріальних, так і з неперервних стовпців.
Цей розділ знайомить вас із реаліями «брудних» і неповних даних. Ви навчитеся знаходити пропущені значення у своїх даних і розглянете кілька підходів до їх обробки. Також ви застосуєте методи опрацювання рядків, щоб прибрати небажані символи з набору даних.
У цьому розділі ви зосередитеся на аналізі базового розподілу ваших даних і тому, як він може вплинути на ваш конвеєр машинного навчання. Ви дізнаєтеся, як працювати зі зміщеними розподілами та ситуаціями, коли викиди можуть негативно впливати на аналіз.
Нарешті, у цьому розділі ви працюватимете з неструктурованими текстовими даними та зрозумієте способи перетворення корпусу текстів на табличні ознаки. Ви порівняєте, як різні підходи впливають на обсяг контексту, що витягується з тексту, і як збалансувати потребу в контексті без надмірного росту кількості ознак.
Поточна вправа