or
To ćwiczenie jest częścią kursu
W tym rozdziale poznasz podstawy inżynierii cech i dowiesz się, jak zacząć stosować ją w praktyce. Załadujesz, przeanalizujesz i zwizualizujesz zbiór danych z odpowiedziami ankietowymi, poznając przy tym ich typy danych i rozumiejąc, dlaczego mają one wpływ na sposób tworzenia cech. Korzystając z biblioteki pandas, stworzysz nowe cechy zarówno z kolumn kategorycznych, jak i ciągłych.
Ten rozdział wprowadza cię w realia pracy z niekompletnymi i nieuporządkowanymi danymi. Dowiesz się, jak wykrywać brakujące wartości i poznasz różne sposoby radzenia sobie z nimi. Nauczysz się też korzystać z technik manipulacji ciągami znaków, aby usuwać niechciane znaki ze zbioru danych.
W tym rozdziale skupisz się na analizie rozkładu swoich danych i ocenie, czy może on negatywnie wpłynąć na potok uczenia maszynowego. Nauczysz się, jak radzić sobie z asymetrycznymi rozkładami oraz sytuacjami, w których wartości odstające mogą zakłócać analizę.
W ostatnim rozdziale zajmiesz się nieustrukturyzowanymi danymi tekstowymi i poznasz sposoby na tworzenie z nich cech kolumnowych. Porównasz różne podejścia pod kątem ilości kontekstu wyodrębnianego z tekstu i nauczysz się balansować między zachowaniem kontekstu a unikaniem nadmiernej liczby tworzonych cech.
Bieżące ćwiczenie