Sestavení vektoru
Posledním krokem v Pipeline je sloučení všech sloupců s příznaky do jediného sloupce. Tento krok je nutný před samotným modelováním, protože každá modelovací rutina v Sparku očekává data právě v tomto formátu. Hodnoty z jednotlivých sloupců se uloží jako prvky vektoru – z pohledu modelu je pak každé pozorování vektorem, který obsahuje veškeré informace o daném záznamu, spolu s příznakem říkajícím, jakou hodnotu toto pozorování reprezentuje.
Proto submodul pyspark.ml.feature obsahuje třídu VectorAssembler. Tento Transformer vezme všechny zadané sloupce a sloučí je do nového sloupcového vektoru.
Toto cvičení je součástí kurzu
Foundations of PySpark
Pokyny k cvičení
- Vytvoř
VectorAssemblerzavolánímVectorAssembler()se seznamem názvů vstupních sloupců v parametruinputColsa názvem výstupního sloupce"features".- Seznam sloupců by měl být
["month", "air_time", "carrier_fact", "dest_fact", "plane_age"].
- Seznam sloupců by měl být
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Make a VectorAssembler
vec_assembler = VectorAssembler(inputCols=____, outputCol=____)