Když na čase záleží – trochu
Naučil/a ses, jak přijatelná latence tvé služby Machine Learning ovlivňuje výběr serving mode, který budeš implementovat.
Někdy mohou uživatelé čekat dny, ba i týdny. Jindy je příliš i jedna sekunda.
Čím nižší je očekávaná latence, tím větší jsou inženýrské výzvy a tím vyšší jsou náklady na tvou službu. Proto se vyhni zbytečnému přeinženýrství a přizpůsob návrh své ML služby tomu, co uživatelé potřebují a za co jsou ochotni platit.
Řekněme například, že vytváříš ML službu pro analýzu a sumarizaci velkých dokumentů ve formátu .pdf. Pokud ti uživatelé sdělí, že chtějí dostávat výstupy tvé služby do 5 minut od odeslání požadavku, nejrozumnějším serving mode pro tvůj případ použití by byl:
Toto cvičení je součástí kurzu
MLOps: nasazení a životní cyklus modelů
Interaktivní praktické cvičení
Proměňte teorii v praxi s jedním z našich interaktivních cvičení
Začít cvičení