Quand le temps compte — un peu
Vous avez vu comment la latence acceptable de votre service de Machine Learning influence le choix du mode de service à mettre en place.
Parfois, les utilisateurs peuvent attendre des jours, voire des semaines. Parfois, une seconde, c'est déjà trop.
Plus la latence attendue est faible, plus les défis d'ingénierie et les coûts de votre service augmentent. Évitez donc la suringénierie et alignez la conception de votre service ML sur ce que les utilisateurs exigent et sont prêts à payer.
Par exemple, disons que vous créez un service ML pour analyser et résumer de gros documents .pdf. Si vos utilisateurs vous disent qu'ils souhaitent recevoir les résultats de votre service dans les 5 minutes suivant leur demande, le mode de service le plus raisonnable pour votre cas d'utilisation serait :
Cette activité fait partie du cours
Déploiement MLOps et cycle de vie
Exercice interactif pratique
Passez de la théorie à l’action grâce à l’un de nos exercices interactifs
Commencer l’exercice