Last updated:
Les contrôles et limites imposés à l'utilisation des ressources d'IA (par exemple, appels API, temps de calcul) afin de appliquer les politiques de gouvernance et prévenir les coûts excessifs ou les abus.
Met en œuvre l’étranglement (throttling), la limitation de débit (rate limiting) ainsi que des plafonds quotidiens ou mensuels de consommation des ressources par utilisateur, équipe ou application. Les quotas protègent contre les attaques par déni de service, les dépenses incontrôlées et les attaques d’extraction de modèle. La gouvernance définit des politiques de quotas alignées sur les SLA et les budgets, surveille les tableaux de bord d’utilisation et notifie automatiquement les utilisateurs — ou bloque leur accès — lorsque les seuils sont atteints, garantissant ainsi un usage équitable et une prévisibilité des coûts.
Real world example:
Une organisation de recherche fixe un quota mensuel de 100 heures-GPU par projet. Lorsqu’un projet dépasse 80 heures, une notification automatisée est envoyée par e-mail au responsable d’équipe ; à 100 heures, les tâches d’entraînement supplémentaires sont mises en file d’attente jusqu’à l’approbation des augmentations de quota, ce qui évite des frais cloud imprévus et les conflits de ressources.




