Aller au contenu

Budgets & cache

Limites de débit et budgets par workload, plafonds d’organisation et cache de réponse exact, avec le comportement de chaque limite une fois atteinte.

Budgets et limites

Chaque charge de travail définit les limites de débit (requêtes et tokens par minute) et un budget partagé entre ses identifiants. Choisissez une période : total, daily ou monthly. Un plafond agrégé à l'échelle de l'organisation s'applique à tous les workloads.

L'application se fait à la passerelle, en argent réel : chaque requête est tarifée d'après le carnet de prix en direct et débitée avant l'envoi. Au-delà de la limite de débit, l'appel renvoie 429 ; au-delà du budget, 402. La requête n'atteint jamais un fournisseur. Si les compteurs deviennent inaccessibles, la vérification échoue en mode fermé et se réconcilie à partir du registre d'audit immuable plutôt que de deviner. Les imports dans Knowledge de Sluis Workspace sont mesurés de la même façon : les embeddings nécessaires à un document sont tarifés comme un appel /v1/embeddings et imputés à l’organisation, à son crédit prépayé et au budget du membre qui importe. Un import est refusé avec 402 lorsque le budget ou le crédit de l’organisation est épuisé.

Utilisation : consultez la consommation et les dépenses.
Utilisation : consultez la consommation et les dépenses.Interface en anglais · données de démonstration illustratives. Ouvrez l’image pour la voir en taille réelle.
# past the key's rate limit — the request never reaches a provider
{
  "error": {
    "message": "rate limit exceeded",
    "type": "rate_limit_error",
    "param": null,
    "code": "rate_limit_exceeded"
  }
}

Mise en cache

Un cache de réponse exact optionnel apparie les requêtes normalisées. Il est strictement isolé par organisation, chiffré au repos et exige la rétention du contenu. Activez-le dans la vue Cache de la Console.

Cache : configurez le cache de réponses exact.
Cache : configurez le cache de réponses exact.Interface en anglais · données de démonstration illustratives. Ouvrez l’image pour la voir en taille réelle.

Les nouvelles lignes d'audit consignent comment l'appel a été servi : none | exact.

# identical request twice — the second is served from the exact cache
curl https://api.sluis.ai/v1/chat/completions \
  -H "Authorization: Bearer $SLUIS_KEY" \
  -H "Content-Type: application/json" \
  -d '{ "model": "mistral/mistral-large-latest", "messages": [{ "role": "user", "content": "Define GDPR" }] }'

# audit row of call #2: cache_hit: exact · no provider dispatch, no token cost