Ga naar de inhoud

Budgetten & caching

Rate limits en budgetten per sleutel, organisatieplafonds en de exacte response-cache.

Budgetten & limieten

Elke workload beheert rate limits (verzoeken en tokens per minuut) en een budget dat alle bijbehorende credentials delen. Kies een budgetperiode: total, daily of monthly. Een organisatiebreed totaalplafond geldt voor alle workloads samen.

Handhaving gebeurt op de gateway, in echt geld: elk verzoek wordt geprijsd uit het live prijsboek en afgeschreven vóór verzending. Boven de rate limit geeft de call 429 terug; boven het budget, 402. Het verzoek bereikt nooit een provider. Zijn de tellers ooit onbereikbaar, dan faalt de controle gesloten (fail closed) en verrekent ze met het onveranderlijke auditgrootboek in plaats van te gokken. Uploads naar Knowledge in Sluis Workspace worden op dezelfde manier gemeten: de embeddings die een document nodig heeft, worden geprijsd als een /v1/embeddings-call en afgeschreven van de organisatie, haar prepaid tegoed en het budget van het lid dat uploadt. Een upload wordt geweigerd met 402 als het budget of tegoed van de organisatie op is.

Gebruik: bekijk verbruik en uitgaven.
Gebruik: bekijk verbruik en uitgaven.Engelstalige interface · illustratieve demogegevens. Open de afbeelding op volledig formaat.
# past the key's rate limit — the request never reaches a provider
{
  "error": {
    "message": "rate limit exceeded",
    "type": "rate_limit_error",
    "param": null,
    "code": "rate_limit_exceeded"
  }
}

Caching

Een optionele exacte response-cache matcht genormaliseerde verzoeken. Hij is strikt geïsoleerd per organisatie, versleuteld in rust en vereist contentretentie. Schakel hem in de Cache-weergave van de Console in.

Cache: stel exacte antwoordcaching in.
Cache: stel exacte antwoordcaching in.Engelstalige interface · illustratieve demogegevens. Open de afbeelding op volledig formaat.

Nieuwe auditregels leggen vast hoe de call is bediend: none | exact.

# identical request twice — the second is served from the exact cache
curl https://api.sluis.ai/v1/chat/completions \
  -H "Authorization: Bearer $SLUIS_KEY" \
  -H "Content-Type: application/json" \
  -d '{ "model": "mistral/mistral-large-latest", "messages": [{ "role": "user", "content": "Define GDPR" }] }'

# audit row of call #2: cache_hit: exact · no provider dispatch, no token cost