Budgetten & caching
Rate limits en budgetten per sleutel, organisatieplafonds en de exacte response-cache.
Budgetten & limieten
Elke workload beheert rate limits (verzoeken en tokens per minuut) en een budget dat alle bijbehorende credentials delen. Kies een budgetperiode: total, daily of monthly. Een organisatiebreed totaalplafond geldt voor alle workloads samen.
Handhaving gebeurt op de gateway, in echt geld: elk verzoek wordt geprijsd uit het live prijsboek en afgeschreven vóór verzending. Boven de rate limit geeft de call 429 terug; boven het budget, 402. Het verzoek bereikt nooit een provider. Zijn de tellers ooit onbereikbaar, dan faalt de controle gesloten (fail closed) en verrekent ze met het onveranderlijke auditgrootboek in plaats van te gokken. Uploads naar Knowledge in Sluis Workspace worden op dezelfde manier gemeten: de embeddings die een document nodig heeft, worden geprijsd als een /v1/embeddings-call en afgeschreven van de organisatie, haar prepaid tegoed en het budget van het lid dat uploadt. Een upload wordt geweigerd met 402 als het budget of tegoed van de organisatie op is.

# past the key's rate limit — the request never reaches a provider { "error": { "message": "rate limit exceeded", "type": "rate_limit_error", "param": null, "code": "rate_limit_exceeded" } }
# budget reached or no active plan — activate a plan or raise the budget { "error": { "message": "budget exceeded", "type": "insufficient_quota", "param": null, "code": "insufficient_quota" } }
Caching
Een optionele exacte response-cache matcht genormaliseerde verzoeken. Hij is strikt geïsoleerd per organisatie, versleuteld in rust en vereist contentretentie. Schakel hem in de Cache-weergave van de Console in.

Nieuwe auditregels leggen vast hoe de call is bediend: none | exact.
# identical request twice — the second is served from the exact cache curl https://api.sluis.ai/v1/chat/completions \ -H "Authorization: Bearer $SLUIS_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "mistral/mistral-large-latest", "messages": [{ "role": "user", "content": "Define GDPR" }] }' # audit row of call #2: cache_hit: exact · no provider dispatch, no token cost