Budżety i cache
Limity szybkości i budżety per klucz, limity organizacji oraz dokładny cache odpowiedzi.
Budżety i limity
Każde obciążenie definiuje limity żądań i tokenów na minutę oraz budżet wspólny dla jego poświadczeń. Wybierz okres: total, daily lub monthly. Zbiorczy limit organizacji obejmuje wszystkie workloady.
Egzekwowanie odbywa się na bramie, w realnych pieniądzach: każde żądanie jest wyceniane z aktualnego cennika i obciążane przed wysyłką. Po przekroczeniu limitu zapytań wywołanie zwraca 429; po przekroczeniu budżetu, 402. Żądanie nigdy nie dociera do dostawcy. Jeśli liczniki są kiedykolwiek nieosiągalne, kontrola zawodzi w stanie zamkniętym (fail closed) i uzgadnia się z niezmiennym rejestrem audytu, zamiast zgadywać. Przesyłanie plików do Knowledge w Sluis Workspace jest rozliczane tak samo: embeddingi potrzebne dla dokumentu są wyceniane jak wywołanie /v1/embeddings i obciążają organizację, jej przedpłacony kredyt oraz budżet przesyłającego członka. Przesyłanie jest odrzucane z kodem 402, gdy budżet lub kredyt organizacji się wyczerpie.

# past the key's rate limit — the request never reaches a provider { "error": { "message": "rate limit exceeded", "type": "rate_limit_error", "param": null, "code": "rate_limit_exceeded" } }
# budget reached or no active plan — activate a plan or raise the budget { "error": { "message": "budget exceeded", "type": "insufficient_quota", "param": null, "code": "insufficient_quota" } }
Buforowanie
Opcjonalny dokładny cache odpowiedzi dopasowuje znormalizowane żądania. Jest ściśle izolowany per organizacja, szyfrowany w spoczynku i wymaga retencji treści. Włącz go w Konsoli, w widoku Cache.

Nowe wpisy audytu zapisują, jak obsłużono wywołanie: none | exact.
# identical request twice — the second is served from the exact cache curl https://api.sluis.ai/v1/chat/completions \ -H "Authorization: Bearer $SLUIS_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "mistral/mistral-large-latest", "messages": [{ "role": "user", "content": "Define GDPR" }] }' # audit row of call #2: cache_hit: exact · no provider dispatch, no token cost