Zum Inhalt springen

Budgets & Caching

Rate-Limits und Budgets pro Schlüssel, Organisations-Obergrenzen und der Exact-Match-Antwort-Cache.

Budgets & Limits

Jeder Workload besitzt Ratenlimits (Anfragen und Tokens pro Minute) und ein Budget, das alle zugehörigen Zugangsdaten gemeinsam nutzen. Wählen Sie einen Zeitraum: total, daily oder monthly. Eine organisationsweite Gesamtobergrenze gilt über alle Workloads hinweg.

Die Durchsetzung erfolgt am Gateway, in echtem Geld: jede Anfrage wird anhand des Live-Preisbuchs bepreist und vor dem Versand abgebucht. Über dem Rate-Limit gibt der Aufruf 429 zurück; über dem Budget 402. Die Anfrage erreicht nie einen Anbieter. Sind die Zähler einmal nicht erreichbar, schlägt die Prüfung nach dem Fail-closed-Prinzip fehl und gleicht sich mit dem unveränderlichen Audit-Register ab, statt zu raten. Uploads in das Wissen von Sluis Workspace werden genauso abgerechnet: Die Embeddings, die ein Dokument braucht, werden wie ein /v1/embeddings-Aufruf bepreist und der Organisation, ihrem Prepaid-Guthaben und dem Budget des hochladenden Mitglieds belastet. Ein Upload wird mit 402 abgelehnt, wenn Budget oder Guthaben der Organisation erschöpft sind.

Nutzung: Prüfen Sie Verbrauch und Ausgaben.
Nutzung: Prüfen Sie Verbrauch und Ausgaben.Englische Oberfläche · illustrative Demodaten. Öffnen Sie das Bild in voller Größe.
# past the key's rate limit — the request never reaches a provider
{
  "error": {
    "message": "rate limit exceeded",
    "type": "rate_limit_error",
    "param": null,
    "code": "rate_limit_exceeded"
  }
}

Caching

Ein optionaler exakter Response-Cache gleicht normalisierte Requests ab. Er ist streng pro Organisation isoliert, im Ruhezustand verschlüsselt und setzt Inhaltsaufbewahrung voraus. Aktivieren Sie ihn in der Cache-Ansicht der Console.

Cache: Konfigurieren Sie exaktes Antwort-Caching.
Cache: Konfigurieren Sie exaktes Antwort-Caching.Englische Oberfläche · illustrative Demodaten. Öffnen Sie das Bild in voller Größe.

Neue Audit-Zeilen halten fest, wie der Aufruf bedient wurde: none | exact.

# identical request twice — the second is served from the exact cache
curl https://api.sluis.ai/v1/chat/completions \
  -H "Authorization: Bearer $SLUIS_KEY" \
  -H "Content-Type: application/json" \
  -d '{ "model": "mistral/mistral-large-latest", "messages": [{ "role": "user", "content": "Define GDPR" }] }'

# audit row of call #2: cache_hit: exact · no provider dispatch, no token cost