Vai al contenuto

Budget e caching

Limiti di velocità e budget per workload, tetti di organizzazione e cache di risposta esatta, con il comportamento di ogni limite quando viene raggiunto.

Budget e limiti

Ogni workload gestisce limiti di frequenza (richieste e token al minuto) e un budget condiviso tra le sue credenziali. Scegli un periodo: total, daily o monthly. Un tetto aggregato dell'organizzazione si applica a tutti i workload.

L'applicazione avviene al gateway, in denaro reale: ogni richiesta viene prezzata dal listino prezzi in tempo reale e addebitata prima dell'inoltro. Superato il rate limit la chiamata restituisce 429; superato il budget, 402. La richiesta non raggiunge mai un provider. Se i contatori diventano irraggiungibili, il controllo fallisce in chiuso e si riconcilia con il registro di audit immutabile invece di tirare a indovinare. I caricamenti in Knowledge di Sluis Workspace sono misurati allo stesso modo: gli embedding necessari a un documento sono prezzati come una chiamata /v1/embeddings e addebitati all’organizzazione, al suo credito prepagato e al budget del membro che carica. Un caricamento viene rifiutato con 402 quando il budget o il credito dell’organizzazione è esaurito.

Utilizzo: consulta consumi e spese.
Utilizzo: consulta consumi e spese.Interfaccia in inglese · dati dimostrativi illustrativi. Apri l’immagine a dimensione intera.
# past the key's rate limit — the request never reaches a provider
{
  "error": {
    "message": "rate limit exceeded",
    "type": "rate_limit_error",
    "param": null,
    "code": "rate_limit_exceeded"
  }
}

Caching

Una cache di risposta esatta opzionale confronta le richieste normalizzate. È rigorosamente isolata per organizzazione, cifrata a riposo e richiede la conservazione dei contenuti. Abilitala nella vista Cache della Console.

Cache: configura la cache delle risposte esatta.
Cache: configura la cache delle risposte esatta.Interfaccia in inglese · dati dimostrativi illustrativi. Apri l’immagine a dimensione intera.

Le nuove righe di audit registrano come è stata servita la chiamata: none | exact.

# identical request twice — the second is served from the exact cache
curl https://api.sluis.ai/v1/chat/completions \
  -H "Authorization: Bearer $SLUIS_KEY" \
  -H "Content-Type: application/json" \
  -d '{ "model": "mistral/mistral-large-latest", "messages": [{ "role": "user", "content": "Define GDPR" }] }'

# audit row of call #2: cache_hit: exact · no provider dispatch, no token cost