Saltar al contenido

Presupuestos y caché

Límites de velocidad y presupuestos por clave, topes de organización y caché de respuesta exacta.

Presupuestos y límites

Cada carga de trabajo define límites de tasa (solicitudes y tokens por minuto) y un presupuesto compartido entre sus credenciales. Elija un periodo: total, daily o monthly. Un límite agregado de la organización se aplica a todos los workloads.

La aplicación ocurre en la pasarela, en dinero real: cada petición se tarifica con el libro de precios en vivo y se descuenta antes de despachar. Superado el límite de tasa, la llamada devuelve 429; superado el presupuesto, 402. La petición nunca llega a un proveedor. Si los contadores llegan a ser inaccesibles, la comprobación falla en cerrado y se reconcilia con el registro de auditoría inmutable en lugar de adivinar. Las subidas a Knowledge de Sluis Workspace se miden igual: los embeddings que necesita un documento se tarifican como una llamada a /v1/embeddings y se cargan a la organización, a su crédito prepago y al presupuesto del miembro que sube el archivo. Una subida se rechaza con 402 cuando el presupuesto o el crédito de la organización se ha agotado.

Uso: revise el consumo y los gastos.
Uso: revise el consumo y los gastos.Interfaz en inglés · datos de demostración ilustrativos. Abra la imagen para verla a tamaño completo.
# past the key's rate limit — the request never reaches a provider
{
  "error": {
    "message": "rate limit exceeded",
    "type": "rate_limit_error",
    "param": null,
    "code": "rate_limit_exceeded"
  }
}

Caché

Una caché de respuesta exacta opcional compara peticiones normalizadas. Está estrictamente aislada por organización, cifrada en reposo y requiere retención de contenido. Actívela en la vista Cache de la Consola.

Caché: configure la caché de respuestas exacta.
Caché: configure la caché de respuestas exacta.Interfaz en inglés · datos de demostración ilustrativos. Abra la imagen para verla a tamaño completo.

Las nuevas filas de auditoría registran cómo se sirvió la llamada: none | exact.

# identical request twice — the second is served from the exact cache
curl https://api.sluis.ai/v1/chat/completions \
  -H "Authorization: Bearer $SLUIS_KEY" \
  -H "Content-Type: application/json" \
  -d '{ "model": "mistral/mistral-large-latest", "messages": [{ "role": "user", "content": "Define GDPR" }] }'

# audit row of call #2: cache_hit: exact · no provider dispatch, no token cost