Cargas de trabajo
Una carga de trabajo reúne la configuración de un equipo, usuario, agente o aplicación. Sus claves API son credenciales asociadas.

Configure modelos, solicitudes y tokens por minuto y un presupuesto diario, mensual o total. block detiene las llamadas al superar el límite (402); notify permite continuarlas.
En Límites y presupuesto, el plazo de respuesta fija cuánto espera una llamada al modelo la respuesta del proveedor: de 10 a 600 segundos, 300 por defecto. Una llamada sin respuesta a tiempo termina con 504 y no se repite, porque el proveedor puede seguir procesándola. Quien llama puede acortar el plazo por solicitud con la cabecera x-sluis-upstream-timeout, nunca alargarlo. Una respuesta en streaming que ya ha empezado no se corta por este plazo; solo 600 segundos de silencio a mitad del flujo la terminan.

Un option_overrides vacío hereda la configuración de la organización. Pausar rechaza solicitudes (403) sin revocar claves. Rotar claves conserva la política de la carga de trabajo.

El control de alcance comprueba cada llamada al modelo hecha con las claves de la carga de trabajo (salvo embeddings) frente a un alcance que usted redacta en lenguaje llano: lo que la IA de esta carga de trabajo puede y no puede hacer, hasta 4.000 caracteres. Un modelo pequeño alojado en la UE (Mistral Small) juzga cada llamada tras la protección de datos, sobre el texto que recibiría el proveedor. off omite la comprobación. log juzga en segundo plano sin retrasar la llamada y anota en el registro de auditoría las llamadas fuera de alcance. block espera el veredicto y rechaza una llamada fuera de alcance con 403 scope_violation antes de que llegue al proveedor; si la comprobación no puede completarse, la llamada se rechaza con 503. Cada comprobación es un comprobante de auditoría aparte, facturado al precio por token del modelo, y su política de residencia debe permitir ese modelo.
