Carichi di lavoro
Un carico di lavoro riunisce le impostazioni di un team, utente, agente o applicazione. Le chiavi API sono le credenziali associate.

Imposta modelli, richieste e token al minuto e un budget giornaliero, mensile o totale. block interrompe le chiamate oltre il limite (402); notify le lascia proseguire.
In Limiti e budget, il tempo di risposta stabilisce quanto una chiamata al modello attende la risposta del provider: da 10 a 600 secondi, 300 per impostazione predefinita. Una chiamata senza risposta in tempo termina con 504 e non viene ripetuta, perché il provider potrebbe ancora elaborarla. Chi chiama può accorciare il tempo per richiesta con l’header x-sluis-upstream-timeout, mai allungarlo. Una risposta in streaming già iniziata non viene interrotta da questo limite; solo 600 secondi di silenzio a metà flusso la chiudono.

Un option_overrides vuoto eredita le impostazioni dell’organizzazione. La pausa rifiuta richieste (403) senza revocare chiavi. La rotazione delle chiavi conserva la politica del carico di lavoro.

Il controllo del perimetro verifica ogni chiamata al modello fatta con le chiavi del carico di lavoro (embedding esclusi) rispetto a un perimetro che scrivi in linguaggio semplice: ciò che l’IA di questo carico di lavoro può e non può fare, fino a 4.000 caratteri. Un piccolo modello ospitato nell’UE (Mistral Small) valuta ogni chiamata dopo la protezione dei dati, sul testo che il provider riceverebbe. off salta il controllo. log valuta in background senza ritardare la chiamata e registra nel registro di audit le chiamate fuori perimetro. block attende il verdetto e rifiuta una chiamata fuori perimetro con 403 scope_violation prima che raggiunga il provider; se il controllo non può completarsi, la chiamata viene rifiutata con 503. Ogni controllo è una ricevuta di audit separata, fatturata al prezzo per token del modello, e la tua policy di residenza deve consentire quel modello.
