Obciążenia
Obciążenie grupuje ustawienia zespołu, użytkownika, agenta lub aplikacji. Klucze API są przypisanymi do niego danymi uwierzytelniającymi.

Ustaw modele, żądania i tokeny na minutę oraz budżet dzienny, miesięczny lub całkowity. block zatrzymuje wywołania po przekroczeniu limitu (402); notify pozwala je kontynuować.
W zakładce Limity i budżet czas na odpowiedź określa, jak długo wywołanie modelu czeka na odpowiedź dostawcy: od 10 do 600 sekund, domyślnie 300. Wywołanie bez odpowiedzi na czas kończy się kodem 504 i nie jest powtarzane, bo dostawca może nadal je przetwarzać. Wywołujący może skrócić ten czas dla pojedynczego żądania nagłówkiem x-sluis-upstream-timeout, ale nigdy go nie wydłuży. Rozpoczęta odpowiedź strumieniowa nie jest przez niego przerywana; kończy ją dopiero 600 sekund ciszy w trakcie strumienia.

Pusty option_overrides dziedziczy ustawienia organizacji. Wstrzymanie odrzuca żądania (403) bez unieważniania kluczy. Rotacja kluczy zachowuje politykę obciążenia.

Strażnik zakresu sprawdza każde wywołanie modelu wykonane kluczami obciążenia (poza embeddingami) względem zakresu, który opisujesz zwykłym językiem: co AI tego obciążenia może, a czego nie może robić, do 4000 znaków. Mały model hostowany w UE (Mistral Small) ocenia każde wywołanie po ochronie danych, na tekście, który otrzymałby dostawca. off pomija sprawdzanie. log ocenia w tle bez opóźniania wywołania i zapisuje wywołania spoza zakresu w dzienniku audytu. block czeka na werdykt i odrzuca wywołanie spoza zakresu kodem 403 scope_violation, zanim dotrze do dostawcy; jeśli sprawdzenie nie może się zakończyć, wywołanie jest odrzucane kodem 503. Każde sprawdzenie to osobne potwierdzenie audytu, rozliczane według ceny tokenów modelu, a Twoja polityka rezydencji musi dopuszczać ten model.
