View a markdown version of this page

Metriche relative ai limiti di velocità - Fondamento Amazon AgentCore

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Metriche relative ai limiti di velocità

Le voci relative ai limiti di velocità specificano una o più metriche che definiscono cosa viene misurato e la finestra temporale per l'applicazione. Ogni tipo di metrica presenta vincoli specifici sui periodi supportati e sui tipi di obiettivi.

Limiti di frequenza delle richieste

I limiti di frequenza delle richieste controllano il numero di richieste API consentite in una finestra temporale.

  • Periodi supportati: second, minute

  • Tipi di bersaglio supportati: tutti i tipi di bersaglio

  • Impostazione della frequenza su 0: blocca tutte le richieste corrispondenti una volta completata la propagazione (fino a 30 secondi)

I limiti di frequenza delle richieste vengono valutati in modo sincrono prima che la richiesta venga inoltrata alla destinazione.

Limiti di velocità dei token

I limiti di velocità dei token controllano il numero di token (input + output) consumati in una finestra temporale. I limiti di velocità dei token si applicano solo agli obiettivi di inferenza.

  • Periodi supportati: minute

  • Tipi di obiettivi supportati: solo obiettivi di inferenza (obiettivi di connettore e obiettivi di provider con percorsi di inferenza noti)

  • Percorsi di inferenza noti:,, /v1/chat/completions /v1/messages /v1/responses

I limiti di tariffa dei token utilizzano un'applicazione basata sul budget:

  1. Il gateway stima l'utilizzo del token di input prima di inoltrare la richiesta.

  2. Il conteggio effettivo dei token (input + output) viene registrato al termine della risposta.

  3. A causa della latenza di risposta, il budget potrebbe superare temporaneamente la tariffa configurata prima che l'applicazione venga ripristinata.

Nota

Per le richieste di completamento delle chat in streaming (/v1/chat/completions), il gateway si aggiunge automaticamente "stream_options": {"include_usage": true} al corpo della richiesta. Ciò accade quando è attivo un limite di velocità dei token e l'opzione non è già presente. Assicura che nella risposta in streaming per l'applicazione del TPM siano disponibili conteggi accurati dei token.

Limiti di velocità di connessione

I limiti di velocità di connessione controllano il numero di richieste simultanee in volo consentite in un dato momento. Ogni richiesta occupa uno slot di connessione dall'accettazione fino al completamento della risposta. Se arriva una nuova richiesta e il numero di connessioni attive ha raggiunto il limite configurato, la richiesta viene rifiutata con una risposta HTTP 429.

  • Periodi supportati: second

  • Tipi di target supportati: tutti i tipi di target (MCP, HTTP, Inference)

  • Misurazione: numero massimo di richieste simultanee in volo

Vincoli metrici

Metrica Periodi supportati Obiettivi supportati

requests

second, minute

Tutti

tokens

minute

Solo obiettivi di inferenza (connettore, provider con percorsi noti)

connections

second

Tutti

Metriche combinate

Una singola immissione del limite di velocità può specificare più metriche. Quando una voce contiene più metriche, tutte le metriche vengono valutate in modo indipendente: la richiesta viene limitata se una singola metrica supera il limite.

L'esempio seguente mostra un limite di velocità che applica sia le richieste al minuto che i token al minuto:

{ "rateLimitId": "inference-rps-and-tpm", "dimensionKeys": ["targetName", "$.context.jwt.sub"], "entries": [ { "dimensions": { "targetName": "my-inference-target", "$.context.jwt.sub": "*" }, "requests": [{"rate": 300, "period": "minute"}], "tokens": [{"rate": 50000, "period": "minute"}] } ] }

In questo esempio, ogni chiamante viene limitato se supera 300 richieste al minuto o 50.000 token al minuto fino a, a seconda del limite raggiunto per my-inference-target primo.