View a markdown version of this page

Surveillez l'inférence basée sur le temps d'exécution à l'aide de métriques CloudWatch - Amazon Bedrock

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Surveillez l'inférence basée sur le temps d'exécution à l'aide de métriques CloudWatch

Le point de bedrock-runtime.region.amazonaws.com terminaison Amazon Bedrock publie des métriques sur Amazon CloudWatch sous l'espace de AWS/Bedrock noms. Utilisez ces mesures pour surveiller le volume d'invocation, la latence, la consommation de jetons, les taux d'erreur et modélisez la livraison de la journalisation des invocations.

Si votre application appelle l'inférencebedrock-mantle.region.api.aws, consultez Surveillez l'inférence entre le substrat rocheux et le manteau à l'aide de métriques CloudWatch plutôt.

Métriques d’exécution Amazon Bedrock

Le tableau suivant décrit les métriques d’exécution fournies par Amazon Bedrock.

Nom de la métrique Unité Description
Invocations Nombre Nombre de requêtes réussies adressées aux opérations Converse ConverseStream, InvokeModel, et InvokeModelWithResponseStream API.

InvocationLatency

MilliSeconds

L'heure entre l'envoi d'une demande et la réception du dernier jeton.

Pour distinguer les augmentations de latence provoquées par des changements de débit côté service des augmentations provoquées par des réponses de modèle plus longues, consultez. Diagnostiquez les InvocationLatencyaugmentations à l'aide de jetons de sortie par seconde (OTPS)

InvocationClientErrors

Nombre

Nombre d’invocations qui entraînent des erreurs côté client.

InvocationServerErrors

Nombre

Nombre d'appels qui entraînent des erreurs AWS côté serveur.

InvocationThrottles

Nombre

Nombre d’invocations que le système a limitées. Les demandes limitées et les autres erreurs d’invocation ne comptent pas comme Invocations ou Erreurs. Le nombre de limitations que vous voyez dépendra de vos paramètres de nouvelle tentative dans le kit SDK. Pour plus d'informations, consultez la section Comportement des nouvelles tentatives dans le Guide de référence AWS des kits de développement logiciel et des outils.

InputTokenCount

Nombre

Nombre de jetons dans l’entrée.

LegacyModelInvocations Nombre Nombre d’invocations utilisant les modèles hérités.

OutputTokenCount

Nombre

Nombre de jetons dans la sortie.

OutputImageCount

Nombre

Nombre d’images dans la sortie (applicable uniquement pour les modèles de génération d’images).

TimeToFirstToken

MilliSeconds

Temps écoulé entre l'envoi d'une demande et la réception du premier jeton, pour les opérations de l'API ConverseStream et de InvokeModelWithResponseStream streaming.

EstimatedTPMQuotaUsage

Nombre

Estimation de la consommation de quotas de jetons par minute (TPM) pour les opérations Converse ConverseStream, InvokeModel, et InvokeModelWithResponseStream API. Cette métrique est une approximation et ne reflète pas la consommation de jetons basée sur les réservations qui entraîne des décisions de limitation. La limitation est basée sur la réservation initiale des jetons d'entrée plus max_tokens (voirMode de comptabilisation des jetons dans Amazon Bedrock), qui peut différer de cette estimation. N'utilisez pas cette métrique comme seul indicateur de l'utilisation des quotas ou de la planification des capacités.

CacheReadInputTokenCount

Nombre

Nombre de jetons d'entrée lus à partir du cache d'invite. Ces jetons sont facturés à un tarif réduit et ne sont pas pris en compte dans votre quota TPM.

CacheWriteInputTokenCount

Nombre

Nombre de jetons d'entrée écrits dans le cache d'invite. Ces jetons sont pris en compte dans votre quota TPM.

Il existe également des métriques pour les barrières de protection Amazon Bedrock et les agents Amazon Bedrock.

Métriques de journalisation CloudWatch des appels de modèles

Pour chaque tentative de livraison réussie ou échouée, les CloudWatch métriques Amazon suivantes sont émises sous l'espace de noms AWS/Bedrock et la Across all model IDs dimension :

  • ModelInvocationLogsCloudWatchDeliverySuccess

  • ModelInvocationLogsCloudWatchDeliveryFailure

  • ModelInvocationLogsS3DeliverySuccess

  • ModelInvocationLogsS3DeliveryFailure

  • ModelInvocationLargeDataS3DeliverySuccess

  • ModelInvocationLargeDataS3DeliveryFailure

Pour générer les métriques relatives à vos opérations Amazon Bedrock, il vous faut spécifier les informations suivantes :

  • La dimension de métrique. Une dimension est un ensemble de paires nom-valeur qui vous permet d’identifier une métrique. Amazon Bedrock prend en charge les dimensions suivantes :

    • ModelId : toutes les métriques

    • ModelId + ImageSize + BucketedStepSize – OutputImageCount

  • Le nom de la métrique, par exemple InvocationClientErrors.

Vous pouvez obtenir des statistiques pour Amazon Bedrock à l'aide de Console de gestion AWS l' AWS CLI API ou de l' CloudWatch API. Vous pouvez utiliser l' CloudWatch API via l'un des kits de développement AWS logiciel (SDK) ou les outils CloudWatch d'API.

Pour afficher les métriques Amazon Bedrock dans la CloudWatch console, accédez à la section des métriques dans le volet de navigation et sélectionnez l'option Toutes les métriques, puis recherchez l'ID du modèle.

Vous devez disposer des CloudWatch autorisations appropriées pour surveiller Amazon Bedrock. CloudWatch Pour plus d'informations, consultez Authentification et contrôle d'accès pour Amazon CloudWatch dans le guide de l' CloudWatch utilisateur Amazon.