Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Couche 2 : ensemble approuvé de modèles et d'outils de base
Au fur et à mesure que les entreprises abordent les premières étapes de l'adoption de l'IA générative, elles se rendent vite compte qu'aucun modèle ne peut traiter efficacement tous les cas d'utilisation. Les différents modèles excellent dans différents domaines et tâches, et les entreprises doivent trouver un équilibre entre les capacités, les coûts et les performances pour chaque application spécifique. Cette réalité rend nécessaire une approche souple, mais contrôlée, de l'accès aux modèles de fondation.
Cette section contient les rubriques suivantes :
Expérimentation et personnalisation de modèles
Amazon Bedrock est conçu pour vous aider à expérimenter différents modèles de base et prend en charge les déploiements de production évolutifs. Avec les bases de connaissances Amazon Bedrock, vous disposez d'une solution entièrement gérée pour créer des flux de travail RAG ( end-to-endRetrieval Augmented Generation). Amazon Bedrock prend également en charge les agents gérés qui peuvent exécuter des tâches complexes sans code, qu'il s'agisse de réserver des voyages ou de gérer les stocks. Parce qu'il est sans serveur, Amazon Bedrock réduit les problèmes de gestion de l'infrastructure et s'intègre en toute sécurité aux autres. Services AWS
En outre, vous pouvez utiliser Amazon Bedrock pour personnaliser en privé les modèles de base avec vos propres données propriétaires et les mettre à la disposition des utilisateurs de votre organisation en toute sécurité. Pour plus d'informations, consultez la section Personnaliser votre modèle afin d'améliorer ses performances pour votre cas d'utilisation dans la documentation Amazon Bedrock. Pour la gestion des accès, Gestion des identités et des accès AWS (IAM) s'intègre à Amazon Bedrock afin que vous puissiez configurer un contrôle d'accès précis. Les commandes déterminent quels utilisateurs peuvent activer et accéder à des modèles spécifiques. Pour plus d’informations, consultez Couche 3 : sécurité et gouvernance pour les plateformes d'IA générative sur AWS dans ce guide.
Évaluation de modèle
Au fur et à mesure que votre organisation passe des prototypes d'IA générative à la production, il est essentiel d'établir des processus d'évaluation rigoureux pour les modèles de base. Bien que les benchmarks ouverts fournissent des informations générales sur les performances des modèles, ils sont souvent insuffisants lorsqu'il s'agit de déterminer l'adéquation d'un modèle aux besoins spécifiques de l'entreprise. Des stratégies d'évaluation personnalisées aident les utilisateurs à sélectionner le modèle le plus approprié qui correspond aux exigences uniques de votre organisation.
Objectifs de l'évaluation de modèles personnalisés
Une approche d'évaluation personnalisée aide les organisations à effectuer les tâches suivantes :
-
Évaluez les performances relatives aux tâches pertinentes pour l'entreprise : évaluez dans quelle mesure les modèles gèrent les tâches directement liées aux cas d'utilisation de votre entreprise.
-
Identifiez les biais et les limites potentiels : détectez les zones dans lesquelles les modèles peuvent présenter des biais ou échouer afin de vous assurer que le modèle est adapté à un déploiement dans le monde réel.
-
Comparez les modèles aux indicateurs pertinents : comparez différents modèles en utilisant des indicateurs qui alignent les priorités et les objectifs de votre organisation.
-
Effectuez une sélection de modèles éclairée : prenez des décisions basées sur les données concernant la sélection, le réglage précis et le déploiement des modèles dans les environnements de production.
Choix des métriques d'évaluation du modèle
L'évaluation efficace des modèles repose sur une combinaison de techniques qui fournissent une vision globale des performances des modèles. Grâce à ces techniques, les organisations peuvent évaluer non seulement la précision technique d'un modèle, mais également son adéquation avec les besoins spécifiques de l'entreprise. Pour évaluer un modèle, vous combinez des mesures quantitatives et qualitatives afin de déterminer les performances, d'identifier les biais et de choisir un modèle. Organisations doivent utiliser à la fois des métriques basées sur la vérité de base (avec des données de référence) et des métriques flexibles (sans données de référence) pour obtenir une vision complète de l'adéquation du modèle. En intelligence artificielle, la vérité fondamentale fait référence à des données factuelles qui ne sont pas divulguées pendant l'entraînement du modèle afin que vous puissiez les utiliser pour l'évaluation du modèle.
Utilisez des métriques basées sur la vérité de base si des données de référence existent. Ces indicateurs fournissent des évaluations quantitatives concrètes. Dans le même temps, les techniques dépourvues de fondement peuvent offrir de la flexibilité. Ces techniques vous aident à évaluer les modèles en fonction de dimensions telles que la lisibilité et l'exhaustivité, même lorsque les bonnes réponses prédéfinies ne sont pas disponibles.
Des métriques basées sur des données fiables sur le terrain
Si des données de référence sont disponibles, des mesures basées sur la vérité de base peuvent fournir des évaluations quantitatives. Les indicateurs suivants fournissent des évaluations quantitatives des performances :
-
Score ROUGE-L — La doublure orientée vers le rappel pour l'évaluation du gisting (ROUGE) pour la plus longue sous-séquence commune (LCS), également connue sous le nom de ROUGE-L, mesure la plus longue sous-séquence commune entre les textes générés et les textes de référence. La métrique évalue la cohérence et le chevauchement des contenus.
-
Similarité des cosinus : cette métrique évalue la similitude sémantique entre les textes. Il fournit des informations sur la compréhension contextuelle du modèle.
-
Score METEOR : métrique d'évaluation de la traduction avec classement explicite (METEOR) qui combine l'alignement des mots et la correspondance sémantique pour fournir une évaluation équilibrée de l'exactitude et du sens du contenu.
-
Similarité binaire : cette métrique vérifie les correspondances exactes, ce qui la rend particulièrement utile pour les tâches nécessitant des résultats précis, telles que la génération de commandes.
-
LLM-as-a-judge score — Cette métrique utilise un autre grand modèle de langage (LLM) pour évaluer la similarité sur une échelle définie. Il propose une évaluation nuancée de la qualité.
Amazon SageMaker Clarify et Amazon Bedrock incluent des fonctionnalités qui vous aident à évaluer les modèles. Ils peuvent automatiser les tâches d'évaluation des modèles afin que vous puissiez quantifier les risques liés aux modèles et la qualité des réponses. Pour plus d'informations, consultez Évaluer, expliquer et détecter les biais dans les modèles et Évaluer les performances des ressources Amazon Bedrock.
Des métriques sans données fiables
Lorsque les données de référence ne sont pas disponibles, ou en tant qu'approche complémentaire, vous pouvez utiliser LLM-as-a-judge cette technique. Il utilise un modèle distinct pour évaluer les résultats d'une solution d'IA générative en fonction de dimensions importantes pour l'entreprise. Cette technique offre une certaine flexibilité pour évaluer les différentes qualités du modèle. Pour plus d'informations, consultez la section Évaluer les performances du modèle à l'aide d'un autre LLM en tant que juge dans la documentation Amazon Bedrock.
Vous pouvez utiliser des métriques calculées pour évaluer l’efficacité avec laquelle un système de génération à enrichissement contextuel (RAG) extrait les informations pertinentes de vos sources de données, ainsi que l’efficacité des réponses générées pour répondre aux questions. Les résultats d’une évaluation RAG vous permettent de comparer différentes bases de connaissances Amazon Bedrock et d’autres sources RAG, puis de choisir la base de connaissances ou le meilleur système RAG pour votre application. Pour plus d'informations, consultez Évaluer les performances des sources RAG dans la documentation Amazon Bedrock.
Techniques d'évaluation des modèles en pratique
Pour faire correspondre efficacement les besoins de l'entreprise aux capacités du modèle, utilisez un ensemble robuste de critères d'évaluation pour orienter le processus d'évaluation du modèle. Ces critères couvrent un éventail de priorités, allant de l'exactitude et de l'exhaustivité à la factualité et au traitement des données sensibles. Chaque critère s'aligne sur des techniques spécifiques pour fournir des informations exploitables. Par exemple, lorsque la précision factuelle est essentielle, des indicateurs tels que le score ROUGE-L ou la similarité des cosinus fournissent des points de référence concrets et quantifiables. À l'inverse, utilisez des techniques telles que l'évaluation LLM-as-a-judge de la lisibilité et de la fraîcheur. Ces techniques offrent des informations qualitatives flexibles adaptées aux normes organisationnelles. Les principales dimensions de l'évaluation des modèles sont les suivantes :
-
Exactitude — Valide l'exactitude des informations fournies
-
Exhaustivité — Vérifie la profondeur et la couverture des réponses
-
Lisibilité — Évalue la clarté et la facilité de compréhension
-
Actualité des informations — Vérifie que le contenu est pertinent et actuel
-
Suppression des données sensibles — Contrôle du traitement approprié des informations confidentielles
-
Exactitude — Mesure l'alignement sur les informations factuelles
-
Cohérence — Examine le flux logique et la cohérence
-
Factualité — Vérifie la véracité du contenu
-
Intégralité — Évalue l'étendue et l'exhaustivité de la couverture
En ancrant les techniques d'évaluation des modèles dans ces critères clairs, vous pouvez vérifier minutieusement les modèles en fonction de leurs objectifs spécifiques. Cette approche structurée aligne les modèles sur les objectifs de l'entreprise, les exigences de conformité et les attentes des utilisateurs. Il jette également des bases solides pour le déploiement d'applications d'IA générative à grande échelle dans les environnements de production.
Recommandations de mise en œuvre
Pour établir une stratégie de modèle de fondation efficace, tenez compte des recommandations suivantes :
-
Formez un comité de gouvernance modèle doté de rôles, de responsabilités et de processus décisionnels clairs.
-
Élaborez des critères d'évaluation et des mécanismes de notation pour l'évaluation des modèles de base avant qu'ils ne soient disponibles pour une utilisation dans l'ensemble de l'organisation.
-
N'oubliez pas que le modèle de base le plus large n'est pas nécessairement toujours le meilleur modèle pour votre cas d'utilisation. Commencez proof-of-concept le développement avec des modèles de haut niveau pour valider la valeur commerciale, puis évaluez systématiquement des modèles plus petits pour optimiser les coûts.
-
Développez des tableaux de bord pour suivre les indicateurs clés, tels que la latence d'inférence, le débit, les taux d'erreur et le coût par inférence.
-
Fournissez des conseils clairs aux équipes sur la manière de sélectionner le modèle adapté à leur cas d'utilisation, y compris les processus d'expérimentation et les critères d'évaluation.