View a markdown version of this page

Evaluadores - Base amazónica AgentCore

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Evaluadores

Los evaluadores son los componentes principales que evalúan el desempeño de su agente en diferentes dimensiones. Analizan el seguimiento de los agentes y proporcionan puntuaciones cuantitativas en función de criterios específicos, como la utilidad, la precisión o las métricas empresariales personalizadas. AgentCore Evaluations ofrece evaluadores integrados para casos de uso comunes y evaluadores externos de bibliotecas de evaluación de código abierto. También puede crear evaluadores personalizados que se adapten a sus requisitos específicos.

Built-in evaluadores

Built-in los evaluadores son soluciones preconfiguradas que utilizan modelos lingüísticos extensos (LLM) como jueces para evaluar el desempeño de los agentes. Estos evaluadores vienen con configuraciones predefinidas, que incluyen plantillas de solicitudes cuidadosamente elaboradas, modelos de evaluadores seleccionados y criterios de puntuación estandarizados.

Built-in los evaluadores están diseñados para abordar las necesidades comunes de evaluación y, al mismo tiempo, garantizar la coherencia y la confiabilidad en todas las evaluaciones. Como forman parte de nuestra oferta totalmente gestionada, puede utilizarlos inmediatamente sin ninguna configuración adicional, y seguiremos mejorando su calidad y añadiendo nuevos evaluadores con el tiempo. Para preservar la coherencia y la fiabilidad, las configuraciones de los evaluadores integrados no se pueden modificar.

Third-party evaluadores

Third-party los evaluadores provienen de bibliotecas de código AutoEval abierto DeepEval y de código abierto. Amazon Bedrock los AgentCore administra de la misma manera que los evaluadores integrados. Seleccione un evaluador externo por ID y el servicio lo ejecutará, sin necesidad de ningún modelo ni configuración. También puede derivar un evaluador personalizado a partir de un evaluador integrado o externo para ejecutar su lógica en su propio modelo. Para obtener más información, consulte Third-party evaluadores.

Evaluadores personalizados

Los evaluadores personalizados ofrecen más flexibilidad al permitirle definir todos los aspectos del proceso de evaluación. AgentCore Evaluations admite los siguientes tipos de evaluadores personalizados:

  • LLM-as-a-judge evaluadores: defina su propio modelo de evaluador, instrucciones de evaluación y esquemas de puntuación. Puede adaptar la evaluación a sus necesidades específicas seleccionando el modelo de evaluador, elaborando instrucciones de evaluación personalizadas, definiendo criterios de evaluación específicos y diseñando su propio esquema de puntuación. Para obtener más información, consulte Evaluadores personalizados.

  • Code-based evaluadores: utilice su propia función de AWS Lambda para evaluar mediante programación el rendimiento de los agentes. Este enfoque le brinda un control total sobre la lógica de evaluación, ya que permite realizar comprobaciones deterministas, llamadas a API externas, hacer coincidencias de expresiones regulares, métricas personalizadas o cualquier regla específica de la empresa sin depender de un juez de LLM. Para obtener más información, consulte Evaluador personalizado basado en código. Evaluador personalizado basado en código

  • Evaluadores derivados de un evaluador base: ejecute la lógica de un evaluador integrado o de terceros existente según su propio modelo e inferencia, en lugar del modelo que elija el servicio. Para obtener más información, consulta los evaluadores. Third-party

Este nivel de personalización es especialmente valioso cuando es necesario evaluar a los agentes de un dominio específico, aplicar estándares de calidad únicos o implementar sistemas de puntuación especializados. Por ejemplo, puede crear criterios de evaluación personalizados para sectores específicos, como el sector sanitario o financiero, o diseñar esquemas de puntuación que se ajusten a las métricas de calidad de su organización.