Evaluadores
Los evaluadores son los componentes principales que evalúan el desempeño de su agente en diferentes dimensiones. Analizan las trazas de los agentes y proporcionan puntuaciones cuantitativas en función de criterios específicos, como la utilidad, la precisión o las métricas empresariales personalizadas. AgentCore Evaluations ofrece evaluadores integrados para casos de uso comunes y la flexibilidad de crear evaluadores personalizados adaptados a sus requisitos específicos.
Built-in evaluadores
Built-in los evaluadores son soluciones preconfiguradas que utilizan modelos de lenguaje de gran tamaño (LLM) como jueces para evaluar el desempeño de los agentes. Estos evaluadores vienen con configuraciones predefinidas, que incluyen plantillas de pronósticos cuidadosamente diseñadas, modelos de evaluadores seleccionados y criterios de puntuación estandarizados.
Built-in Los evaluadores están diseñados para abordar las necesidades de evaluación comunes y, al mismo tiempo, garantizar la coherencia y la confiabilidad de todas las evaluaciones. Como forman parte de nuestra oferta totalmente gestionada, puede utilizarlos inmediatamente sin necesidad de realizar ninguna configuración adicional, y seguiremos mejorando su calidad e incorporando nuevos evaluadores a lo largo del tiempo. Para preservar la coherencia y la fiabilidad, las configuraciones de los evaluadores integrados no se pueden modificar.
Evaluadores personalizados
Los evaluadores personalizados ofrecen más flexibilidad al permitirle definir todos los aspectos del proceso de evaluación. AgentCore Evaluations admite dos tipos de evaluadores personalizados:
-
LLM-as-a-judge evaluadores: defina su propio modelo de evaluador, instrucciones de evaluación y esquemas de puntuación. Puede adaptar la evaluación a sus necesidades específicas seleccionando el modelo de evaluador, elaborando instrucciones de evaluación personalizadas, definiendo criterios de evaluación específicos y diseñando su propio esquema de puntuación. Para obtener más información, consulte Evaluadores personalizados.
-
Code-based evaluadores: utilice su propia función AWS Lambda para evaluar mediante programación el rendimiento de los agentes. Este enfoque le proporciona un control total sobre la lógica de evaluación, ya que permite realizar comprobaciones deterministas, llamadas a API externas, coincidencias de expresiones regulares, métricas personalizadas o cualquier regla específica de la empresa sin tener que depender de un juez de LLM. Para obtener más información, consulte Evaluador personalizado basado en código.
Este nivel de personalización es especialmente valioso cuando se necesita evaluar agentes de un dominio específico, aplicar estándares de calidad únicos o implementar sistemas de puntuación especializados. Por ejemplo, puede crear criterios de evaluación personalizados para sectores específicos, como la sanidad o las finanzas, o diseñar esquemas de puntuación que se ajusten a las métricas de calidad de su organización.