Crear puntuadores personalizados
Los puntuadores personalizados le ayudan a probar su IA con criterios específicos como precisión, tono y voz de marca. Al utilizar un LLM como juez, puede puntuar y revisar automáticamente resultados para asegurarse de que las respuestas de sus agentes cumplen de forma coherente sus objetivos y estándares de calidad específicos.
Ediciones necesarias
![]() Este artículo se aplica a: |
Nuevo centro de pruebas en Agentforce Studio (Beta) |
![]() Este artículo no se aplica a: |
Centro de pruebas de Agentforce heredado en Configuración |
| Disponible en: Lightning Experience |
| Disponible en: Enterprise Edition, Performance Edition, Unlimited Edition y Developer Edition. Las licencias complementarias requeridas varían según el tipo de agente. |
| Permisos de usuario necesarios | |
|---|---|
| Para crear pruebas en el Centro de pruebas: | Gestionar cuadrículas Agentforce Y Gestionar pruebas Agentforce |
Cada agente tiene un propósito u objetivo, de modo que evaluar el rendimiento de un agente requiere identificar mediciones adaptadas a ese propósito. Junto con los puntuadores predeterminados, los puntuadores personalizados le permiten definir criterios específicos para evaluar la eficacia de su agente más allá de simples comprobaciones de aprobación o fallo. Con los puntuadores personalizados puede comprobar que sus agentes de IA reflejan de forma coherente la voz de su marca, cumplen las expectativas de calidad y entregan la opinión prevista. O bien, utilice puntuadores personalizados cuando espere un resultado estructurado como un JSON, y un ejemplo de texto en el campo Respuesta esperada no es suficiente para capturar sus criterios de validación.
-
Para crear un puntuador personalizado, haga clic en Agregar personalizado y seleccione LLM Judge.
¿Qué es un juez LLM?
Un juez de LLM (o LLM como juez) es cuando un modelo de idioma grande (LLM) evalúa y puntúa los resultados de otro. Un juez LLM recibe una solicitud que define la tarea y describe los criterios de puntuación como precisión de hechos, relevancia, coherencia y fidelidad al origen. Con estos recursos y directrices, el juez de LLM determina la respuesta esperada y la compara con la respuesta del agente. Basándose en esta comparación, el juez genera puntuaciones, clasificaciones o comentarios escritos. El modelo LLM como juez sirve como una herramienta de evaluación ampliable, automatizada y objetiva para tareas como resúmenes de puntuación o respuestas de clasificación. Hemos diseñado cuidadosamente nuestras solicitudes de LLM como juez para proporcionarle los resultados de pruebas más precisos y útiles. - Cuando crea una solicitud para un puntuador personalizado, puede adaptar varios elementos clave.
- Guarde su anotador.
Después de guardar su puntuación personalizada, se selecciona automáticamente para su conjunto de pruebas. Cuando Agentforce finaliza la generación de pruebas, aparecen bajo Casos de prueba. Dependiendo del tamaño y la complejidad de la solicitud, este proceso puede tardar desde unos minutos hasta varias horas. Es posible que tenga que actualizar el conjunto de pruebas para ver sus casos de prueba.
Cuando aparezcan los casos de prueba, haga clic en Ejecutar prueba. Agentforce comienza a ejecutar los puntuadores elegidos en los casos de prueba.


