Loading
Generative AI von Agentforce und Einstein
Erstellen von benutzerdefinierten Scorern

Erstellen von benutzerdefinierten Scorern

Mit benutzerdefinierten Scorern können Sie Ihre AI anhand bestimmter Kriterien wie Genauigkeit, Ton und Markenstimme testen. Mithilfe eines LLM-as-Judge können Sie die Ausgaben automatisch bewerten und überprüfen, um sicherzustellen, dass die Antworten Ihrer Agenten Ihre spezifischen Ziele und Qualitätsstandards konsistent erfüllen.

Erforderliche Editionen

Grünes Häkchen

Dieser Artikel gilt für:

Neues Testcenter in Agentforce Studio (Beta)
Rotes Kreuz

Dieser Artikel gilt nicht für:

Veraltetes Agentforce-Testcenter unter "Setup"
Verfügbarkeit: Lightning Experience
Verfügbarkeit: Enterprise, Performance, Unlimited und Developer Edition. Erforderliche Add-On-Lizenzen variieren je nach Agententyp.
Erforderliche Benutzerberechtigungen
Erstellen von Tests im Testcenter:

Verwalten von Agentforce-Rastern

UND

Verwalten von Agentforce Tests

Jeder Agent hat einen Zweck oder ein Ziel. Daher müssen für die Bewertung der Leistung eines Agenten auf diesen Zweck zugeschnittene Kennzahlen identifiziert werden. Zusammen mit Standardbewertungen können Sie mit benutzerdefinierten Bewertungskriterien die Effektivität Ihres Agenten über einfache Überprüfungen hinaus bewerten. Mit benutzerdefinierten Scorern können Sie überprüfen, ob Ihre AI-Agenten Ihre Markenstimme konsistent widerspiegeln, die Qualitätserwartungen erfüllen und die gewünschte Stimmung vermitteln. Verwenden Sie alternativ benutzerdefinierte Scorer, wenn Sie eine strukturierte Ausgabe wie eine JSON erwarten und ein Textbeispiel im Feld "Erwartete Antwort" nicht ausreicht, um Ihre Validierungskriterien zu erfassen.

  1. Klicken Sie zum Erstellen eines benutzerdefinierten Scorers auf Benutzerdefiniert hinzufügen und wählen Sie LLM-Richter aus.

    Was ist ein LLM-Richter?

    Ein LLM-Richter (oder LLM-as-Judge) ist der Fall, wenn ein großes Sprachmodell (LLM) die Ausgaben eines anderen auswertet und bewertet. Ein Richter erhält eine Aufforderung, die die Aufgabe definiert und die Bewertungskriterien wie faktische Genauigkeit, Relevanz, Kohärenz und Quelltreue beschreibt. Mit diesen Ressourcen und Richtlinien bestimmt der LLM-Richter die erwartete Antwort und vergleicht sie mit der Agentenantwort. Basierend auf diesem Vergleich generiert der Richter Bewertungen, Ranglisten oder schriftliches Feedback. Das LLM als Richtermodell dient als skalierbares, automatisiertes und objektives Bewertungstool für Aufgaben wie Bewertungszusammenfassungen oder Rangantworten. Unsere Aufforderungen zur Beurteilung von LLM wurden sorgfältig entwickelt, um Ihnen die genauesten und nützlichsten Testergebnisse zu bieten.
  2. Wenn Sie eine Eingabeaufforderung für einen benutzerdefinierten Scorer erstellen, können Sie mehrere wichtige Elemente anpassen.
    • Bestimmen, welches AI-Modell als Richter fungiert
    • Hinzufügen von Salesforce-Ressourcen
    • Speichern mehrerer Vorlagenversionen
    • Festlegen der Schwellenwertbewertung für Ihre bestandenen Kriterien
  3. Speichern Sie Ihren Scorer.

Nachdem Sie Ihren benutzerdefinierten Scorer gespeichert haben, wird er automatisch für Ihre Test-Suite ausgewählt. Sobald Agentforce die Generierung von Tests abgeschlossen hat, werden sie unter "Testfälle" angezeigt. Je nach Größe und Komplexität der Anforderung kann dieser Vorgang zwischen einigen Minuten und mehreren Stunden dauern. Möglicherweise müssen Sie die Test-Suite aktualisieren, um Ihre Testfälle anzuzeigen.

Wenn die Testfälle angezeigt werden, klicken Sie auf Test ausführen. Agentforce führt die ausgewählten Scorer für die Testfälle aus.

 
Laden
Salesforce Help | Article