Sie befinden sich hier:
Verwenden von Testergebnissen
Überprüfen Sie nach Abschluss eines Testlaufs die Bewertungsbewertungen, um zu ermitteln, wo Ihre Agenten- oder Aufforderungsvorlage fehlt. Erfahren Sie, was die einzelnen Scorer messen, wie Bewertungen berechnet werden und was bei niedrigen Ergebnissen zu tun ist.
Wenn ein Testlauf abgeschlossen ist, werden die Ergebnisse im Test-Suite-Raster als Bewertungen angezeigt, eine Zeile pro Testfall und eine Spalte pro Bewertung. Achten Sie genau auf wiederkehrende Fehler: Sie verweisen oft auf zugrunde liegende Probleme wie unklare Anweisungen, fehlender Kontext oder Konfigurationsprobleme.
Testen Sie fehlgeschlagene Äußerungen im Agentforce Builder für Agententests manuell erneut und optimieren Sie Unteragentenanweisungen, Agentenaktionen und Knowledge, bis sich die Ergebnisse verbessern. Verwenden Sie zum Testen von Aufforderungsvorlagen die Bewertungen, um zu ermitteln, wo die Ausgabe der Vorlage unterschritten wird, und wechseln Sie dann zum Eingabeaufforderungsgenerator, um Ihre Vorlagenanweisungen entsprechend anzupassen.
Agentenstandardauswertungen
Agententests enthalten eine Reihe von Standardauswertungen, die bei jedem Test automatisch ausgeführt werden, sowie optionale Qualitätsauswertungen, die Sie hinzufügen können. Standardauswertungen erhalten die Bewertung "1", "Bestanden" oder "0" und schlagen fehl.
| Auswertung | Testsignifikanz | Empfehlung |
|---|---|---|
| Antwortauswertung | Bewertungen von 3 bis 5 geben an, dass der Agent sein Ziel im Allgemeinen erreicht. Eine Bewertung von 5 spiegelt eine präzise, vollständige und markengerechte Antwort ohne irrelevanten Inhalt wider. Bewertungen von 3 bis 4 zeigen abnehmende Klarheit und Vollständigkeit. Es kann kleinere Auslassungen oder teilweises Verständnis geben, was zu einigen Unklarheiten führt, während der Kern-Intent noch angesprochen wird. Bewertungen von 1 bis 2 deuten darauf hin, dass der Agent Schwierigkeiten hatte, das Ziel zu erreichen. Die Antwort kann unklar sein, wichtige Elemente fehlen oder irrelevante Informationen enthalten. Möglicherweise wird der Benutzer auch um Informationen gebeten, die aus dem CRM hätten abgerufen werden sollen. Eine Bewertung von 0 stellt einen vollständigen Fehler bei der Lösung der Abfrage des Benutzers dar. Die Antwort ist generisch und geht nicht auf den Intent des Benutzers ein. |
Überprüfen Sie Ihre Agentenkonfiguration auf Probleme in Bezug auf die Auswahl, Anweisungen oder Aktionen von Unteragenten. Überlegen Sie, ob Knowledge-Lücken wie veraltete Artikel oder andere Probleme vorliegen, die den Agenten daran hindern, angemessen zu antworten. |
| Subagentenbehauptung | Die Bewertung 1 gibt an, dass der Agent den geeigneten Unteragenten für eine Äußerung richtig identifiziert hat. Die Bewertung 0 gibt an, dass der Agent einen unerwarteten Unteragenten ausgewählt hat, um eine Äußerung zu bearbeiten. |
Testen Sie alle fehlgeschlagenen Äußerungen im Agentforce Builder manuell erneut und überprüfen Sie die Argumentation des Agenten im Zeichenbereich "Plan". Optimieren Sie die Anweisungen für die erwartete Aktion und den Unteragenten selbst, um den Agenten klar zur richtigen Auswahl zu führen und die Verwendung der falschen Aktion einzuschränken. |
| Aktionsbehauptung | Eine Bewertung von 1 gibt an, dass der Agent alle geeigneten Aktionen in einem Unteragenten richtig identifiziert hat, um eine Äußerung zu bearbeiten. Eine Bewertung von 0 gibt an, dass der Agent entweder die falschen Aktionen ausgewählt hat oder nicht alle erforderlichen Aktionen innerhalb eines Unteragenten ausgewählt hat, um eine Äußerung zu beheben. |
Testen Sie alle fehlgeschlagenen Äußerungen im Agentforce Builder manuell erneut und überprüfen Sie die Argumentation des Agenten im Zeichenbereich "Plan". Optimieren Sie die Anweisungen für die erwartete Aktion und den Unteragenten selbst, um den Agenten klar zur richtigen Auswahl zu führen und die Verwendung der falschen Aktion einzuschränken. |
Bei der Bewertung der Antwortqualität wird ein LLM-Richter verwendet, um Antworten auf einer Skala von 0 bis 5 zu bewerten, wobei 3 oder höher für eine bestandene Antwort stehen. Einige Auswertungen gelten für beide Testtypen, andere nur für einen. Die Gründe für die einzelnen Bewertungen sind im Detailbereich verfügbar, wenn Sie ein Ergebnis auswählen.
Was ist ein LLM-as-judge?
"LLM as Judge" (LLM als "Urteil") wird verwendet, wenn ein großes Sprachmodell die Ausgaben eines anderen LLM auswertet und als skalierbares, automatisiertes und objektives Bewertungstool für Aufgaben wie Bewertungszusammenfassungen oder Rangantworten dient. Ein "Richter"-LLM erhält eine Aufforderung, die die Aufgabe und Bewertungskriterien wie faktische Genauigkeit, Relevanz, Kohärenz und Quelltreue enthält. Mit diesen Ressourcen und Richtlinien bestimmt der LLM-Richter die erwartete Antwort und vergleicht sie mit der Agentenantwort. Anschließend generiert er Bewertungen, Ranglisten oder Textfeedback. Unsere Aufforderungen zur Beurteilung von LLM wurden sorgfältig entwickelt, um Ihnen die genauesten und nützlichsten Testergebnisse zu bieten.
| Scorer | Agententests | Aufforderungsvorlagentests |
|---|---|---|
| Vollständigkeit | Bewertung 0–5. Eine Bewertung von 5 gibt eine vollständig vollständige und genaue Antwort ohne wichtige Auslassungen an. Die Bewertungen 4 und 3 spiegeln die abnehmende Vollständigkeit wider, mit geringfügigen bis mäßigen Lücken. Bewertungen von 1 oder 2 weisen auf eine signifikant unvollständige Antwort hin. Eine Bewertung von 0 bedeutet, dass bei der Antwort alle wichtigen Informationen verpasst wurden. |
Bewertung 0–5. Die gleiche Skala wie bei Agententests. "Weitergeben" oder "Fehlschlagen" wird basierend darauf zurückgegeben, ob die Antwort vollständig auf die Abfrage reagiert. |
| Kohärenz | Bewertung 0–5. Bewertungen von 3–5 geben an, dass die Antwort die zugrunde liegenden Informationen in eine klare Unterhaltungssprache umwandelt. Die Bewertungen 0–2 geben die bereitgestellten Rohdaten wie JSON-Strukturen oder direkte Feldinhalte an und nicht die natürliche Sprache. |
Bewertung 0–5. Die gleiche Skala wie bei Agententests. Bestehen oder schlagen Sie fehl, je nachdem, ob die Antwort logisch strukturiert und frei von grammatikalischen Fehlern ist. |
| Prägnanz | Bewertung 0–5. Bewertungen von 3–5 geben an, dass die Antwort angemessen kurz und genau ist. Bewertungen von 0–2 geben an, dass die Antwort langwierig ist, sich wiederholt oder irrelevanten Inhalt enthält. |
Bewertung 0–5. Die gleiche Skala wie bei Agententests. Übergeben oder fehlschlagen, je nachdem, ob die Antwort unnötige Längen vermeidet. |
| Tatsache | — | Bewertung 0–5. Bewertungen von 3–5 geben an, dass die Antwort genaue und gut unterstützte Informationen enthält. Bewertungen von 1–2 geben Fehler oder nicht unterstützte Ansprüche an. Eine Bewertung von 0 gibt an, dass Inhalte erheblich ungenau oder fingiert sind. |
| Latenz | Nicht bewertet. Eine hohe oder ungewöhnliche Latenz deutet auf ein Problem mit der Äußerung oder der zugrunde liegenden Infrastruktur hin. Wenn das Problem durch Agentenanpassungen nicht behoben werden kann, wenden Sie sich an den Salesforce-Support. |
— |
| Einhaltung der Anweisungen / Befolgen der Anweisungen | Als hoch, niedrig oder unsicher bewertet. Hoch: Der Agent befolgt die Anweisungen des Unteragenten vollständig, spricht wichtige Punkte an und stellt die erforderlichen Informationen bereit. Niedrig: Der Agent befolgt nicht mindestens eine Anweisung, was zu einer falschen Antwort führt. Optimieren Sie die Anweisungen und legen Sie klarere Einschränkungen fest. Unsicher: Die Einhaltung kann aufgrund einer mehrdeutigen Antwort, einer unvollständigen Antwort oder widersprüchlicher Interpretationen der Anweisungen des Unteragenten nicht abschließend bestimmt werden. |
Bewertung 1, 3 oder 5. 5 (hoch): Die Antwort folgte vollständig den Anweisungen der Aufforderungsvorlage. 3 (Unsicher): Die Einhaltung kann nicht abschließend bestimmt werden. 1 (Niedrig): Die Antwort wich von den Anweisungen ab. |
| Antwortübereinstimmung | — | Bewertung 0–5. Misst, wie nahe die Antwort der erwarteten Ausgabe entspricht, die Sie in Ihrer CSV-Datei angegeben haben. Ein höherer Wert bedeutet eine engere Übereinstimmung. Erfordert eine Spalte "Erwartete Ausgabe" in Ihrer Testfall-CSV. |
Qualitätsbewertungen werden vom LLM-Richter anhand fester Kriterien bewertet. Wenn eine Antwort eine niedrige Bewertung erhält, überprüfen Sie sie sorgfältig, um festzustellen, ob sie wirklich hinter Ihren Erwartungen zurückbleibt. Beispielsweise kann der LLM-Richter eine niedrige Prägnanzbewertung zuweisen, Sie sind jedoch der Meinung, dass ein zusätzlicher Kontext Ihren Kunden besser dient oder Ihrer Markenstimme entspricht. Sie können zusätzliche Anweisungen hinzufügen, um die Agenten- oder Aufforderungsvorlage besser an Ihre Ziele anzupassen. Berücksichtigen Sie beim Interpretieren von Bewertungen immer Ihre spezifischen Ziele und Ihren Anwendungsfall. Qualitätsbewertungen bieten Orientierung, sind jedoch keine absoluten Maßeinheiten für Erfolg oder Misserfolg.
