您位於此處:
使用測試結果
測試完成後,您會看見測試套件的整體度量以及每個測試的評估分數。使用這些結果來識別失敗或評分低的說話方式,然後在 Agentforce Builder 中手動重新測試。限定子工作人員與動作中的指示,並重複進行,直到您對回應感到滿意為止。請特別注意循環失敗,因為這些結果可協助發現基本問題,例如指引不明確、缺少 Knowledge 或組態問題。若要解譯您的結果,請查看每個評估如何協助測量工作人員績效。
若要解譯您的結果,請查看每個評估如何協助測量工作人員績效。
預設評估的評分為 1 通過或 0 失敗。
| 評估 | 測試重要性 | 建議 |
|---|---|---|
| 回應評估 | 3 到 5 的分數表示工作人員在達成目標的過程中大致成功。分數為 5,反映精確、完整且符合品牌標識的回應,且沒有不相關的內容。 3 到 4 的分數顯示明確度與完整性降低。仍在處理核心意圖時,可能會有輕微的省略或部分瞭解,進而產生一些不明確性。 1 到 2 的分數表示工作人員難以達成目標。回應可能不明確、缺少關鍵元素,或包含不相關的資訊。它也可能會要求使用者提供應從 CRM 提取的資訊。 0 的分數代表解決使用者查詢的完整失敗。此回應是一般的,不會解決使用者的意圖。 |
檢查您的工作人員組態是否有與子工作人員選取、指示或動作相關的問題。考慮是否有 Knowledge 缺口,例如過期的文章,或其他問題阻止工作人員做出適當的回應。 |
| 子工作人員判斷式 | 分數為 1 表示工作人員已正確識別適當的子工作人員來處理說話方式。 0 的分數表示工作人員已選取非預期的子工作人員來處理說話方式。 |
在 Agentforce Builder 中手動重新測試任何失敗的說話方式,並在計畫畫布中檢閱工作人員的推理。精簡預期動作與子工作人員本身的指示,以清楚引導工作人員進行正確的選擇,並限制使用不正確的動作。 |
| 動作判斷式 | 分數為 1 表示工作人員已正確識別子工作人員內的所有適當動作以處理說話方式。 分數為 0 表示工作人員選擇錯誤的動作或未在子工作人員內選取解決說話方式的所有必要動作。 |
在 Agentforce Builder 中手動重新測試任何失敗的說話方式,並在計畫畫布中檢閱工作人員的推理。精簡預期動作與子工作人員本身的指示,以清楚引導工作人員進行正確的選擇,並限制使用不正確的動作。 |
回應品質評估的評分主要介於 0 到 5,其中 3 或更高表示通過;然而,「指示符合度」的唯一評分為「高」、「低」或「不確定」。LLM 評論員透過資訊泡泡提供每個分數的理由。
什麼是 LLM 作為判斷者?
LLM as Judge 是指當一個大型語言模型 (LLM) 評估另一個 LLM 的輸出時,作為如評分摘要或排名回應等工作的可調整、自動化和目標評估工具。「判斷者」LLM 會收到提示,其中包含工作與評估條件,例如實際準確性、相關性、一致性和對來源的忠誠度。透過這些資源與指導方針,LLM 判斷者可決定預期的回應,並將其與工作人員的回應進行比較,然後產生評分、排名或文字回饋意見。我們已仔細設計 LLM 作為判斷者提示,為您提供最準確且有用的測試結果。
| 評估 | 測試重要性 |
|---|---|
| 完整性 | 分數為 5,表示完整且準確的回答,且沒有重要遺漏。4 和 3 的分數會反映完成程度的減少程度,且會有較小的到中度差異,這可能會略有影響瞭解。 1 或 2 的分數表示產生的回答明顯不完整,缺少數個或最重要的資訊,這會造成混淆或導致部分誤導結果。 0 的分數代表評估的完整失敗,表示回答遺漏了所有重要的資訊,因此具有高度混淆或誤導性。 |
| 一致性 | 3 到 5 的評分表示工作人員可以使用適當的句子和語法結構,將基本資訊正確轉換為對話語言,以確保對話流程順利且使用者能輕鬆理解。 介於 0 到 2 的評分表示已從 Salesforce 物件取得資訊,並作為 JSON 結構或直接欄位內容等原始資料傳送。 |
| 簡要性 | 介於 3 到 5 的分數表示工作人員的回應簡短但準確,並成功捕捉所需內容的本質。 0 到 2 的評分表示產生的回答缺乏簡要性,可能是因為回應很長、重複、包含不重要的點數,或包含不相關的內容。 |
| 延遲性 | 測試說話方式的高度或異常延遲表示說話方式本身或某些基礎結構發生問題。如果工作人員調整無法解決問題,請連絡 Salesforce 支援以檢查基礎結構問題。 |
| 指示符合度 | 高:工作人員會解讀並完全遵循子工作人員指示,解決重點並提供任何必要資訊。 低:工作人員無法準確解譯或遵循子工作人員指示。無法遵循至少一個指示,導致回應不正確。這表明需要限定指示並設定更明確的限制。 不確定:指示符合度無法因不明確的回應或動作、不完整的回應,或子工作人員指示的解譯衝突而最終決定。 |
預設評估是透過比較預期結果與實際結果來評分,但評判者-LLM 會根據固定的條件評估品質評估。如果回應得到低分數,請仔細檢閱回應以瞭解回應是否實際低於您的期望。例如,judge-LLM 可能會指派低精確度分數,但您可能會覺得額外的內容更適合您的客戶或符合您的品牌聲音。否則,您可以新增額外的指示或護欄,讓工作人員符合您的目標。一律考量您的特定目標,並在解譯分數時使用個案。品質評估提供指引,但並非工作人員成功或失敗的絕對度量。
