測試多個意圖預估
透過大量測試多種說話方式,而非一次測試一個說話方式,來評估機器人預估意圖的準確度。此方法可協助評估意圖準確度,並識別意圖組態中的間隙。大量測試可協助識別分類錯誤的說話方式,並使用預估度量評估整體模型效能。先前,測試說話方式需要手動,逐一驗證。大量測試透過分析大型資料集並傳回合併的預估摘要來簡化流程。
必要版本
| 檢視支援的版本。 |
| 需要的使用者權限 | |
|---|---|
| 建立及管理 Einstein 機器人: | 自訂應用程式 或 「修改中繼資料」權限 或 「管理機器人」權限 |
大量測試可用於:
- 在單一要求中評估最多 1000 種說話方式
- 比較預期和預估的意圖
- 檢閱每個預估的信賴分數
- 使用摘要度量分析整體績效
您可以透過兩種方式執行大量測試:
- 測試自訂說話方式:提供說話方式與預期意圖的資料集,以評估特定情況。
- 使用現有機器人資料進行測試:評估已在機器人中設定的所有說話方式,以產生完整的績效摘要。
這兩種方法會對應至不同的 API 端點。
在開始之前,請先開啟 Einstein 機器人和 Einstein for Intents,然後建立模型。開啟「批次輸入測試員」試用版權限,然後在「機器人概觀」頁面上開啟跨語言意圖模型 (意圖 V3)。
備註 連絡 Salesforce 客戶支援以開啟「批次輸入測試員」試用權限。如果您關閉跨語言意圖模型,Salesforce 會使用「意圖標準 V2」(針對單一語言) 或「意圖多語言 2.5」(針對多種語言) 建立模型。
大量測試如何運作
大量測試會根據機器人的意圖模型評估說話方式,並傳回:
- 您以一組說話方式或所選機器人版本起始評估要求。
- 意圖模型會處理每種說話方式,並預估最相關的意圖。
- 系統會在提供時,將預估的意圖與預期的意圖進行比較。
- 系統會為每個預估指派信賴分數和等級。
- 系統會產生具有整體效能度量的預估摘要。
- 系統會傳回所有已評估說話方式的合併結果。
瞭解預估結果
若要瞭解機器人如何精確地分類說話方式,並識別可改善的區域,請檢閱預估結果。
每位流失結果。針對每種說話方式,系統會傳回:
- 預估的意圖:模型識別的意圖
- 預估成果:表示預估的意圖是否符合預期的意圖 (通過、失敗或未處理)
- 信賴分數:表示預估正確的可能性
摘要度量。系統提供彙總的度量,以協助評估整體績效:
- 成功率:正確預估的說話方式百分比
- 失敗計數:錯誤預估的說話方式數
- 意圖涵蓋率:針對至少一個說話方式正確預估的意圖百分比
- 錯誤計數:機器人無法處理的說話方式數量
考量事項
當您使用大量測試時,請記住以下考量事項:
- 您一次最多可評估 1000 種說話方式。
- 結果取決於意圖訓練資料的品質。
- 檢閱失敗的預估以改善意圖準確性。
- 個別說話方式的錯誤不會停止整體評估。
如需 API 詳細資料,請參閱《Connect REST API 開發人員指南》中的 機器人說話方式意圖預估資源。
此文章是否解決您的問題?
請讓我們知道,以便我們改進!

