為您的提示範本選擇正確的 AI 模型
選取並測試 AI 模型,以找出最適合您特定的使用個案。正確的模型選擇會大幅影響回應品質、成本和效能。
必要版本
| 提供版本:Lightning Experience |
| 提供版本:具有 Einstein for Platform、適於銷售的 Einstein 或 Agentforce 或 Service 附加元件,或適用於 Agentforce Foundations 的 Enterprise、Performance 及 Unlimited Edition |
在提示詞產生器中,您可以選取要為提示範本提供的 AI 模型。最新的或最強大的模型並非一律是最佳選擇。重要的是模型對您實際資料的特定工作執行程度。
模型選取原則
工作特定性最重要。不同的模型在不同的工作中表現出色。產生創意銷售電子郵件的功能可能無法用於從個案中提取結構化資料。一律針對實際使用個案測試模型,而非一般基準。
效能高於最近效能。較新的模型不會自動符合您的需求。請勿預設為最新的模型—測量工作效能。
成本與準確性權衡。較高成本的模型通常 (但不一定) 會產生更高品質的輸出。將模型成本與回應可視性和業務影響比對。
| 實例 | 品質需求 | 模型選項 |
|---|---|---|
| 支援小組讀取的內部個案摘要 | 足夠好 | 符合成本效益的模型 |
| 企業帳戶的面向客戶電子郵件 | 絕佳 | 保費模型 |
| 產生數千筆記錄的大量欄位 | 一致且快速 | 中層模型 |
| 一次性執行摘要 | 盡可能 | 保費模型 |
一致性對生產而言至關重要。產生優良回應的模型 80% 的時間,產生不良回應 20% 的時間並未準備好生產。使用相同輸入多次測試每個模型,以測量一致性,而不只是績效高峰。
測試和選取模型
遵循此流程進行以證據為基礎的模型選擇。
步驟 1:定義成功條件。在測試任何模型之前,請先決定「好」在使用個案中的意義。識別 2–3 個可測量的條件。例如,針對銷售電子郵件提示:個人化 (電子郵件參照特定帳戶詳細資料)、語氣 (專業但對話、評分 1–5) 和長度 (100–150 字)。
步驟 2:建立測試資料。從實際使用情況準備 10–20 個代表範例。使用實際的 Salesforce 記錄,而非現成的測試資料。實際資料會呈現邊緣個案,例如空白欄位、異常值、非常長或簡短的文字,以及特殊字元。包含跨產業、個案類型和帳戶大小的多樣性,並包含一般記錄和已有問題的記錄。
步驟 3:測試每個模型。使用測試資料對照每個可用模型執行您的提示範本。針對所有模型使用完全相同的提示範本和測試資料—僅變更模型選取項目。
步驟 4:測量結果。根據您的成功條件為每個輸出評分。計算所有測試記錄之間的匯總統計資料,例如通過率、平均分數和合規率。
步驟 5:分析資料。在成功條件之間比較模型。找出對您使用個案而言最重要的條件執行最佳的模型。
步驟 6:檢查一致性。針對前 2–3 個模型,針對 5 個測試記錄 (每個模型總計執行 25 次) 執行相同提示五次。高變異表示模型無法供生產使用。選擇低變異的模型。
步驟 7:根據證據進行選擇。選取在實際成功條件上表現最佳的模型,而不是在聲譽或行銷宣告上。記錄您的選擇,包括成交條件、測試結果摘要和測試日期。新模型可供使用時,您可以重新測試並對照基準進行比較。
瞭解何時切換模型
您的模型選項非永久性。請考慮在這些情況下切換。
- 新的模型可供使用。當 Salesforce 發行新模型時,請使用相同的流程對照基準進行測試。不要假設新等於較佳。
- 您的使用個案變更。如果需求變更—例如,您現在需要多國語言支援或較長的輸出—請重新測試模型。
- 效能降低。如果您注意到輸出品質隨著時間下降,請測試替代模型。有時模型更新會影響特定使用個案的效能。
- 成本考量事項會變更。如果您的體積大幅增加,即使品質略微下降,更具成本效益的模型仍會有意義。分析品質差異是否對一般使用者顯示,以及是否影響業務成果。
常見的模型選取錯誤
- 根據一般基準進行選擇。基準會測量一般功能。您的特定工作可能與基準工作不一致。一律使用實際提示與資料進行測試。
- 永不重新測試。模型會變更、新模型會發行,且您的使用個案會演進。為重要提示排程每季模型檢閱。
- 使用人工資料進行測試。生產資料很混亂。實際記錄具有空白欄位、邊緣個案和非預期值。一律使用真實的 Salesforce 記錄進行測試。
- 測試一次。單一測試不會顯示一致性問題。使用相同輸入多次測試,以測量一致性。
- 最佳化為錯誤的度量。先定義成功條件,然後針對特定條件進行測試,而非針對一般品質或創意。
模型比較檢查清單
比較模型時,請評估這些項目。
- 準確性:輸出是否符合預期內容與格式?
- 一致性:重複執行是否產生類似品質?
- 合規性:回應是否符合欄位大小與格式限制?
- 語調:Voice 是否符合您的品牌與使用個案?
- 完整性:是否包含所有必要元素?
- 速度:回應時間是否符合使用者期望?
- 成本:價格是否符合此使用個案的業務價值?
- 邊緣個案:如何處理異常或最小資料?

