为提示模板选择正确的 AI 模型
选择并测试 AI 模型,以找到最适合特定用例的模型。正确的模型选择会显著影响响应质量、成本和性能。
所需的 Edition
| 适用于:Lightning Experience |
| 适用于:Enterprise、Performance 和 Unlimited Edition,带有 Einstein for Platform、Einstein 或适用于销售的 Agentforce 或 Service 加载项、Agentforce Foundations |
在提示生成器中,您可以选择哪个 AI 模型支持提示模板。最新或最强大的型号并不总是最好的选择。重要的是模型在实际数据中执行特定任务的能力。
模型选择原则
任务特殊性最重要。不同的模型在不同的任务中表现优异。对于生成创造性的销售电子邮件有效,但对于从个案中提取结构化数据无效。始终在您的实际用例上测试模型,而不是通用基准。
表现优于最近。更新的模型不会自动更好地满足您的需求。请勿默认设置为最新模型 — 衡量任务的性能。
成本和准确性的权衡。更昂贵的模型通常(但并不总是)产生更高质量的输出。将模型成本与响应可见性和业务影响相匹配。
| 场景 | 质量需求 | 模型选择 |
|---|---|---|
| 支持团队读取的内部个案汇总 | 够好了 | 经济高效的模型 |
| 面向客户的企业客户电子邮件 | 完美 | 保费模型 |
| 批量生成数千条记录的字段 | 一致且快速 | 中端模型 |
| 一次性执行摘要 | 尽可能好 | 保费模型 |
一致性对生产至关重要。在 80% 的时间内产生良好响应,在 20% 的时间内产生较差响应的模型尚未准备好投入生产。使用相同的输入多次测试每个模型,以衡量一致性,而不仅仅是峰值性能。
测试并选择模型
遵循此流程,以做出基于证据的模型选择。
步骤 1:定义成功标准。在测试任何模型之前,决定“良好”对用例意味着什么。确定 2-3 个可衡量的标准。例如,对于销售电子邮件提示:个性化(电子邮件引用特定客户详细信息)、语气(专业但会话,得分为 1-5)和长度(100–150 个单词)。
步骤 2:创建测试数据。从实际使用情况中准备 10-20 个有代表性的示例。使用实际 Salesforce 记录,而不是虚构的测试数据。真实数据表面会区分大小写,例如空字段、异常值、很长或很短的文本和特殊字符。包括行业、个案类型和客户规模之间的多样性,并包括典型记录和存在问题的记录。
步骤 3:测试每个模型。使用测试数据,针对每个可用模型运行提示模板。对所有模型使用完全相同的提示模板和测试数据 — 仅更改模型选择。
步骤 4:测量结果。根据成功标准对每个输出进行评分。计算汇总统计数据,例如所有测试记录的合格率、平均分数和合规率。
步骤 5:分析数据。比较成功标准中的模型。确定哪个模型在对您用例最重要的标准上表现最佳。
步骤 6:检查一致性。对于前 2-3 个模型,对 5 个测试记录运行相同的提示 5 次(每个模型总共运行 25 次)。高方差表示模型对生产不可靠。选择低方差的模型。
步骤 7:根据证据进行选择。选择在实际成功标准方面表现最佳的模型,而不是在声誉或市场营销要求方面。记录您的选择,包括赢得的条件、测试结果摘要和测试日期。在新模型可用时,您可以重新测试并与基准进行比较。
了解何时切换模型
您的模型选择不是永久性的。请考虑在这些情况下切换。
- 新模型可用。在 Salesforce 发布新模型时,使用相同流程根据基准进行测试。不要假设新的等于更好。
- 您的用例发生变化。如果要求发生变化(例如,您现在需要多语言支持或更长的输出),请重新测试模型。
- 性能下降。如果您发现输出质量随时间下降,请测试替代模型。有时,模型更新会影响特定用例的性能。
- 成本注意事项会发生变化。如果您的数量急剧增加,即使质量略有下降,更具成本效益的模型也可能有意义。分析最终用户是否注意到质量差异,以及它是否影响业务结果。
常见模型选择错误
- 根据一般基准进行选择。基准衡量一般能力。您的特定任务可能与基准任务不一致。始终使用实际提示和数据进行测试。
- 永远不要重新测试模型会发生变化,新模型会发布,用例也会发生变化。为重要提示安排季度模型审查。
- 使用人工智能进行测试。生产数据混乱。真实记录包含空字段、边缘个案和意外值。始终使用真实的 Salesforce 记录进行测试。
- 测试一次。单个测试不会显示一致性问题。使用相同的输入测试多次,以衡量一致性。
- 针对错误的度量进行优化。首先定义成功标准,然后测试这些特定标准,而不是一般质量或创造力。
模型比较核对清单
在比较模型时,评估这些项目。
- 准确性:输出是否匹配预期内容和格式?
- 一致性:重复运行是否会产生类似的质量?
- 合规性:响应是否适合字段大小和格式约束?
- 音调:语音是否与您的品牌和用例相匹配?
- 完整性:是否包含所有必需元素?
- 速度:响应时间是否满足用户期望?
- 成本:价格是否与此用例的业务价值一致?
- 边缘个案:如何处理异常或最少数据?

