Loading
Agentforce 和 Einstein 生成式 AI
目录
选择筛选器

          没有结果
          没有结果
          以下是一些搜索提示

          检查关键字的拼写。
          使用更普遍的搜索词。
          选择更少的筛选器,并扩大搜索范围。

          搜索所有 Salesforce 帮助
          为提示模板选择正确的 AI 模型

          为提示模板选择正确的 AI 模型

          选择并测试 AI 模型,以找到最适合特定用例的模型。正确的模型选择会显著影响响应质量、成本和性能。

          所需的 Edition

          适用于:Lightning Experience
          适用于:EnterprisePerformanceUnlimited Edition,带有 Einstein for Platform、Einstein 或适用于销售的 Agentforce 或 Service 加载项、Agentforce Foundations

          在提示生成器中,您可以选择哪个 AI 模型支持提示模板。最新或最强大的型号并不总是最好的选择。重要的是模型在实际数据中执行特定任务的能力。

          模型选择原则

          任务特殊性最重要。不同的模型在不同的任务中表现优异。对于生成创造性的销售电子邮件有效,但对于从个案中提取结构化数据无效。始终在您的实际用例上测试模型,而不是通用基准。

          表现优于最近。更新的模型不会自动更好地满足您的需求。请勿默认设置为最新模型 — 衡量任务的性能。

          成本和准确性的权衡。更昂贵的模型通常(但并不总是)产生更高质量的输出。将模型成本与响应可见性和业务影响相匹配。

          场景 质量需求 模型选择
          支持团队读取的内部个案汇总 够好了 经济高效的模型
          面向客户的企业客户电子邮件 完美 保费模型
          批量生成数千条记录的字段 一致且快速 中端模型
          一次性执行摘要 尽可能好 保费模型

          一致性对生产至关重要。在 80% 的时间内产生良好响应,在 20% 的时间内产生较差响应的模型尚未准备好投入生产。使用相同的输入多次测试每个模型,以衡量一致性,而不仅仅是峰值性能。

          测试并选择模型

          遵循此流程,以做出基于证据的模型选择。

          步骤 1:定义成功标准。在测试任何模型之前,决定“良好”对用例意味着什么。确定 2-3 个可衡量的标准。例如,对于销售电子邮件提示:个性化(电子邮件引用特定客户详细信息)、语气(专业但会话,得分为 1-5)和长度(100–150 个单词)。

          步骤 2:创建测试数据。从实际使用情况中准备 10-20 个有代表性的示例。使用实际 Salesforce 记录,而不是虚构的测试数据。真实数据表面会区分大小写,例如空字段、异常值、很长或很短的文本和特殊字符。包括行业、个案类型和客户规模之间的多样性,并包括典型记录和存在问题的记录。

          步骤 3:测试每个模型。使用测试数据,针对每个可用模型运行提示模板。对所有模型使用完全相同的提示模板和测试数据 — 仅更改模型选择。

          步骤 4:测量结果。根据成功标准对每个输出进行评分。计算汇总统计数据,例如所有测试记录的合格率、平均分数和合规率。

          步骤 5:分析数据。比较成功标准中的模型。确定哪个模型在对您用例最重要的标准上表现最佳。

          步骤 6:检查一致性。对于前 2-3 个模型,对 5 个测试记录运行相同的提示 5 次(每个模型总共运行 25 次)。高方差表示模型对生产不可靠。选择低方差的模型。

          步骤 7:根据证据进行选择。选择在实际成功标准方面表现最佳的模型,而不是在声誉或市场营销要求方面。记录您的选择,包括赢得的条件、测试结果摘要和测试日期。在新模型可用时,您可以重新测试并与基准进行比较。

          了解何时切换模型

          您的模型选择不是永久性的。请考虑在这些情况下切换。

          • 新模型可用。在 Salesforce 发布新模型时,使用相同流程根据基准进行测试。不要假设新的等于更好。
          • 您的用例发生变化。如果要求发生变化(例如,您现在需要多语言支持或更长的输出),请重新测试模型。
          • 性能下降。如果您发现输出质量随时间下降,请测试替代模型。有时,模型更新会影响特定用例的性能。
          • 成本注意事项会发生变化。如果您的数量急剧增加,即使质量略有下降,更具成本效益的模型也可能有意义。分析最终用户是否注意到质量差异,以及它是否影响业务结果。

          常见模型选择错误

          • 根据一般基准进行选择。基准衡量一般能力。您的特定任务可能与基准任务不一致。始终使用实际提示和数据进行测试。
          • 永远不要重新测试模型会发生变化,新模型会发布,用例也会发生变化。为重要提示安排季度模型审查。
          • 使用人工智能进行测试。生产数据混乱。真实记录包含空字段、边缘个案和意外值。始终使用真实的 Salesforce 记录进行测试。
          • 测试一次。单个测试不会显示一致性问题。使用相同的输入测试多次,以衡量一致性。
          • 针对错误的度量进行优化。首先定义成功标准,然后测试这些特定标准,而不是一般质量或创造力。

          模型比较核对清单

          在比较模型时,评估这些项目。

          • 准确性:输出是否匹配预期内容和格式?
          • 一致性:重复运行是否会产生类似的质量?
          • 合规性:响应是否适合字段大小和格式约束?
          • 音调:语音是否与您的品牌和用例相匹配?
          • 完整性:是否包含所有必需元素?
          • 速度:响应时间是否满足用户期望?
          • 成本:价格是否与此用例的业务价值一致?
          • 边缘个案:如何处理异常或最少数据?
           
          正在加载
          Salesforce Help | Article