Loading
Agentforce 和 Einstein 生成式 AI
内容安全和保安

内容安全和保安

Einstein Trust 层包含一组策略,以帮助检测试图危及 AI 应用程序安全性的潜在有害内容和恶意攻击。

所需的 Edition

适用于:EnterprisePerformanceUnlimited Edition,带有 Einstein for Sales、Einstein for Platform、Einstein for Service、Einstein 1 Service 或 Einstein GPT Service 加载项。要购买加载项,请联系您的 Salesforce 客户主管。

有害内容

有害内容是指可能对个人或社区产生有害影响的信息。在生成式 AI 模型的上下文中,有害内容是指提示或响应中对心理健康、行为或福祉产生负面影响的数据。有害内容可以包括仇恨和暴力等有毒材料,或具有不公平或歧视性模式的内容。

由于以下几个原因,大型语言模型 (LLM) 可能会无意中产生有害内容:

  • 提示影响:提示中的语言直接影响模型的输出。例如,如果提示包含冒犯性或有害短语,模型可以在响应中包含类似的语言。
  • 培训数据:LLM 从大量数据中学习,这些数据可能包括有偏见或有毒的内容。如果训练数据包含有害语言,模型可能会无意中复制它。
  • 上下文模式:LLM 根据数据中的统计模式生成响应。如果有害语言在相似上下文中频繁出现,模型可以复制这些模式。
  • 微调和转移学习:对特定任务的 LLM 进行微调可能会引入偏见。从不相关的域转移学习也会影响内容生成。

Einstein Trust 层使用机器学习模型来识别生成式 AI 应用程序和功能中的有害内容。

提示注入

提示注入是尝试使 LLM 执行并非设计执行的操作。黑客可以创建提示,尝试覆盖系统策略或操纵 LLM 执行意外操作。

Salesforce 提供快速防御机制,以帮助降低恶意攻击带来的风险。

提示注入检测与系统策略一起提供了深入的提示防御方法。提示注入防御一致应用于所有用户提示,增强了 Agentforce 和嵌入式 AI 应用程序中的安全性。

  • 我们内置了系统策略,以帮助限制幻觉,并降低 LLM 意外或有害输出的可能性。
  • 提示注入检测用于帮助检测恶意攻击,这些攻击试图操纵 LLM 执行一些并非设计执行的操作。
 
正在加载
Salesforce Help | Article