内容安全和保安
Einstein Trust 层包含一组策略,以帮助检测试图危及 AI 应用程序安全性的潜在有害内容和恶意攻击。
所需的 Edition
| 适用于:Enterprise、Performance 和 Unlimited Edition,带有 Einstein for Sales、Einstein for Platform、Einstein for Service、Einstein 1 Service 或 Einstein GPT Service 加载项。要购买加载项,请联系您的 Salesforce 客户主管。 |
有害内容
有害内容是指可能对个人或社区产生有害影响的信息。在生成式 AI 模型的上下文中,有害内容是指提示或响应中对心理健康、行为或福祉产生负面影响的数据。有害内容可以包括仇恨和暴力等有毒材料,或具有不公平或歧视性模式的内容。
由于以下几个原因,大型语言模型 (LLM) 可能会无意中产生有害内容:
- 提示影响:提示中的语言直接影响模型的输出。例如,如果提示包含冒犯性或有害短语,模型可以在响应中包含类似的语言。
- 培训数据:LLM 从大量数据中学习,这些数据可能包括有偏见或有毒的内容。如果训练数据包含有害语言,模型可能会无意中复制它。
- 上下文模式:LLM 根据数据中的统计模式生成响应。如果有害语言在相似上下文中频繁出现,模型可以复制这些模式。
- 微调和转移学习:对特定任务的 LLM 进行微调可能会引入偏见。从不相关的域转移学习也会影响内容生成。
Einstein Trust 层使用机器学习模型来识别生成式 AI 应用程序和功能中的有害内容。
提示注入
提示注入是尝试使 LLM 执行并非设计执行的操作。黑客可以创建提示,尝试覆盖系统策略或操纵 LLM 执行意外操作。
Salesforce 提供快速防御机制,以帮助降低恶意攻击带来的风险。
提示注入检测与系统策略一起提供了深入的提示防御方法。提示注入防御一致应用于所有用户提示,增强了 Agentforce 和嵌入式 AI 应用程序中的安全性。
- 我们内置了系统策略,以帮助限制幻觉,并降低 LLM 意外或有害输出的可能性。
- 提示注入检测用于帮助检测恶意攻击,这些攻击试图操纵 LLM 执行一些并非设计执行的操作。
另请参阅:
本文章是否解决您的问题?
请与我们共享您的想法,以便我们进行改进!
