Вы находитесь здесь:
Безопасность содержимого
Einstein Trust Layer содержит набор политик, помогающих обнаружить потенциально вредоносный контент и вредоносные атаки, которые пытаются нарушить безопасность и защиту приложений на основе искусственного интеллекта.
Требуемые версии
| Доступно в версиях: Enterprise, Performance и Unlimited Edition с надстройкой Einstein for Sales, Einstein for Platform, Einstein for Service, Einstein 1 Service или Einstein GPT Service. Чтобы приобрести дополнительные компоненты, обратитесь к менеджеру по работе с клиентами Salesforce. |
Вредное содержимое
Под вредным содержимым понимается информация, которая может иметь пагубные последствия для отдельных лиц или сообществ. В контексте генеративных моделей на основе искусственного интеллекта вредное содержимое обозначает данные в напоминаниях или ответах, которые негативно влияют на психическое здоровье, поведение или благополучие. Вредное содержимое может включать токсичные материалы, например, ненависть и насилие, или содержимое, которое имеет несправедливые или дискриминационные схемы.
Крупноязыковые модели (LLM) могут случайно создавать вредное содержимое по нескольким причинам:
- Влияние напоминания: Язык в напоминании напрямую влияет на вывод модели. Например, если напоминание содержит оскорбительные или вредные фразы, модель может добавить похожие формулировки в ответ.
- Данные обучения: LLM изучают огромные объемы данных, которые могут содержать предвзятое или токсичное содержание. Если обучающие данные содержат вредные выражения, модель может случайно воспроизвести их.
- Контекстные схемы: LLM создают ответы на основе статистических схем в данных. Если вредные выражения часто появляются в похожих контекстах, модель может воспроизвести эти схемы.
- Настройка и передача обучения: Точная настройка LLM для определенных задач может внести предвзятость. Перенос обучения из несвязанных доменов также может повлиять на создание содержимого.
Einstein Trust Layer использует модели компьютерного обучения для идентификации вредного контента в генеративных приложениях и функциях искусственного интеллекта.
Напоминание о впрысках
Инъекции мгновения — это попытки заставить LLM сделать то, для чего он не предназначен. Хакеры могут создать напоминания, которые пытаются переопределить системные политики или манипулировать LLM, чтобы заставить его сделать что-то непреднамеренное.
Salesforce предоставляет оперативные механизмы защиты, помогающие уменьшить риски, создаваемые вредоносными атаками.
Своевременное обнаружение инъекции вместе с политиками системы предоставляют глубокий подход к оперативной защите. Защита от инъекций подсказок последовательно применяется ко всем подсказкам пользователя, укрепляя безопасность в Agentforce и встроенных приложениях на основе искусственного интеллекта.
- Мы разработали встроенные системные политики, которые помогают ограничить галлюцинации и уменьшить вероятность непреднамеренных или вредных результатов LLM.
- Оперативное обнаружение инъекций используется для обнаружения вредоносных атак, которые пытаются манипулировать LLM, чтобы сделать то, для чего они не были созданы.
