Innholdssikkerhet og sikkerhet
Einstein Trust Layer inneholder et sett policyer som hjelper til med å oppdage potensielt skadelig innhold og skadelige angrep som forsøker å kompromittere sikkerheten til AI-programmer.
Nødvendige utgaver
| Tilgjengelig i Enterprise, Performance og Ubegrenset Edition med et Einstein for Sales, Einstein for Platform, Einstein for Service, Einstein 1 Service eller Einstein GPT Service-tillegg. Hvis du vil kjøpe tillegg, kontakter du din Salesforce-kundeansvarlige. |
Skadelig innhold
Skadelig innhold henviser til informasjon som kan ha skadelige effekter på enkeltpersoner eller fellesskap. I sammenheng med generative AI-modeller refererer skadelig innhold til data i ledetekster eller svar som negativt påvirker mental helse, virkemåte eller velvære. Skadelig innhold kan inkludere giftig materiale som hat og vold eller innhold som har urettferdige eller diskriminerende mønstre.
Store språkmodeller (LLM-er) kan utilsiktet generere skadelig innhold av flere årsaker:
- Ledetekstinnvirkning: Språket i ledeteksten påvirker direkte modellens utdata. Hvis for eksempel ledeteksten inneholder støtende eller skadelige uttrykk, kan modellen ta med lignende språk i svaret.
- Opplæringsdata: LLM-er lærer fra store mengder data, som kan inkludere skjevt eller giftig innhold. Hvis opplæringsdataene inneholder skadelig språk, kan modellen utilsiktet reprodusere dem.
- Kontekstmønstre: LLM-er genererer svar basert på statistiske mønstre i dataene. Hvis skadelig språk vises ofte i lignende kontekster, kan modellen replikere disse mønstrene.
- Finjustering og overføring av læring: Finjustering av LLM-er for bestemte oppgaver kan introdusere systematiske avvik. Overføring av læring fra ikke-relaterte domener kan også påvirke innholdsgenerering.
Einstein Trust Layer bruker maskinlæringsmodeller til å identifisere skadelig innhold i generative AI-programmer og -funksjoner.
Be om injeksjoner
Ledetekstinntak er forsøk på å få LLM til å gjøre noe som ikke er utformet for. Hackere kan opprette ledetekster som forsøker å overstyre systempolicyene eller manipulere LLM til å gjøre noe utilsiktet.
Salesforce tilbyr hurtigbeskyttelsesmekanismer for å bidra til å redusere risikoen for skadelige angrep.
Deteksjon av ledetekstinnsetting sammen med systempolicyene gir en detaljert tilnærming til ledetekstbeskyttelse. Promptinnsettingsbeskyttelse brukes konsekvent på alle brukermeldinger, noe som øker sikkerheten i Agentforce og innebygde AI-programmer.
- Vi har innebygde systempolicyer for å bidra til å begrense hallusinasjoner og redusere sannsynligheten for utilsiktede eller skadelige utdata fra LLM.
- Deteksjon av ledetekstinnsetting brukes til å hjelpe til med å oppdage skadelige angrep som forsøker å manipulere LLM-ene til å gjøre noe de ikke var utformet for.
