Loading
Agentforce og Einstein Generative AI
Ledeteksjon av ledetekst (beta)

Ledeteksjon av ledetekst (beta)

Ledetekstinnsetting, noen ganger referert til som "jailbreak", er en stor språkmodell-sårbarhet (LLM). Ledetekstinntak er forsøk på å få LLM til å gjøre noe som ikke er utformet for. Hackere kan opprette ledetekster som forsøker å overstyre systempolicyene eller manipulere LLM til å gjøre noe utilsiktet.

Nødvendige utgaver

Tilgjengelig i Enterprise, Performance og Ubegrenset Edition med et Einstein for Sales, Einstein for Platform, Einstein for Service, Einstein 1 Service eller Einstein GPT Service-tillegg. Hvis du vil kjøpe tillegg, kontakter du din Salesforce-kundeansvarlige.

Ledetekstinntak kan settes inn direkte i ledeteksten eller indirekte via datakilder som er inkludert i ledeteksten.

Salesforce-modeller for deteksjon av ledetekstinnsetting gjenkjenner disse typene ledetekstinnsettingsangrep:

Type Beskrivelse
Lat som (rolle) Ledetekster som instruerer AI til å ta i bruk en annen systempersonlighet med skadelig hensikt, og bruke villedende eller villedende språk til å manipulere den i sosialtekniske angrep
Eskalering av rettigheter eller forsøk på å endre systemregler Ledetekster som har skadelige kommandoer for å omgå eller endre systemregler og omgå sikkerhetsopplæring for språkmodeller, inkludert angrep som bryter sikkerhetsrestriksjoner, som Do Anything Now (DAN)- jailbreak-angrep
Ledetekningshensikt Ledetekster utformet for å innhente sensitiv informasjon fra språkmodellen, som systempolicyer og Knowledge, for å få uautorisert informasjon
Koding av angrep Bruke forvirrede eller skjulte meldinger i ledetekster til å få en språkmodell til å produsere skadelig, ikke-justert eller giftig innhold
Personvernangrep ledetekster som forsøker å få personlig eller konfidensiell informasjon for å få uautorisert tilgang til data eller misbruke informasjonen
Generering av skadelig kode Ledetekster som forsøker å produsere skadelig datamaskinkode, som skadelig programvare, virus eller verktøy eller programvare utformet for å utføre svindel og annen skadelig hensikt.

Hvis en ledetekstinnsetting oppdages, rangeres innholdet og scoren logges i revisjonssporet og lagres i Data 360. Du kan vise ledetekstinnsettingsscore i Data 360-DMO-er.

Viktig
Viktig Selv om deteksjonsmodellene for hurtiginnsprøytning har vist seg å være effektive under interne tester, er det viktig å merke seg at ingen modell kan garantere 100 % nøyaktighet. Med Trust som vår prioritet er vi dedikert til den kontinuerlige evalueringen og forbedringen av modellene våre.
 
Laster
Salesforce Help | Article