Ledetekstinnsetting, noen ganger referert til som "jailbreak", er en stor språkmodell-sårbarhet (LLM). Ledetekstinntak er forsøk på å få LLM til å gjøre noe som ikke er utformet for. Hackere kan opprette ledetekster som forsøker å overstyre systempolicyene eller manipulere LLM til å gjøre noe utilsiktet.
Nødvendige utgaver
Tilgjengelig i Enterprise, Performance og Ubegrenset Edition med et Einstein for Sales, Einstein for Platform, Einstein for Service, Einstein 1 Service eller Einstein GPT Service-tillegg. Hvis du vil kjøpe tillegg, kontakter du din Salesforce-kundeansvarlige.
Ledetekstinntak kan settes inn direkte i ledeteksten eller indirekte via datakilder som er inkludert i ledeteksten.
Salesforce-modeller for deteksjon av ledetekstinnsetting gjenkjenner disse typene ledetekstinnsettingsangrep:
Type
Beskrivelse
Lat som (rolle)
Ledetekster som instruerer AI til å ta i bruk en annen systempersonlighet med skadelig hensikt, og bruke villedende eller villedende språk til å manipulere den i sosialtekniske angrep
Eskalering av rettigheter eller forsøk på å endre systemregler
Ledetekster som har skadelige kommandoer for å omgå eller endre systemregler og omgå sikkerhetsopplæring for språkmodeller, inkludert angrep som bryter sikkerhetsrestriksjoner, som Do Anything Now (DAN)- jailbreak-angrep
Ledetekningshensikt
Ledetekster utformet for å innhente sensitiv informasjon fra språkmodellen, som systempolicyer og Knowledge, for å få uautorisert informasjon
Koding av angrep
Bruke forvirrede eller skjulte meldinger i ledetekster til å få en språkmodell til å produsere skadelig, ikke-justert eller giftig innhold
Personvernangrep
ledetekster som forsøker å få personlig eller konfidensiell informasjon for å få uautorisert tilgang til data eller misbruke informasjonen
Generering av skadelig kode
Ledetekster som forsøker å produsere skadelig datamaskinkode, som skadelig programvare, virus eller verktøy eller programvare utformet for å utføre svindel og annen skadelig hensikt.
Hvis en ledetekstinnsetting oppdages, rangeres innholdet og scoren logges i revisjonssporet og lagres i Data 360. Du kan vise ledetekstinnsettingsscore i Data 360-DMO-er.
Viktig Selv om deteksjonsmodellene for hurtiginnsprøytning har vist seg å være effektive under interne tester, er det viktig å merke seg at ingen modell kan garantere 100 % nøyaktighet. Med Trust som vår prioritet er vi dedikert til den kontinuerlige evalueringen og forbedringen av modellene våre.
We use three kinds of cookies on our websites: required, functional, and advertising. You can choose whether functional and advertising cookies apply. Click on the different cookie categories to find out more about each category and to change the default settings.
Privacy Statement
Required Cookies
Always Active
Required cookies are necessary for basic website functionality. Some examples include: session cookies needed to transmit the website, authentication cookies, and security cookies.
Functional Cookies
Functional cookies enhance functions, performance, and services on the website. Some examples include: cookies used to analyze site traffic, cookies used for market research, and cookies used to display advertising that is not directed to a particular individual.
Advertising Cookies
Advertising cookies track activity across websites in order to understand a viewer’s interests, and direct them specific marketing. Some examples include: cookies used for remarketing, or interest-based advertising.